Skip to content
所有標籤

#prompt-engineering

21 篇文章

Prompt 版本控制:改一個字可能讓 eval 從 5/5 掉到 0/5

Looplane 的 prompt 已到 `m3-exact-edit-v4`:版本寫進 artifact,core/tool/interaction/runtime/instructions/skills/workspace/memory 以 stable/dynamic section 組裝,並加入 replace_text、unified diff、direct reply 的正反例。unit tests 已釘住結構,live eval 覆蓋仍需擴大。

ai guide Ask AI 實戰

Ask AI 怎麼把證據寫成答案:Writer Context 與 Citation Contract

Writer 預設只讀 factual query 的前 8 筆或 recommendation 的前 12 筆候選證據,引用必須使用候選集合中的 exact `source_url`;檢索為空或被判為 weak 時,prompt 要求拒絕用模型常識補答案。

Looplane 的 prompt、instruction precedence 與 explicit memory:模型最後看見了什麼

Looplane 先在應用程式層解析 user 與 root-to-leaf 專案 instructions,再把 runtime、skills、workspace 與最近 20 筆 explicit memory 放進具名 prompt sections。這套流程可追蹤、可 reload,但不是 semantic memory,也不會把 repo 文字升格成 system authority。

ai guide AI 證照備考

Claude Certified Architect Foundations 考試完整指南

Claude 官方架構師認證(CCAR-F)的完整備考指南:五大領域權重 27/18/20/20/15、六大考試情境抽四個、常見反模式與實際演練建議。官方規格為 60 題 / 120 分鐘 / $125 / 效期 12 個月 / 及格 720,報考限 Claude Partner Network 成員,準時續期免費且非監考。

ai guide AI 證照備考

Claude Certified Associate(CCAO-F)備考路徑:最重的一塊是「怎麼判斷 Claude 講錯了」

CCAO-F 是 Anthropic 四張裡最便宜的一張($99、60 題、120 分鐘),給的是「用 Claude 做事」而不是「寫程式串 Claude」的人。七個領域裡最重的是 Output Evaluation and Validation 21%——辨識幻覺、判斷何時需要人工複核、比較與改寫輸出;Governance, Risk, and Responsible Use 也有 15%。官方明講它不適合寫 API 或設計 agentic 系統的開發者。另有一條容易被忽略:這張不計入 Claude Partner Network 的 tier 資格,另外三張才算。

ai deep-dive AI 證照備考

prompt 與 context engineering 的考法:十張證照怎麼問,跟實務差在哪

多數人以為 GenAI 證照的主軸是 prompt 寫作,但 CCAO-F 的 Prompting 只有 14%,輸出評估卻有 21%;CCDV-F 的 Prompt and Context Engineering 只有 11%。真正被考的是結構化輸出、防禦性 prompt、動態 context 注入、context 壓縮與快取、prompt 生命週期治理,以及「prompt 改了怎麼證明變好」——這六件事比較接近 context engineering 與軟體工程,而不是寫作技巧。另外沒有任何一張要你現場寫 prompt,全是選擇題,所以練「說得出為什麼」比練手感有用。最該記住的一條來自 CCAR-F:業務邏輯必須被保證時,「先改 prompt」通常是錯誤選項。

CS146S Week 2:context 工程、RePPIT,與 MCP 的 98.7% 那一刀

Fall 2026 把整整一週的 prompting 壓成這週的一節,換上 RePPIT(Research、Propose、Plan、Implement、Test)與 MCP。RePPIT 的兩條硬規則最值得抄:propose 一定要兩個方案、寫 code 的那個 instance 不准 review 自己的 code。MCP 那邊 Anthropic 量到把工具改成程式碼呼叫可以把 150,000 tokens 壓到 2,000。

Agents, Prompts, and RAG:一堂課教完之後,剩下的才是難的

BCG 的實驗發現一條「鋸齒狀邊界」:邊界內 AI 大幅提升顧問表現,邊界外 AI 讓結果更差,而人們會在方向盤上睡著。這一講也給了一個很有立場的判斷——盡可能避開 fine-tuning,因為等你調完,下一代模型已經打敗你 fine-tune 過的版本了。

ai guide Stanford CS230 導讀

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。

ai deep-dive Agent 生產線

安全:prompt injection 只能在 harness 層做損害控制

2025-11 三大實驗室聯手把先前提出的 12 種 prompt injection 防禦全部攻破。EchoLeak 的 payload 通過了微軟自己的專用分類器。所以目標不是擋住每次攻擊,是攻擊成功時活下來——而這只能在 harness 做。

ai guide

2026 年該上哪些 AI 課程:從不懂 AI、vibe coding,到能上 production

把 OpenAI、Anthropic、Google 三家官方課程平台,加上 Stanford CS146S/CS336、Elements of AI、Hugging Face、MIT 6.S191、李宏毅等資源實際逐頁抓過一遍,按「不懂 AI / vibe coding / 讓它能上 production / 底層 AI」四層重排。另收 2026 年仍在更新的自學倉庫與免裝環境的互動式平台,並用「最後更新日期」篩掉星數很高但停在 2024 的名教材。結論:課幾乎全部免費,稀缺的不是課,是選課的判斷力;而第四層不會解決第三層的問題。

ai deep-dive

Loop Engineering:當 AI 不再需要你打 Prompt

Loop Engineering 是設計「自動 prompt agent 的系統」而非手動 prompt 的工程實踐。Boris Cherny 跑數百個 agent、Addy Osmani 正式命名、Blake Crosley 指出驗證成本才是真正瓶頸——這篇整理一手來源、五大構建塊、適用邊界與批評觀點。

ai deep-dive

別再手工調 prompt:從 GEPA 到 tool description,agent 行為的自動最佳化

自動 prompt 優化(APO)從 APE/OPRO 演進到 GEPA:用語言反思取代稀疏 reward,少 4–35 倍 rollouts 贏過 GRPO 約 6pp。另一邊,tool description 是被忽略的 prompt——小改措辭能讓工具選用率變 10 倍,Anthropic 實測讓 Claude 自我改寫 tool description 勝過人類專家手寫。兩條線正在合流:eval-driven 的自動優化吃掉手工調 prompt。

ai deep-dive

system_prompts_leaks 導讀:40k star 的 AI 系統提示 archive 在解什麼問題

asgeirtj/system_prompts_leaks 蒐集 40 多個 AI 助理的 system prompt 原文,從 GPT-5.5、Claude Opus 4.7 到 Gemini 3.1 Pro 都有,40.3k stars、461 commits、MIT 授權。價值不在於拿到秘密,而在於把廠商的隱性政策變成可比對的工程素材——要學的是設計決定,不是文字本身。

tech debug

LLM agent 的 tool description 決定它怎麼選 tool:三個踩坑修法

把 tool description 從軟建議改成硬規則(白名單 + 後果說明),LLM 亂選 tool 的問題消失了;另外加 skip_signal=True 修掉 vector store 雙重 indexing。

ai deep-dive

Claude Skills:把專業知識打包成資料夾,教一次就一直記得

Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。

ai guide

AI Agent 的 Tool 描述不該是靜態的:從 Claude Code 學到的動態 prompt() 設計

Claude Code 的 45 個 tool 中,每個 prompt() 都會根據使用者類型、feature flags、系統能力動態調整。將這個模式套用到 ReAct Agent,根據 orchestrator 模型能力、locale、可用 tools 三個維度動態生成 tool description,小模型自動補 few-shot,大模型省 token。

ai guide AI Agent 實戰

從 Prompt 到 Harness:AI 工程的三次演化

AI 工程經歷三個階段:Prompt Engineering(寫好指令)→ Context Engineering(餵對資訊)→ Harness Engineering(設計整個工作環境)。每一次演化不是取代前者,而是在更高的抽象層級上操作。

ai guide AI Agent 實戰

Context Engineering:為什麼你的 AI Agent 問題出在資訊,不在模型

Context Engineering 是 2025 年取代 Prompt Engineering 的核心概念:重點不再是「怎麼問」,而是「給什麼資訊」。把對的資訊在對的時機送進 context window,比換更強的模型更有效。這篇整理了定義、四大策略、實作技巧和常見失敗模式。

ai guide

Prompt Engineering 實戰:迭代方法論、常見錯誤與 Few-shot 最佳化

好的 Prompt 不是一次寫出來的,而是迭代出來的。從最簡單的 prompt 開始,用真實 case 測試,分類錯誤類型,針對性修改。本文涵蓋 System Prompt 三段式結構、推理框架選擇、Few-shot 最佳化、Token 預算管理和六個常見錯誤。

ai guide RAG 技法大全

RAG Prompt Engineering:System Prompt 和 Context 怎麼設計

搜尋找到了正確的文件,但 LLM 的回答還是不好——很多時候問題在 Prompt 設計。System prompt 結構、context 排版、指令語言都會影響輸出品質。