一次成功,為什麼還不足以證明 Skill 可用?
Skill 的輸出會同時受到模型版本、上下文長度、工具回應、檔案狀態與使用者措辭影響。昨天成功的案例,只覆蓋當時的一組條件。
工程團隊很容易挑一個熟悉題目試跑,看到結果可讀便宣告完成。正式使用後,近似題目可能沒有觸發 Skill,無關題目又可能誤觸發;工具呼叫順序也可能改變,導致成本、權限或資料風險升高。
最小心智模型是:固定案例,分別執行有 Skill 與基線,按多層條件評分,比較差異與變異,再把失敗案例回收到下一輪測試。Eval 讓版本變動從感覺轉成可比較紀錄。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實核心主張直接支持信心:高
Anthropic 將 Skills 定義為可動態載入的指令、腳本與資源集合,用於讓代理在特定任務上形成可重複的工作方式。
信心理由:Anthropic 官方 Skills 儲存庫直接說明用途與結構。 - AI 推論核心主張多方驗證信心:中
Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。
信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。
Skill Eval 的最小閉環
FIGURE 01 / FLOW正例、反例與邊界條件
有 Skill 與基線同步執行
觸發、路徑、成果、成本
平均、變異與失敗類型
加入下一輪回歸資料集
Skill Eval 應該測哪五層?
只看最終文章或程式碼,容易漏掉誤觸發、錯誤路徑與成本退化。一套完整 Skill Eval 至少覆蓋五層。
Trigger 檢查正例與近似反例;Behavior 檢查工具、順序、參數與越權行為;Outcome 檢查任務是否完成;Non-functional 檢查 token、延遲、穩定性與安全;Regression 比較新舊 Skill、模型或工具版本。
LangChain 的 trajectory 評測可檢查嚴格順序、任意順序、必要工具集合與多餘工具。Anthropic Skill Creator 進一步要求有 Skill 與基線版本同時執行,避免把模型原有能力誤算成 Skill 貢獻。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實核心主張直接支持信心:高
Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。
信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。 - 來源事實核心主張直接支持信心:高
LangChain 將代理評測分成最終回覆、單一步驟與完整 trajectory;trajectory 可用嚴格順序、任意順序、子集合、超集合或模型評分檢查工具路徑。
信心理由:LangChain 官方文件提供分類與 trajectory match 模式。 - AI 推論核心主張多方驗證信心:中
Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。
信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。
Skill Eval 五層模型
FIGURE 02 / MATRIX| 項目 | 核心問題 | 常用指標 | 典型失敗 |
|---|---|---|---|
| 觸發 | 該載入時有載入嗎 | precision、recall、誤觸發率 | 漏載或錯載 Skill |
| 行為 | 執行路徑合理嗎 | 工具與參數命中率、步數 | 多餘工具、危險參數 |
| 成果 | 任務真的完成嗎 | 斷言通過率、品質分數 | 內容可讀但要求漏做 |
| 非功能 | 代價與風險可接受嗎 | token、時間、變異、安全事件 | 成本增加或穩定性下降 |
| 回歸 | 新版有更好嗎 | 新舊差值、失敗案例數 | 修好一類、破壞另一類 |
去 AI 味 Skill 要怎麼做基準對照?
用十篇不同類型草稿,同步執行舊版 Skill、新版 Skill 與無 Skill 基線,每個案例重跑三次。
程式檢查禁用句型、來源欄位、長度與 Markdown 結構;模型評分可讀性、資訊密度、自然度與內容保真;人工盲評隱藏版本名稱,比較哪一篇更像專業人類作者。
平均分數呈現中央趨勢,標準差與失敗分布揭露不穩定案例。新版只有在硬性條件全數通過,且品質、成本與穩定性整體優於基線時才應取代舊版。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實核心主張直接支持信心:高
Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。
信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。 - 來源事實輔助主張直接支持信心:高
NIST 強調 AI 評測需要依使用情境選擇準確性、可靠性、韌性、安全、隱私與透明度等量測組合。
信心理由:NIST TEVV 官方頁面列出多類量測特性並強調情境重要性。
如何把最小可用 Eval 接進 CI?
第一版不需要大型平台。選一個高頻 Skill,以真實工作樣本建立小型資料集,已足以開始發現回歸。
先收集五個應觸發案例與三個近似反例。每個案例寫出三到五條可驗證斷言,將格式、安全與必要步驟交給程式評分,將品質條件交給模型評分。首次結果保存成 baseline。
每次修改 SKILL.md、description、參考檔、模型或工具後,在 CI 重跑資料集。正式環境的新型失敗經去識別後回收成測試案例,形成離線測試與線上監控閉環。
- 建立 evals.json,保存 prompt、預期成果與斷言。
- 保存 Skill hash、模型、工具版本與執行時間。
- 同步跑 with-skill 與 baseline,避免單看絕對分數。
- 每個案例重跑多次,記錄平均、變異與失敗類型。
- 設定發布門檻,硬性斷言全數通過,品質不得顯著低於基線。
- 把正式環境失敗 trace 回收進回歸資料集。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- AI 建議核心主張多方驗證信心:中
小型團隊可從五個正向案例、三個近似反例、每案三次重跑與一份基線報告開始,先覆蓋高風險條件,再逐步擴大資料集。
信心理由:案例數與重跑次數屬實務起點,應依風險、成本與變異調整。
AI 餿水實驗室應該先建立哪些 Eval?
內容網站的 Skill 同時負責研究、寫作、隱私、圖片與發布。單篇文章通過人工閱讀,仍可能漏掉來源契約、免責聲明、禁用句型或發布欄位。
先建立四組 Eval:研究 Skill 檢查來源權威性與 claim 對應;閱讀架構 Skill 檢查敘事主線與段落密度;去 AI 味 Skill 做盲評與禁用句型檢查;發布 Skill 驗證 schema、圖片、SEO 欄位與建置結果。
這些 Eval 共用文章樣本,同時保留各 Skill 的局部評分。整條發布流程再加一層端到端測試,確認多個 Skill 串接後沒有互相抵銷。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- AI 推論核心主張多方驗證信心:中
Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。
信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。 - AI 建議核心主張多方驗證信心:中
小型團隊可從五個正向案例、三個近似反例、每案三次重跑與一份基線報告開始,先覆蓋高風險條件,再逐步擴大資料集。
信心理由:案例數與重跑次數屬實務起點,應依風險、成本與變異調整。
讀完後,你能重建這套評測機制嗎?
成熟 Skill 必須說得清楚適用輸入、執行路徑、成功條件、成本風險與版本退化訊號。以下五題可作為閱讀與設計驗收。
實作驗收規則很直接:每次版本變更都重跑相同資料集;硬性斷言必須全數通過;開放式品質需維持或超越基線;成本、延遲與變異不得出現未解釋的顯著惡化。
Eval 最終保護的是修改 Skill 的自由。團隊能快速嘗試更精簡的指令、替換模型、調整工具與拆分流程,同時以固定證據判斷是否值得發布。
- 當正例未載入 Skill 時,你會用哪個 Trigger 指標定位問題?
- 最終答案合格時,哪些 trajectory 錯誤仍可能帶來權限或成本風險?
- 無 Skill 基線與舊版 Skill 基線分別適用於哪種變更?
- 格式、安全、自然度與專業判斷應分別交給哪類 grader?
- 正式環境出現新型失敗後,如何去識別並回收到回歸資料集?
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實核心主張直接支持信心:高
Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。
信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。 - AI 推論核心主張多方驗證信心:中
Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。
信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。