AI SYNTHESIS / MAY CONTAIN ERRORS

一次成功,為什麼還不足以證明 Skill 可用?

Skill 的輸出會同時受到模型版本、上下文長度、工具回應、檔案狀態與使用者措辭影響。昨天成功的案例,只覆蓋當時的一組條件。

工程團隊很容易挑一個熟悉題目試跑,看到結果可讀便宣告完成。正式使用後,近似題目可能沒有觸發 Skill,無關題目又可能誤觸發;工具呼叫順序也可能改變,導致成本、權限或資料風險升高。

最小心智模型是:固定案例,分別執行有 Skill 與基線,按多層條件評分,比較差異與變異,再把失敗案例回收到下一輪測試。Eval 讓版本變動從感覺轉成可比較紀錄。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實核心主張直接支持信心:

    Anthropic 將 Skills 定義為可動態載入的指令、腳本與資源集合,用於讓代理在特定任務上形成可重複的工作方式。

    信心理由:Anthropic 官方 Skills 儲存庫直接說明用途與結構。
  2. AI 推論核心主張多方驗證信心:

    Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。

    信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。

Skill Eval 的最小閉環

FIGURE 01 / FLOW
固定案例

正例、反例與邊界條件

雙軌執行

有 Skill 與基線同步執行

分層評分

觸發、路徑、成果、成本

版本比較

平均、變異與失敗類型

失敗回收

加入下一輪回歸資料集

Skill 修改後重跑相同資料,才能判斷能力是否真正改善。

Skill Eval 應該測哪五層?

只看最終文章或程式碼,容易漏掉誤觸發、錯誤路徑與成本退化。一套完整 Skill Eval 至少覆蓋五層。

Trigger 檢查正例與近似反例;Behavior 檢查工具、順序、參數與越權行為;Outcome 檢查任務是否完成;Non-functional 檢查 token、延遲、穩定性與安全;Regression 比較新舊 Skill、模型或工具版本。

LangChain 的 trajectory 評測可檢查嚴格順序、任意順序、必要工具集合與多餘工具。Anthropic Skill Creator 進一步要求有 Skill 與基線版本同時執行,避免把模型原有能力誤算成 Skill 貢獻。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實核心主張直接支持信心:

    Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。

    信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。
  2. 來源事實核心主張直接支持信心:

    LangChain 將代理評測分成最終回覆、單一步驟與完整 trajectory;trajectory 可用嚴格順序、任意順序、子集合、超集合或模型評分檢查工具路徑。

    信心理由:LangChain 官方文件提供分類與 trajectory match 模式。
  3. AI 推論核心主張多方驗證信心:

    Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。

    信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。

Skill Eval 五層模型

FIGURE 02 / MATRIX
Skill Eval 五層模型
項目核心問題常用指標典型失敗
觸發該載入時有載入嗎precision、recall、誤觸發率漏載或錯載 Skill
行為執行路徑合理嗎工具與參數命中率、步數多餘工具、危險參數
成果任務真的完成嗎斷言通過率、品質分數內容可讀但要求漏做
非功能代價與風險可接受嗎token、時間、變異、安全事件成本增加或穩定性下降
回歸新版有更好嗎新舊差值、失敗案例數修好一類、破壞另一類
每一層回答不同問題,單一總分容易隱藏失敗位置。

去 AI 味 Skill 要怎麼做基準對照?

用十篇不同類型草稿,同步執行舊版 Skill、新版 Skill 與無 Skill 基線,每個案例重跑三次。

程式檢查禁用句型、來源欄位、長度與 Markdown 結構;模型評分可讀性、資訊密度、自然度與內容保真;人工盲評隱藏版本名稱,比較哪一篇更像專業人類作者。

平均分數呈現中央趨勢,標準差與失敗分布揭露不穩定案例。新版只有在硬性條件全數通過,且品質、成本與穩定性整體優於基線時才應取代舊版。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實核心主張直接支持信心:

    Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。

    信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。
  2. 來源事實輔助主張直接支持信心:

    NIST 強調 AI 評測需要依使用情境選擇準確性、可靠性、韌性、安全、隱私與透明度等量測組合。

    信心理由:NIST TEVV 官方頁面列出多類量測特性並強調情境重要性。

如何把最小可用 Eval 接進 CI?

第一版不需要大型平台。選一個高頻 Skill,以真實工作樣本建立小型資料集,已足以開始發現回歸。

先收集五個應觸發案例與三個近似反例。每個案例寫出三到五條可驗證斷言,將格式、安全與必要步驟交給程式評分,將品質條件交給模型評分。首次結果保存成 baseline。

每次修改 SKILL.md、description、參考檔、模型或工具後,在 CI 重跑資料集。正式環境的新型失敗經去識別後回收成測試案例,形成離線測試與線上監控閉環。

  • 建立 evals.json,保存 prompt、預期成果與斷言。
  • 保存 Skill hash、模型、工具版本與執行時間。
  • 同步跑 with-skill 與 baseline,避免單看絕對分數。
  • 每個案例重跑多次,記錄平均、變異與失敗類型。
  • 設定發布門檻,硬性斷言全數通過,品質不得顯著低於基線。
  • 把正式環境失敗 trace 回收進回歸資料集。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. AI 建議核心主張多方驗證信心:

    小型團隊可從五個正向案例、三個近似反例、每案三次重跑與一份基線報告開始,先覆蓋高風險條件,再逐步擴大資料集。

    信心理由:案例數與重跑次數屬實務起點,應依風險、成本與變異調整。

AI 餿水實驗室應該先建立哪些 Eval?

內容網站的 Skill 同時負責研究、寫作、隱私、圖片與發布。單篇文章通過人工閱讀,仍可能漏掉來源契約、免責聲明、禁用句型或發布欄位。

先建立四組 Eval:研究 Skill 檢查來源權威性與 claim 對應;閱讀架構 Skill 檢查敘事主線與段落密度;去 AI 味 Skill 做盲評與禁用句型檢查;發布 Skill 驗證 schema、圖片、SEO 欄位與建置結果。

這些 Eval 共用文章樣本,同時保留各 Skill 的局部評分。整條發布流程再加一層端到端測試,確認多個 Skill 串接後沒有互相抵銷。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. AI 推論核心主張多方驗證信心:

    Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。

    信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。
  2. AI 建議核心主張多方驗證信心:

    小型團隊可從五個正向案例、三個近似反例、每案三次重跑與一份基線報告開始,先覆蓋高風險條件,再逐步擴大資料集。

    信心理由:案例數與重跑次數屬實務起點,應依風險、成本與變異調整。

讀完後,你能重建這套評測機制嗎?

成熟 Skill 必須說得清楚適用輸入、執行路徑、成功條件、成本風險與版本退化訊號。以下五題可作為閱讀與設計驗收。

實作驗收規則很直接:每次版本變更都重跑相同資料集;硬性斷言必須全數通過;開放式品質需維持或超越基線;成本、延遲與變異不得出現未解釋的顯著惡化。

Eval 最終保護的是修改 Skill 的自由。團隊能快速嘗試更精簡的指令、替換模型、調整工具與拆分流程,同時以固定證據判斷是否值得發布。

  • 當正例未載入 Skill 時,你會用哪個 Trigger 指標定位問題?
  • 最終答案合格時,哪些 trajectory 錯誤仍可能帶來權限或成本風險?
  • 無 Skill 基線與舊版 Skill 基線分別適用於哪種變更?
  • 格式、安全、自然度與專業判斷應分別交給哪類 grader?
  • 正式環境出現新型失敗後,如何去識別並回收到回歸資料集?
CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實核心主張直接支持信心:

    Anthropic 的 Skill Creator 流程要求建立真實測試提示,同時執行有 Skill 與基線版本,記錄 token、時間、斷言分數與變異,再依結果迭代 Skill。

    信心理由:官方 Skill Creator 文件直接列出基準對照、評分、聚合與迭代步驟。
  2. AI 推論核心主張多方驗證信心:

    Skill Eval 可整理為觸發、行為、成果、非功能與回歸五層;五層分別回答是否載入、如何執行、是否完成、代價多高與新版是否退化。

    信心理由:五層模型由 Anthropic、LangChain、OpenAI 與獨立的 NIST 評測觀點交叉整理,分層名稱屬本文綜合。