AI SYNTHESIS / MAY CONTAIN ERRORS

1. 結論先行:Opus 5 是新的日常主力,不是 Fable 5 的縮水複製品

Anthropic 在 2026 年 7 月 24 日推出 Claude Opus 5,官方定位是以 Opus 4.8 的價格,提供接近 Fable 5 的能力。這個定位大致合理,但真正值得關注的不是「差多少分」,而是 Anthropic 把高階代理能力拆成可調 effort、快取、工具配置、fallback 與 Fast mode,讓模型選擇從一次性的品牌決策,變成每個工作流都能控制的執行策略。

對多數軟體工程、研究、文件與企業代理工作,Opus 5 應先成為 Anthropic 生態系內的預設候選;只有當任務是數天長、極高自主、開放式且失敗成本可控時,才優先比較 Fable 5。

這不代表發布會圖表已證明 Opus 5 在所有真實環境都更划算。官方最亮眼的 Frontier-Bench 結果來自 Anthropic 內部執行,且在安全分類器拒絕時使用 Opus 4.8 fallback;截至 2026 年 7 月 25 日,獨立評測雖已顯示它位於第一梯隊,但跨供應商、長期穩定性與真實維運成本仍需更多資料。

  • 適合先試:跨檔案開發、root-cause analysis、程式碼審查、研究與文件代理、長 context 的企業工作流。
  • 不該直接下結論:一個 benchmark 冠軍等於所有 repo、所有語言、所有代理框架都更好。
  • 採用重點:找出每類任務的最低可接受 effort,而不是讓所有請求固定跑 max。

2. 官方規格:同價升級之外,最重要的是控制面變完整

Opus 5 的 API model ID 是 claude-opus-5,預設與最大 context 都是 1M tokens,單次最大輸出 128k tokens,thinking 預設開啟。標準價格為每百萬 input tokens 5 美元、output tokens 25 美元,與 Opus 4.8 相同;Fable 5 則是 10/50 美元。Fast mode 約為標準速度的 2.5 倍,價格也變成 10/50 美元。

effort 提供 low、medium、high、xhigh、max 五級,預設是 high。Anthropic 明確建議從 high 開始,以自己的 eval 向下尋找品質仍能維持的低成本設定,或只在最困難工作升到 xhigh/max。

Opus 5 的最低可快取 prompt 長度降到 512 tokens,Opus 4.8 是 1,024 tokens。這對短而穩定的 system prompt、工具定義與任務規範有實際意義,但快取是否省錢仍取決於重用頻率、寫入成本與 TTL。

Anthropic 高階模型的官方定位

FIGURE 01 / MATRIX
Anthropic 高階模型的官方定位
項目標準 API 價格主要控制與規格較合理的使用位置
Opus 4.8Input 5/Output 25 美元/MTok舊一代 Opus;thinking 非預設既有相容性或 fallback 基線
Opus 5Input 5/Output 25 美元/MTok1M context、128k output、thinking 預設、五級 effort複雜代理程式開發與企業工作的日常主力
Fable 5Input 10/Output 50 美元/MTokAnthropic 廣泛發布模型中的最高能力層數天長、極高自主與最高難度任務
價格與規格取自 Anthropic 官方文件;「適合情境」是依官方定位整理,不代表每個工作流的實測結果。

3. Benchmark 怎麼讀:先看測試主體,再看分數

Anthropic 宣稱 Opus 5 在 Frontier-Bench、GDPval-AA、ARC-AGI 3、AutomationBench、OSWorld 2.0 等多項評測取得領先或很高的成本效益。這些結果值得重視,卻不能全部視為同一等級的外部證據。

官方公告指出,Opus 5 在 Frontier-Bench v0.1 超過其他模型,且以較低每任務成本取得超過 Opus 4.8 兩倍的表現;在 CursorBench 3.2 的 max effort,距 Fable 5 峰值分數 0.5%。官方也宣稱 ARC-AGI 3 是下一名的三倍、AutomationBench 在相同成本約為下一名的 1.5 倍,OSWorld 2.0 則以約 Fable 5 三分之一成本超過其最佳成績。

但 Frontier-Bench 的註腳同時說明,這是 Anthropic 以 mini-SWE-agent 與 GKE backend 執行的內部測試,每題取五次平均,安全分類器拒絕時以 Opus 4.8 fallback。這不是造假,而是提醒讀者:harness、重試、fallback、工具權限與成本計算方式都會改變結果。

公告中的 Box、Cursor、Devin、Zapier 等數字屬於早期客戶或合作夥伴內部評測。它們能指出可能的高價值場景,卻不是隨機對照、跨組織可直接複製的證明。

四種證據層級不能混在同一欄

FIGURE 02 / MATRIX
四種證據層級不能混在同一欄
項目能告訴你的事主要限制正確用法
Anthropic 官方 benchmark模型在指定 harness 與 effort 下的能力上限供應商選題、設定與成本口徑閱讀註腳並重跑相關任務
獨立評測平台跨模型、固定方法下的相對位置仍受 benchmark 組合與提示設定影響比較相同 effort 與相同版本
早期客戶內部 eval特定產品與資料的實務訊號樣本、基線與失敗案例通常不完整當成場景假設,不直接外推 ROI
自己的 production eval真正的成功率、返工、延遲與成本建置較慢,需保存失敗樣本作為採購、路由與升級的最終依據
本表不是替來源打絕對分數,而是說明不同資料能回答的問題與不能回答的問題。

4. 獨立評測的訊號:能力確實高,但 max 並不便宜也不快

Artificial Analysis 在發布後的評測把 Opus 5 high effort 列為 Intelligence Index 59、輸出速度約 58 tokens/秒;max effort 則是 61、約 52.3 tokens/秒。max 版本在該平台完成整套 Intelligence Index 的估算成本為 3,835.51 美元,time to first token 為 62.68 秒。

這組資料支持兩件事。第一,Opus 5 的確屬於當前第一梯隊,不只是官方自述。第二,從 high 升到 max 的能力增量,伴隨更高推理 token、較長首 token 等待與更高整體測試成本;在互動式產品或大量代理任務裡,這些差異可能比兩個指數點更重要。

不能把 Artificial Analysis 的 59 或 61 和 Anthropic 圖表上的任一分數直接相減。兩者的 benchmark 組合、prompt、工具、重試與 effort 設定不同;可靠的用途是觀察同一評測體系下的相對位置與成本曲線。

  • max 適合能力瓶頸,而不是所有請求的預設值。
  • 互動產品應同時量 TTFT、完整回應時間與使用者中止率,不能只量 output tokens/second。
  • 代理工作流應用 cost per accepted task,而不是單純 cost per token。

5. 成本模型:同樣 5/25 美元,不等於同樣工作流成本

Opus 5 與 Opus 4.8 的牌價相同,但 thinking 預設開啟、文件可能更長、會更主動驗證,也較容易叫出 subagent。實際成本因此取決於未快取 input、快取寫入、快取命中、thinking 與答案 output、工具回合、subagent 數、重試、fallback,以及人工修正時間。

以標準模式為例,若單次工作使用 180k 未快取 input、600k cache hit 與 18k output,token 費約為 1.65 美元;若另有 120k 的 5 分鐘快取寫入,第一次執行再增加 0.75 美元。這只是帳單層,不含代理工具、雲端執行、外部 API 與人工 review。

1M context 是容量上限,不是免費記憶,也不是把整個 repo、所有 log 與所有歷史對話全部塞入的理由。更多 context 可能提高 input 費、首 token 延遲與注意力競爭;應以 retrieval、摘要、artifact 與快取,把每一步真正需要的資訊放進去。

6. 對 Agent 架構的真正影響:模型路由要升級成控制平面

Opus 5 的 effort、thinking、動態工具與 server-side fallback 讓代理平台不再只是傳入一個 model ID。生產系統需要針對任務風險、難度、互動性與預算,決定 effort、max_tokens、工具集合、是否允許 fallback,以及失敗時如何升級。

mid-conversation tool changes 可以先宣告完整工具集,再在對話中加入或移除工具,而不改動被 hash 的 tools prefix,因此能保留 prompt cache。這對長 session、權限逐步提升與階段式 agent 很有價值,但功能仍是 beta,應加入版本旗標與回退路徑。

automatic fallback 會讓被安全分類器攔截的 Opus 5 請求改由其他模型回應。可用性提高了,但若系統沒有記錄 requested_model、served_model、fallback_reason 與 usage,就可能把模型切換造成的行為差異誤認成隨機波動。

Opus 5 工作流的建議路由

FIGURE 03 / FLOW
任務分類

判斷可回放性、風險、時效與失敗成本

低成本起跑

可回放的例行任務先用 low/medium

標準複雜任務

跨檔案或多步工作以 high 為基準

能力瓶頸升級

只有驗證顯示需要時才升 xhigh/max 或 Fable

執行與觀測

記錄 served model、effort、token、tool、fallback 與延遲

驗收與回寫

以 accepted task、返工與缺陷更新路由規則

流程是 AI 生成的導入建議;實際門檻需由自己的 eval、SLO 與風險政策決定。

7. 從 Opus 4.8 遷移:不要只改 model ID

Anthropic 表示既有 Opus 4.8 prompt 多半可直接工作,但 API 與行為有幾個會影響代理穩定性的差異:thinking 改為預設開啟、max_tokens 同時限制 thinking 與可見答案、xhigh/max 不能關閉 thinking;若在允許的 effort 關閉 thinking,偶爾可能把工具呼叫或內部 XML 標記輸出成文字。

Prompting guide 也警告,Opus 5 會自行驗證、較容易擴張範圍與啟動 subagent。舊 harness 若仍強制「再檢查一次」「叫另一個 agent 驗證」,可能造成重複驗證、額外 token 與延遲,卻沒有品質提升。

可見回答與寫入磁碟的文件通常比前代長。effort 控制的是思考深度,不保證可見輸出變短;若產品需要短回答或固定文件長度,必須直接寫出篇幅與停止條件。

8. 安全與可用性的取捨:攔截變少,但模型漂移要能看見

Anthropic 的官方自動行為稽核把 Opus 5 的整體 misaligned behavior 分數列為 2.3,並宣稱是近期模型最低。官方也表示 Opus 5 沒有推進高風險雙用途能力前沿:找漏洞的能力接近 Mythos 5,但把漏洞發展成 exploit 的能力明顯落後。

Opus 5 的 cyber classifiers 允許從原始碼尋找漏洞,但阻擋 binary-based vulnerability scanning、penetration testing 與 exploit generation。Anthropic 預估分類器介入次數比 Fable 5 少約 85%;Claude.ai、Claude Code 與 Claude Cowork 的被標記請求預設 fallback 到 Opus 4.8,API 也可啟用 fallback。

這代表安全分類器不再只是「成功或拒絕」的邊界,而是路由的一部分。對需要稽核的企業系統,HTTP 200 不足以判斷實際發生什麼;應保存 stop_reason、served model、fallback 類型、工具操作與最終採用結果。

  • 較少攔截不等於沒有安全政策,也不等於每種資安工作都允許。
  • fallback 提升任務完成率,但可能改變推理風格、能力與成本。
  • 安全數字來自 Anthropic 測試;高風險用途仍應查閱最新 System Card、政策與合約條款。

9. 選型建議:先用 Opus 5 找操作點,再決定是否升 Fable

合理的選型不是「哪個模型最強」,而是「在可接受品質下,哪個設定使每個被採用結果的總成本最低」。對可回放、可驗收的任務,可由 low/medium 起跑;對跨檔案與深度分析,high 是較好的基準;xhigh/max 應留給能力瓶頸,Fast mode 留給延遲價值高且願意支付兩倍 token 價格的情境。

依任務條件選擇設定

FIGURE 04 / MATRIX
依任務條件選擇設定
項目優先情境主要風險必要驗收
Opus 5 low/medium例行審查、分類、可回放的小型修改少數高難案例可能品質不足錯誤率與升級率低於門檻
Opus 5 high跨檔案功能、複雜除錯、企業知識工作token 與延遲高於低 effortaccepted task、返工與缺陷優於既有基線
Opus 5 xhigh/max深度 root-cause、困難重構、能力已成瓶頸TTFT、輸出量與成本上升增量品質足以覆蓋額外成本
Opus 5 Fast高價值互動流程、延遲直接影響轉換或作業input/output 價格為標準模式兩倍節省時間的價值高於新增費用
Fable 5數天長、高自主、最困難的開放式工作標準 token 價格約為 Opus 5 兩倍Opus 5 在相同任務確實無法達標
這是 AI 依官方控制項與獨立評測產生的起始矩陣,不是 Anthropic 官方保證;應以自己的 eval 覆寫。

10. 兩週導入法:用固定任務與停止條件取代發布日直覺

正式遷移前,建立 20 至 50 個可回放任務,涵蓋容易、典型、困難與安全邊界案例。固定程式碼版本、資料、工具權限、prompt 與驗收規則,依序比較 Opus 4.8、Opus 5 low/medium/high,只有在 high 仍未達標時才測 xhigh/max 或 Fable 5。

第一週建立離線基線:成功率、嚴重缺陷、false positive、工具失敗、完整延遲、token、費用與人工返工。第二週做小流量 shadow 或 canary,加入 fallback、timeout、rate limit、快取與真實使用者中止行為。

停止條件應事先寫好。例如嚴重缺陷高於基線、served model 無法追蹤、p95 延遲超過 SLO、單一 accepted task 成本超出預算,或 fallback 後結果無法重現,就停止擴量。

兩週可回滾的導入節奏

FIGURE 05 / FLOW
建立任務集

20–50 個可回放案例與明確 rubric

離線 effort sweep

固定版本與工具,比較 4.8、low、medium、high

人工盲測

檢查嚴重缺陷、可理解性與返工

Shadow/Canary

加入真實延遲、快取、fallback 與限流

門檻決策

以 cost per accepted task 與 SLO 決定路由

持續回歸

模型、prompt、工具或政策變更即重跑

每一階段都設停止條件;沒有證據支持時不自動擴量。

11. 仍待觀察:發布日資料不能回答長期維運問題

截至 2026 年 7 月 25 日,Opus 5 已有完整官方文件、合作夥伴內部 eval 與初步獨立評測,但仍缺少跨數週、跨版本、跨代理框架的大規模 production 資料。尤其是長 session 的穩定性、fallback 後的行為一致性、不同 effort 的缺陷型態,以及主動驗證與 subagent 對總成本的影響,仍需持續追蹤。

因此本文的「日常代理主力」是有條件的 AI 推論:它依目前價格、規格、官方定位與獨立評測成立,但不等於所有組織現在就應全面切換。

最值得追蹤的不是下一張 leaderboard,而是三項可否被重現:在自己的典型任務中,low/medium 是否保留足夠品質;high 是否降低人工返工;xhigh/max 或 Fable 的額外成本是否真的換到可採用的增量結果。

  • 觀察獨立 benchmark 是否在相同模型版本與 effort 下穩定重現。
  • 觀察 API、Bedrock、Google Cloud、Microsoft Foundry 的功能與延遲是否一致。
  • 觀察 beta 的 dynamic tools 與 fallback 在升級後是否改變 schema、計費或可觀測欄位。