回想一下你以前是怎麼把工作交給 Opus 4.8 的。

多數人的做法都差不多:先把大任務手動切成七八個小包,一次餵一包,跑完看一眼、確認沒歪掉,再餵下一包。理由不是不信任它,是經驗告訴你,鏈條拉太長會出事——它會在第五步的時候忘記第二步的決定,或是在某個工具回傳空值的地方原地打轉。

所以你養成了一套習慣:切得夠碎、盯得夠緊、貴的模型只用在關鍵幾步。

Claude Opus 5 在 7 月 24 日上線了,價錢跟 Opus 4.8 完全一樣,每百萬 input token 五美元、output 二十五美元。帳單沒變,所以很容易以為這只是一次例行升級。但如果你繼續用舊習慣去用它,會浪費掉這次升級最值錢的部分。(來源:Anthropic

以前:一次交一小段。現在:一次交一條鏈

官方在 Frontier-Bench v0.1 上的說法是,Opus 5 超越所有其他模型,而且以更低的每任務成本,做到 Opus 4.8 兩倍以上的表現。

「每任務成本更低」這六個字比 benchmark 分數重要。單價沒降,但完成同一件事花的總 token 變少了,因為它繞路繞得比較少、重試比較少。

這個差別在長任務上才看得出來。短問答不管用哪一代都一樣,你問一個語法它答一個語法。但當任務變成「把這個模組的錯誤處理統一改掉,跑測試,failed 的自己修到綠」,以前你得拆成三次對話,現在可以一次講完。Zapier 的 AutomationBench 是專測這種多步驟自動化的,Opus 5 的通過率是次佳模型的 1.5 倍。

實務上的調整很直接:把你原本切成五段的 prompt 併回一段,然後把驗收條件寫清楚。你要練的不是描述步驟,是描述「怎樣算做完」。

以前:它卡住就回來問你。現在:它自己想辦法量

官方發布裡有個例子我覺得比所有數字都好懂。

任務是要看一張機械零件圖,但直接檢視圖檔這條路走不通。以前的模型會怎麼做?告訴你「我無法讀取這個檔案,請提供其他格式」,然後停在那裡等你。Opus 5 的做法是自己寫了一套電腦視覺 pipeline,用那套 pipeline 去解析,然後反覆重建出完整的 3D 模型。

打個比方。你請水電師傅來修管線,他發現手上的量尺不夠長。一種師傅會打電話跟你說量尺不夠長、你去買一把再叫我;另一種會拿現場的材料自己接一把出來,量完繼續做。第二種師傅的價值不在他懂的東西比較多,在於他不會因為缺一個小工具就整個停下來。

這正是長任務會不會斷掉的關鍵。一條十步的鏈,只要有一步卡住需要人介入,自動化就破功了。

以前:工具清單開場就得定死。現在:中途換不炸 cache

這是跟 Opus 5 一起推出的兩個 beta 功能之一,做開發的人應該最有感。

以前的規矩是這樣:prompt cache 是靠前綴一致來命中的,工具定義又排在很前面,所以你只要在對話中途動了工具清單,整個 cache 就失效,後面每一輪都得重新付全額的 input token。結果就是大家習慣一開場把所有可能用到的工具全部掛上去,寧可讓模型在三十個工具裡挑,也不敢中途調整。

現在支援對話中途變更工具而不讓 cache 失效。這件事解鎖的是動態工具集:一開始只給它讀取類的工具,確認方向對了再把寫入、部署那些危險的掛上去。權限收得更緊,成本反而更低。

如果你在寫自己的 agent harness,這條會直接影響你的架構選擇。我在迴圈工程那篇提過外層 loop 該怎麼設計,工具集能動態調整之後,「階段性授權」從一個要繞路實作的東西,變成內建就支援。

以前:被擋下來就整個失敗。現在:自動換一台跑

第二個 beta 是自動 fallback,被 flag 的請求會自動路由到替代模型。

這跟之前寫過的 Fallback Models 是不同的東西,別搞混。那個處理的是「主模型過載」,這個處理的是「這則請求被判定需要換一台」。對無人值守的排程任務來說,兩者都是把「整條 pipeline 因為單點失敗而停擺」的機率往下壓。

Fast mode 要不要開

Opus 5 一樣有 Fast mode,大約 2.5 倍速,代價是兩倍價錢。Claude Code 裡打 /fast 切換,它跑的還是 Opus,不是偷偷換成小模型。

要不要開,判準跟之前那篇 Fast Mode 教學寫的一樣,沒有因為換代而改變:你在旁邊等它的時候值得開,它在背景自己跑的時候不值得。花兩倍的錢買一個沒人在看的進度條,是這整套工具裡最容易犯的浪費。

幾件該先知道的事

它不是每個面向都最強。官方自己標明,在資安攻擊利用這類任務上它仍落後 Mythos 5。行為稽核方面則相反,它比 Opus 4.8、Sonnet 5 和 Fable 5 都更貼合 Claude 的 Constitution。

科學任務的進步幅度比程式碼更誇張。有機化學題目比 Opus 4.8 高出 10.2 個百分點,蛋白質相關預測高 7.7 個百分點。ARC-AGI 3 上的分數是競品的三倍。這些領域如果剛好是你的工作範圍,換代的體感會比寫 code 的人強烈得多。

還有一件必須講的:7 月 27 日 Opus 5 出過一次事故,claude.ai、API、Claude Code 和 Cowork 都有錯誤率升高的情形,從 11:27 UTC 開始,11:47 UTC 恢復正常。新模型上線頭幾週不穩定是常態,如果你打算把它接進排程任務,重試機制先寫好再上。(來源:Claude Status

最後標一下誠實邊界:上面所有 benchmark 數字都來自官方發布,我沒有自己跑過對照測試。實際體感因任務而異,別把單一分數當成保證。

真正變的是那個習慣

回到開頭那件事。

以前你要練的技能是「拆解」——怎麼把一個大任務切到模型扛得住的大小,怎麼在每個接縫處檢查。這個技能在 Opus 4.8 那個世代非常值錢,切得好的人跟切不好的人,產出差距很大。

現在該練的是另一件事:定義完成條件,然後放手。

聽起來輕鬆,其實更難。切任務是勞力活,做久了就熟;把「怎樣算做完」講清楚是判斷活,你得先自己想明白要什麼。以前模型會在中途停下來問你,等於強迫你分段思考;現在它會一路跑到底,你沒想清楚的地方,它會用自己的判斷填滿。

模型變強,省下的是你的手,不是你的腦。