
Anthropic 於 2026 年 9 月 22 日推出 Claude Opus 5.5,這是 Claude 5.5 家族的首個模型。官方稱它在大部分工作上達到 Claude Fable 5.1 的水平,運行成本則比 Opus 5 低 40%。Anthropic 同時表示,模型在發布前接受了 Frontier Design 和 METR 等外部評估者測試。
這次發布把焦點放在長時間、跨檔案和需要多個工具步驟的工作,而不只是單次問答。Anthropic 的內部和早期使用者測試涵蓋 agentic coding、computer use、知識工作和商業流程;不過,頁面上的大部分結果仍然是 Anthropic、合作夥伴或早期測試者提供的資料,不能直接當作所有真實環境的獨立基準。
編程方面,Anthropic 形容 Opus 5.5 特別適合大型程式庫遷移與審核。一名早期測試者稱模型在一天內完成 680,000 行程式碼的遷移;另一項測試則是替網頁應用程式改善載入速度,Opus 5.5 在 40 次嘗試中成功 39 次。這些例子顯示模型可以處理較長的任務鏈,但仍需要工程師檢查變更、測試結果和回滾路徑。
官方列出的成本結構也與代理工作有關:每百萬輸入 token 為 4 美元、輸出 token 為 20 美元,cache read 為 0.20 美元;Anthropic 稱預設設定下典型工作負載總成本比 Opus 5 低 40%,輸出速度則快逾 30%。對長時間代理而言,cache 和步驟數是否真的下降,往往比單一 token 價格更影響總成本。
安全部分,Anthropic 稱 Opus 5.5 在其自動化行為審核中取得目前最好的結果,並在長任務、不可能完成的任務及仿真真實事故的情境中擴大測試。官方亦表示模型對 prompt injection 的抵抗力優於 Opus 5,並透過每次行動前的分類器、可審核的 sandbox 和合併前程式碼審查來支援代理部署。這些都是產品方的安全聲稱,完整判讀仍要看 system card、測試設定和外部重現。
Opus 5.5 的基準表包括 Terminal-Bench、FrontierCode、CursorBench、GDPval 和 OSWorld 等項目。Anthropic 亦提醒,在這個能力水平,基準分數差距未必能可靠預測真實工作差異;不同 effort 設定、工具、護欄介入和測試環境都會影響結果。因此,企業評估模型時,應把任務成功率、工具呼叫數、人工重工和錯誤後果一起記錄。
目前 Opus 5.5 已按不同方案提供,Anthropic 亦宣布提高部分訂閱方案的五小時使用上限,並計劃在未來數周推出 Sonnet 5.5 和 Haiku 5.5。生命科學和網絡安全方面則採取驗證計劃,先讓符合條件的組織使用相關能力。這反映出模型能力提高後,存取權限、使用者身分和高風險領域的審核會一起成為產品設計的一部分。
這次發布的實際訊號,是 AI 編程代理正在由短任務助手走向可以長時間運行的工作單位。當模型能夠連續讀取上下文、修改多個檔案和自行驗證,評估重點就不應只看一次回答是否正確,而要看權限邊界、每一步是否可追蹤、何時需要人批准,以及失敗後能否安全回復。Opus 5.5 的數據值得留意,但仍應以受控試點和可驗證的工程指標決定是否採用。



