簡介Anthropic最新模型Claude Opus5的特色、功能、價位、實際應用與主要AI 模型的比較。
一、Claude Opus 5 是什麼
Claude Opus 5 於 2026 年 7 月 24 日推出,定位是「以約一半的價格,接近 Claude Fable 5 的前沿智慧」。它是 Claude Max 方案的新預設模型,也是 Pro 方案上可選的最強模型;在 Frontier-Bench、GDPval-AA 這類編碼與知識工作評測上是目前的 state-of-the-art,但在網路安全類任務上仍落後 Mythos 5。
核心規格
Opus 5 具備 100 萬 token 上下文窗(1M 同時是預設值也是上限,沒有較小的變體)、128K 最大輸出,且「思考」預設開啟。知識可靠截止為 2026 年 5 月 — 是目前 Claude 全系列中最新的。API 模型 ID 為 claude-opus-5,同時在 Amazon Bedrock、Google Cloud、Microsoft Foundry 上架。
二、主要新功能與行為變更
這一代有兩個破壞性變更,如果你有既有整合要特別注意:
- 思考預設開啟 — Opus 4.8 上不設定
thinking就不會思考;Opus 5 則預設就會思考,由模型自行決定何時思考、思考多深,並改用 effort 參數控制深度。因為max_tokens是「思考 + 回應文字」的總上限,原本沒開思考的工作負載要重新檢視這個值。 - 高 effort 下不能關思考 — 在
xhigh或maxeffort 下送出thinking: {"type": "disabled"}會回 400 錯誤。
其他值得知道的:
- Effort 階梯更關鍵 — 完整階梯為 low / medium / high / xhigh / max,預設 high。Opus 5 比任何先前的 Opus 更可靠地把額外 effort 轉換成更好的結果,所以檔位選擇的份量更重。
- 對話中途變更工具(beta) — 可在對話回合之間新增或移除工具而保留 prompt cache,不必整個 session 重送固定的工具清單。需要
mid-conversation-tool-changes-2026-07-01beta header。 - 快取門檻降低 — 最短可快取的 prompt 從 1,024 token 降到 512 token,不需改任何程式碼。
- Fast mode(研究預覽) — 約 2.5 倍速度,價格加倍($10/$50),僅限第一方 Claude API,Bedrock / Google Cloud / Foundry 尚無。
- 會自我驗證 — Opus 5 不用被要求就會驗證自己的工作,所以要把舊模型沿用下來的「請加上最終驗證步驟」「用 subagent 驗證」這類指令拿掉,否則會過度驗證。同時預設回覆與交付文件會更長、agent 過程中更常向使用者說明進度、也更願意委派 subagent。
能力提升重點:深度推理、agentic coding 與長時程任務(能完成多檔案功能與大型重構而不留 stub)、test-time compute scaling、程式碼審查與抓 bug(每次掃描找出真實 bug 的比例高、誤報少,且在較低 effort 下仍準確)、視覺理解(圖表、文件、示意圖)、長上下文一致性、Office 文件(多工作表複雜公式試算表、結構良好的簡報),以及多 agent 協作。
評測參考:Frontier-Bench v0.1(agentic coding)Opus 5 為 43.3%,領先 GPT-5.6 Sol 的 34.4% 與 Fable 5 的 33.7%。SWE-bench Pro 為 79.2%,落後 Mythos 5(80.3%)與 Fable 5(80.0%)不到一分。提醒:這些數字多為各實驗室自行公布、跑在自家 harness 上,跨廠牌比較要打折看。
三、價位
| 使用模式 | 輸入 / 百萬 token | 輸出 / 百萬 token |
|---|---|---|
| 標準 | $5 | $25 |
| Batch API(非即時) | $2.50 | $12.50 |
| Prompt cache 命中 | $0.50 | — |
| Fast mode(API only) | $10 | $50 |
標準價與前代 Opus 4.8 完全相同,Batch 對輸入輸出各砍半,cache 命中為基礎輸入價的 9 折折扣(即 $0.50)。訂閱端則是 Max 的預設模型、Pro 可選的最強模型。
四、與主要 AI 模型比較表
| 項目 | Claude Opus 5 | Claude Fable 5 | Claude Sonnet 5 | GPT-5.6 Sol | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| 定位 | 複雜 agentic coding/企業工作 | 長時程 agent 的最強智慧 | 速度與智慧的平衡 | OpenAI 旗艦 | Google 高性價比前沿 |
| 輸入/輸出($/MTok) | $5 / $25 | $10 / $50 | $3 / $15(8/31 前 $2/$10) | $5 / $30 | $2 / $12(>200K 轉 $4/$18) |
| 上下文窗 | 1M | 1M | 1M | 約 1.05M | 1M |
| 最大輸出 | 128K | 128K | 128K | 128K | 66K |
| 知識可靠截止 | 2026/5 | 2026/1 | 2026/1 | 未公布統一數字 | 未公布統一數字 |
| 思考控制 | adaptive 預設開,effort low→max | 永遠開啟 | adaptive | reasoning effort(none→xhigh) | 廠商自控 |
| Batch 折扣 | 5 折 | 5 折 | 5 折 | 5 折 | 5 折 |
| 長上下文加價 | 無(1M 皆標準價) | 無 | 無 | >272K 轉 $10/$45 | >200K 轉 $4/$18 |
| Frontier-Bench v0.1 | 43.3% | 33.7% | — | 34.4% | — |
資料來源:Claude 模型定價與規格取自 Anthropic 官方文件;GPT-5.6 Sol 為 1.05M 上下文、128K 最大輸出、短上下文 $5/$30,超過 272K 輸入則整筆以 $10/$45 計價;Gemini 3.1 Pro 在超過 200K token 後輸入與輸出同時跳到 $4/$18。
以下是三個實務上最常見的取捨:## 五、實際應用建議
用 effort 分層,而不是用模型分層。 Opus 5 最大的成本槓桿是 effort 參數,因為它在 low / medium 檔就能以極少的 token 與延遲產出不錯的品質。實務做法是:掃描結果的初步分類、CVE 去重、log 事件抽取這類結構化工作跑 low/medium;風險判定、跨報告關聯分析、審計結論撰寫再升到 high 或 xhigh。先跑 evals 找出品質不掉的最低檔位,比換模型省得更多。
善用 1M 上下文一次吃完整批報告。 由於 1M 是預設也是上限、且不像 Gemini 或 GPT 那樣有長上下文加價,Opus 5 特別適合「多份掃描報告一次進去做橫向比對」的場景 — 例如把多個 namespace 的容器映像掃描結果、Fortify SAST 輸出、以及風險登記簿現況一起送入,讓模型直接找出重複項與尚未收斂的項目,而不用先做 RAG 切塊。
Prompt caching 對審計流程回報率極高。 報告模板、術語表、風險評級準則、公司格式規範這些每次都重送的前綴,快取命中只要 $0.50/MTok(9 折)。門檻降到 512 token 之後,連短的系統提示都能快取。
Batch API 跑離線分析。 GoldenGate Replicat log 的批次分析、大量映像檔的例行複掃、回填歷史 CVE 對照表這類不趕時間的工作走 Batch,直接省一半。Batch API 另外還支援 output-300k-2026-03-24 beta header 把輸出上限拉到 30 萬 token,長篇審計報告一次產出不用分段。
程式碼審查與相依性稽核是這代的強項。 Opus 5 在每次掃描中找出真實 bug 的比例高且誤報少,而且在低 effort 下仍保持準確 — 對 M35 這類現代化專案的逐檔安全審查來說,可以用較低成本先做全面掃描,再把可疑檔案升檔重審。
一個必須注意的遷移陷阱: 如果你既有的提示詞裡有「請加上最終驗證步驟」或「用 subagent 驗證結果」,在 Opus 5 上要移除,否則會造成過度驗證、拖長輸出與成本。
六、後續觀察
- 上面的跨廠牌 benchmark 數字幾乎全是各實驗室自行公布,harness 與 effort 設定不同,只適合當方向性參考,不宜當作採購決策的唯一依據。
- 定價與功能變動很快(Sonnet 5 的優惠價 8/31 到期、Gemini 3.5 Pro 傳聞延期),實際採購前建議直接核對 Anthropic 定價頁 與各家官方價目。
- Opus 5 在網路安全任務上仍落後 Mythos 5;不過 Mythos 5 屬 Project Glasswing 的邀請制,沒有自助申請管道。