← 返回文章列表
Vibe Coding 動態 by Claude News Bot

重大:Introducing Claude Opus 5

#claude-code #breaking-news #ai-development #major

Anthropic 官方宣布 Claude Opus 5 已於 2026 年 7 月 24 日推出。根據公告,Opus 5 被定位為「thoughtful and proactive」的日常可用模型,並以相同於前代 Opus 4.8 的成本提供更高效能;它也成為 Claude Max 的新預設模型,以及 Claude Pro 上最強的模型。

這次更新之所以被列為重大事件,核心在於 Anthropic 明確宣稱 Opus 5 在多項 coding 與 knowledge work 評測中達到新的 state-of-the-art。公告提到,在 Frontier-Bench v0.1 上,Opus 5 超越所有其他模型,且相較 Opus 4.8,在更低的單任務成本下達到超過兩倍的表現;在 CursorBench 3.2 上,Opus 5 於 max effort 設定下接近 Claude Fable 5 的峰值分數,差距在 0.5% 內,但單任務成本約為一半。

Anthropic 也強調,Opus 5 的「effort setting」可讓使用者在智慧程度、token 節省、速度與成本之間做取捨。這對 Claude Code 使用者尤其重要:若公告中的表現反映在實際開發流程中,開發者可能可以用更低成本完成更複雜的軟體工程任務,或在需要較高推理品質時提高 effort 設定以換取更完整的解題能力。

除了 coding 評測,Opus 5 在知識工作與問題解決任務上也有明顯強調。公告指出,在 ARC-AGI 3 上,Opus 5 的分數是下一名模型的三倍;在 Zapier AutomationBench 上,同等單任務成本下,Opus 5 的通過率約為下一名模型的 1.5 倍;在 OSWorld 2.0 上,Opus 5 在任意成本點都優於其他模型,並以略高於三分之一的成本超越 Fable 5 的最佳結果。

對研究工作者而言,公告也提到 Opus 5 相較 Opus 4.8 在生命科學相關評測中全面提升,涵蓋結構生物學、有機化學與生物資訊學等領域。其中,有機化學任務如根據光譜資料推斷分子結構,Opus 5 在 Anthropic 內部 benchmark 上比 Opus 4.8 高出 10.2 個百分點;蛋白質相關任務如預測序列變異對功能的影響,則高出 7.7 個百分點。

在使用方式上,Anthropic 表示 Opus 5 更擅長驗證自身工作,並能更謹慎地反覆迭代直到成功。公告舉例指出,在一個 Frontier-Bench 任務中,Opus 5 被要求根據機械零件圖重建 3D FreeCAD 模型,但沒有直接觀看圖像的方式;它改為自行撰寫 computer vision pipeline 從原始像素擷取幾何資訊,並成功重建零件。

開發者現在可以做的事,是先確認自己使用的 Claude 方案與模型設定是否已切換到 Opus 5,並在 Claude Code 或其他 coding workflow 中測試不同 effort setting 對成本、速度與輸出品質的影響。若目前仍依賴 Opus 4.8,這次公告提供了明確理由重新評估升級後的效能與成本效益。

相關連結:

讀者回應

0/500

載入中...


推薦閱讀

訂閱最新文章

每週接收 Claude Code 最新動態、AI 開發工具趨勢與技術分析,直接送到你的信箱。

我們尊重你的隱私,隨時可以取消訂閱。

本文由 Namog Vibe Coding 自動化監控系統生成