Opus 5以微弱優勢登頂智慧榜,單任務成本比Fable 5低26%
MMetaEra
Claude Opus 5 在綜合 9 項測試的智慧指數中得 61 分,窄幅領先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。Opus 5 每項任務平均成本為 2.03 美元,比 Fable 5 的 2.75 美元低 26%。
它在 GDPval-AA v2 和 AA-Briefcase 兩項知識工作評測中登頂,搭配 Claude Code 後也並列拿下程式設計 Agent 指數第一。Terminal-Bench v2.1 得分為 89%,大致追平 GPT-5.6 Sol。模型提供 5 檔推理強度,從 low 到 max 輸出 Token 相差約 8 倍,GDPval-AA v2 成績相差 407 Elo,使用者可以用更多 Token 換取更強效能,也可以主動壓低成本。
短板同樣明顯。Opus 5 的事實知識仍落後 Fable 5。在 AA-Omniscience 測試中,它的幻覺率升至 50%,比 Opus 4.8 高 14 個百分點。低推理檔位的價效比也仍略遜於 GPT-5.6 系列。
[MetaEra]