Opus 5 以微弱差距在 Smart Rankings 榜上奪得首位,單一任務成本比 Fable 5 低 26%
BBlockBeats
它在基於9項測試的綜合智慧指數中得分為61,僅以1分之差領先得分為60的 Fable 5。GPT-5.6 Sol 得分為59,Kimi K3 得分為57。Opus 5 每項任務的平均成本為$2.03,比 Fable 5 的 $2.75 低26%。
它在 GDPval-AA v2 與 AA-Briefcase 知識工作評估中名列榜首,並且在與 Claude Code 搭配時在 Programming Agent 指數上並列第一。Terminal-Bench v2.1 得分為89%,大致等於 GPT-5.6 Sol。該模型提供5個推理強度等級。從低到最大,Token 輸出大約相差8倍,GDPval-AA v2 得分相差407 Elo。使用者可以用更多 Token 換取更高效能,或主動降低成本。
然而,弱點也很明顯。Opus 5 的事實性知識仍然落後於 Fable 5。在 AA-Omniscience 測試中,它的幻覺率已上升到50%,比 Opus 4.8 高出14個百分點。低推理等級的性價比也仍然略遜於 GPT-5.6 系列。
[律动]