Anthropic于周一发布了Claude Sonnet 5.5,作为今年6月Sonnet 5的升级版。该公司表示,这款中端模型运行速度比前代快30%以上。“Sonnet 5.5在最明确的日常任务、修复漏洞以及创建精良文档、幻灯片和电子表格方面表现最强。它对设计也有敏锐的眼光,”Anthropic写道。
Myriad:英伟达股价会跌至多低?点击做出你的预测。
价格维持在每百万输入令牌2美元、每百万输出令牌10美元。令牌是AI读写文本块,比单词稍短,企业按百万计费。这一价格仅为Opus 5.5的一半。此外,它每项任务使用的令牌减少近三分之一,意味着运行成本比Sonnet 5更低。不过,该模型在编码方面表现突出。
在Terminal-Bench 4.0(测试AI代理能否通过自主键入命令完成复杂专业任务,以完成任务比例计分)中,Sonnet 5.5达到70.6%。Opus 5.5为66.4%,Sonnet 5仅10.3%。通俗地说,更便宜的模型完成了更多工作。独立测试机构Artificial Analysis运行自己的版本并认可:Sonnet 5.5为63.6%,Opus 5.5为59.6%,OpenAI的GPT-6 Astra为59.1%。
分数也取决于努力设置,该旋钮让模型思考更久以获更好答案和更高账单。Anthropic称,高努力下的Sonnet 5.5在FrontierCode上匹配GPT-6 Sol,而每项任务成本约为其五分之一。在GDPval-AA(使用Elo棋类风格系统评估44个职业真实专业工作)中,Sonnet 5.5得1844分,Opus 5.5为1846,实质平手。GPT-6 Sol得1487。
竞争对手价格相当。OpenAI上周将GPT-6 Sol降至2和10美元,其中端模型GPT-5.6 Terra标价2和12美元。Anthropic未发布Terra基准。
需注意:Sonnet 5.5是个“话痨”。在最大努力下,每个测试任务写约193,000令牌,是Artificial Analysis测得最多,比Opus 5.5多约60%。这导致每项任务7.60美元,比Sonnet 5高约50%,与Anthropic最高省30%的说法相悖。Anthropic的节省来自较低设置:在中等努力(其应用默认)下,Sonnet 5.5以不到十分之一成本击败Sonnet 5最佳编码分。Artificial Analysis称高努力性价比最高。对日常用户,意味着只要旋钮调低,就能以零头价格获得近旗舰编码力。
Anthropic的表格为自报,Artificial Analysis测试了预发布版本,存在一bug,Anthropic预计影响不大或轻微低估分数。Anthropic表示Opus 5.5在需持续判断的复杂工作中仍明显更强。面向高容量、成本敏感应用的Claude Haiku 5.5将在未来数周推出。
