Sonnet 5.5正式发布,效率优先成为核心卖点
当地时间9月28日,Anthropic正式发布Claude Sonnet 5.5,这是Claude 5.5家族的第二款模型,距离旗舰级Opus 5.5发布仅过去一周。
与以往强调能力边界不同,Anthropic这次把宣传重心放在了“效率”上。官方数据显示,Sonnet 5.5的输出生成速度比上一代Sonnet 5快30%以上,完成单项任务的综合成本最高可降低30%。
关键之处在于,这一成本下降并非来自API降价。Sonnet 5.5的API定价与Sonnet 5完全一致:每百万输入Token 2美元,每百万输出Token 10美元,缓存读取0.20美元,缓存写入2.50美元。成本节省的真正来源,是模型在执行任务时使用了更少的Token和更少的工具调用。
编程能力大幅跃升,Terminal-Bench反超旗舰
在Anthropic公布的基准测试中,Sonnet 5.5在编程领域的进步最为突出。
在自主智能体编程测试Terminal-Bench 4.0中,Sonnet 5.5得分达到70.6%,而上一代Sonnet 5仅为10.3%,提升超过60个百分点。更引人注目的是,这一成绩甚至超过了旗舰级Opus 5.5在Xhigh档位下的66.4%。
在真实编辑器场景测试CursorBench 4.0中,Sonnet 5.5取得55.5%,较Sonnet 5的34.1%大幅提升,与Opus 5.5的57.8%仅差2.3个百分点。
知识工作领域的表现同样接近旗舰。在覆盖44个职业真实任务的GDPval-AA v2.1评估中,Sonnet 5.5得分1844,与Opus 5.5的1846几乎持平,而Sonnet 5仅为1449。在计算机操作测试OSWorld 2.1中,Sonnet 5.5达到80.1%,Opus 5.5为81.8%,Sonnet 5则只有57.0%。

少调用、少执行:效率提升的真实来源
Sonnet 5.5成本下降的核心机制,是执行任务时所需的外部操作大幅减少。
Anthropic的客户测试提供了具体数据。Lovable联合创始人兼CTO Fabian Hedin表示,其内部评估发现Sonnet 5.5完成编程任务时所需的工具调用次数减少了约三分之一,Shell执行次数减少了约一半。每一次避免的工具调用,都意味着少一次外部操作、少一次网络往返、少一次上下文消耗。
Box的AI产品副总裁Yashodha Bhavnani表示,Sonnet 5.5“比上一代更准确,速度快2.4倍,总Token使用量减少12%”。Zendesk的测试显示,工单处理速度提升了20%,且模型做出的错误决策更少。Slack的首席工程师Curtis Allen则表示,Sonnet 5.5在公司几乎所有离线评估中都优于Sonnet 5,无需修改提示词,且输出Token减少了约14%。
Base44在118个真实应用构建任务中发现,Sonnet 5.5达到与Opus 5相当的结果平均只需3.6次迭代,而Opus 5需要7.7次,同时Sonnet 5.5产生的失败工具调用次数也是所有对比模型中最少的。
市场定位:中杯模型正在吃掉大杯的份额
Sonnet 5.5的发布,延续了Anthropic将旗舰能力下放到中端模型的策略。官方将其定位为最适合“范围明确的日常工作”——软件调试、编码、制作文档、演示文稿和电子表格,以及界面设计。Opus 5.5仍被推荐用于需要持续判断的模糊或开放式任务。
但Anthropic自己的测试数据显示,两者在某些工作负载上的差距已经显著缩小,甚至Sonnet 5.5在部分编程任务上实现了反超。
Anthropic还透露了成本效率的另一个维度。在多项评估中,Sonnet 5.5以低或中等努力档位运行,即可在约十分之一的单任务成本下超越Sonnet 5的最佳成绩。在FrontierCode测试中,Sonnet 5.5在高档位的得分比Sonnet 5同档位高出约10分,而单任务成本仅为其约十五分之一。

生态快速接入:GitHub Copilot与Devin同步上线
发布当天,GitHub宣布Claude Sonnet 5.5已在GitHub Copilot中全面可用。GitHub的早期测试显示,Sonnet 5.5在编码任务上与Sonnet 5持平,但使用的步骤、Token和工具调用明显更少,任务完成速度也更快。
Cognition也已将Sonnet 5.5接入其AI编程助手Devin。据AlphaSignal报道,Cognition的评估发现,Sonnet 5.5完成编程任务所需的工具调用减少约三分之一,Shell执行减少约一半,可将编码成本降低30%。
竞争格局:日常模型的价格战正在收紧
Sonnet 5.5进入的是一个竞争日趋激烈的中端模型市场。
OpenAI上周发布的GPT-6 Sol,标准API定价同样为每百万输入Token 2美元、输出Token 10美元,缓存读取0.20美元、缓存写入2.50美元。谷歌的Gemini 3.8 Flash则以0.75美元/3.75美元的入门价格提供更强的价格竞争力,标准价格将于2027年1月1日调整为1.50美元和7.50美元。
Anthropic的差异化策略,是将竞争维度从“每Token价格”转向“每任务成本”。当三家公司的API标价越来越接近时,模型完成任务所需的外部操作次数、失败重试次数和总Token消耗量,正在成为决定企业实际支出的关键变量。Sonnet 5.5的发布表明,Anthropic正在把这一维度作为其下一代产品的核心竞争点。
(素材来自:Anthropic 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
