简讯
- Anthropic 于周一发布了 Claude Sonnet 5.5,定价为每百万输入 token 2 美元、每百万输出 token 10 美元——与 Sonnet 5 持平,是 Opus 5.5 价格的一半。
- 据 Anthropic 称,Sonnet 5.5 在 Terminal-Bench 4.0 上得分 70.6%,而 Opus 5.5 为 66.4%;独立测试机构 Artificial Analysis 的结果也显示其领先,为 63.6% 对 59.6%。
- Artificial Analysis 将其排在 Opus 5.5 之后位列第二,但表示它在每个任务上使用的 token 比其测试过的任何模型都多。
Anthropic 于周一发布了 Claude Sonnet 5.5,这是对 6 月发布的 Sonnet 5 的升级。Anthropic 表示,这款中端模型的运行速度比其前代产品快 30% 以上。
“Sonnet 5.5 最擅长范围明确的日常任务、修复 bug,以及制作精美的文档、幻灯片和电子表格。它对设计也有敏锐的眼光,”Anthropic 写道。

价格保持为每百万输入 token 2 美元、每百万输出 token 10 美元。Token 是 AI 读写的一小段文本,比一个单词稍短,公司按百万计费。这是 Opus 5.5 收费的一半。然而,它每个任务使用的 token 少了近三分之一,这意味着它最终运行起来比 Sonnet 5 更便宜。
话虽如此,这个模型在编程方面表现出色。在 Terminal-Bench 4.0 上——这是一项测试 AI 智能体能否通过自行输入命令完成复杂专业任务的基准,按已完成任务的百分比计分——Sonnet 5.5 达到了 70.6%。Opus 5.5 得分为 66.4%,而 Sonnet 5 仅达到 10.3%。
简而言之,更便宜的模型完成了更多任务。 Artificial Analysis,一家独立测试公司,运行了自己的版本并得出了相同结论:Sonnet 5.5 为 63.6%,Opus 5.5 为 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。
Claude Sonnet 5.5(max)在 Terminal-Bench 上取得重大进展,在 Terminal-Bench 4.0 和 Terminal-Bench-Science 两项基准中均跻身顶级模型之列。在 Terminal-Bench 4.0 中它得分 64%,比 Claude Sonnet 5(max)提高了 50 分,并略高于 Opus 5.5 和 GPT-6 的 60%…… pic.twitter.com/7CPrhgmfxe
— Artificial Analysis (@ArtificialAnlys) 2026年9月28日
得分还取决于努力程度设置,这是一个调节旋钮,能让模型思考更久以获得更好的答案,同时也带来更高的账单。Anthropic 表示,Sonnet 5.5 在高努力程度下在 FrontierCode 上与 GPT-6 Sol 持平,而每个任务的成本约为其五分之一。
在 GDPval-AA 上,该基准使用 Elo——一种类似国际象棋、用于对相对技能进行排名的系统——对横跨 44 种职业的真实世界专业工作进行评分,Sonnet 5.5 得分为 1844,而 Opus 5.5 为 1846,实际上打成平手。GPT-6 Sol 得分为 1487。
竞争对手也匹配了价格。 OpenAI 上周将 GPT-6 Sol 降至 2 美元和 10 美元,而其 mid-tier 模型 GPT-5.6 Terra 标价为 2 美元和 12 美元。Anthropic 没有发布 Terra 的基准测试。
问题所在
Sonnet 5.5 话很多。在最大努力程度下,它在每个测试任务中写了约 193,000 个 token,这是 Artificial Analysis 测量到的最多数量,比 Opus 5.5 多出约 60%。这导致每个任务花费 7.60 美元,比 Sonnet 5 高出约 50%,这与 Anthropic 所称最高可节省 30% 的说法相矛盾。
Anthropic 的节省来自更低的设置:在其应用中的默认设置中等努力程度下,它表示 Sonnet 5.5 以不到十分之一的成本超过了 Sonnet 5 的最佳编码得分。Artificial Analysis 表示高努力程度最具性价比。对于日常用户来说,这意味着只要旋钮保持较低,就能以极低价格获得接近旗舰级的编码能力。

Anthropic 的表格是自行报告的,而 Artificial Analysis 测试的是一个预发布版本,该版本存在一个 bug,Anthropic 预计这个 bug 对其分数影响很小或略微低估了分数。Anthropic 表示,Opus 5.5 在需要持续判断的复杂工作上仍然明显更强。
Claude Haiku 5.5 专为高用量、对成本敏感的应用而打造,预计将在未来几周内推出。






