Claude Sonnet 5.5 推荐,家族第二块拼图落在日常活上

Anthropic 的 5.5 家族在六天内落了第二子。Opus 5.5 九月二十二日亮相,Sonnet 5.5 二十八日跟上,官方定位一句话讲清,更快更便宜的补充款,Opus 扛需要谨慎判断的复杂活,Sonnet 最擅长边界清晰的日常任务。我把官方公告、定价页和 HN 讨论对了一遍,这个模型的账很值得算。

主要功能

能力口径先摆官方自称。比上一代 Sonnet 5 提速三成以上,多数工作的成本最多降三成,途径是定价不变但 token 消耗显著减少,官方还给了个趣味标签,第一个仅凭截图通关初代宝可梦的 Sonnet。

基准数字挑重点说。终端任务基准 Terminal-Bench 4.0 拿到百分之七十点六,上一代只有百分之十点三,甚至超过了 Opus 5.5 的百分之六十六点四;智能体编码基准 CursorBench 百分之五十五点五,与 Opus 的五十七点八几乎贴脸;通用文档处理基准与 Opus 打平,人类终极考试带工具百分之六十四点五,操作系统界面任务百分之八十点一。官方算了笔账,在编程基准的高难度档,用大约五分之一的单任务成本追平了 GPT-6 Sol 的最好成绩,这个口径是官方自选场景,横向比较时留意。另有个趣味注脚,通关宝可梦红用了多少步官方没披露,标签意义大于成绩。

价格是这次的杀手锏。每百万 token 输入两美元、输出十美元,与上一代 Sonnet 完全同价,是 Opus 5.5 的一半,缓存写入两块五、缓存读取两毛,批处理再打对折。对比 GPT-6 Sol 的同档表现,成本优势明摆着。企业侧还支持零数据保留,合规要求高的团队用得着。官方客户引述也有信息量,协作工具厂商的评语说上一代频繁触发网页搜索与高 token 消耗两个毛病都好了,另一家平台称一百一十八次真实构建里与上一代旗舰打平,平均迭代次数从七点七次降到三点六次,这些是官方挑选的口径,听个方向。

解决了什么需求

日常开发里大量任务是明确的,改个 bug、补测试、整理文档、做幻灯,这些活用 Opus 是杀鸡用牛刀,用旧 Sonnet 又嫌笨,5.5 卡位正准。HN 讨论里用户 ramish94 直接列数,终端与智能体编码两项基准几乎追平 Opus,性价比陡增。用户 bbor 的感慨有趣,用硬数字呈现的自我改进。用户 nicoburns 说得两极,上一代确实不行,这代明显更好,但离他家旗舰还有距离。用户 takerofnaps 说考虑把部分任务从 GLM 切回来;用户 schwarzrules 把它当作撞上 Opus 限额时的替补。冷水也到位。用户 maherbeg 实测后认为 Opus 开低速档反而更聪明更便宜更快,用户 bigyabai 拿 GLM-5.3 Flash 约二十分之一的价格说事,质疑 API 性价比,开源模型的挤压实实在在。还有一组集体吐槽值得记录,安全审查过敏,做渗透测试授权、校验数据库写入、编译老代码,甚至提示词里出现模糊测试一词都被拦截,有用户指出官方的网络安全验证计划尚未覆盖 5.5 系列,安全相关工作者先避雷。综合看,这代的最佳用法是分层,日常主力切 5.5,难题留给 Opus,成本结构立刻健康。

注意事项

上下文窗口官方公告没有公布,平台文档在部分区域无法访问,这个数字本文不写,等官方口径。云渠道方面官方公告写亚马逊、谷歌云与微软 Azure,模型页又写微软 Foundry,两处措辞不一致,采购前与销售确认。订阅用户在 Claude 应用三端可用,API 模型名 claude-sonnet-5-5,免费层用户能用的正是 Sonnet 与 Haiku 两档,等于第一时间摸到新模型。家族的第三块拼图 Haiku 5.5 官方说数周内到,等完整阵容再评估工作流分层。缓存与批处理的定价细节值得配进工作流,省的是真金白银。模型名写法别搞混,5-5 与 5.5 是同一个模型的两个名字,叫错会调到旧版。

总结

同价提速降耗,基准贴脸自家旗舰,日常任务的最优选名单里该有它,这话我说得有底气。安全场景用户等验证计划覆盖,成本敏感的大规模调用继续货比三家,免费层已经能用上,试错零成本。

来源

  • Anthropic 官方公告 https://www.anthropic.com/claude-sonnet-5-5
  • 官方模型页 https://www.anthropic.com/claude/sonnet
  • 官方定价 https://claude.com/pricing
  • HN 讨论 https://news.ycombinator.com/item?id=49881850