Claude Haiku 5.5发布,跑分超过GPT-6 Luna,价格直接对标

Claude Haiku 5.5正式发布,以小模型身份实现跑分逆袭。成绩超过此前的两个"斩杀线"模型DeepSeek V4.1Flash和GLM-5.3-Flash,成为新的小模型守门员。官方跑分显示,Haiku 5.5逐项胜过GPT-6 Luna,价格也完全对标Luna。
Haiku 5.5是首个支持effort调节的Haiku模型,提供从low到max的五档配置。上一代Haiku 4.5于一年前推出,价格是5.5的10倍。Haiku 5.5的优惠有条件:提示词在10万token以内的请求(占Haiku 4.5请求量的90%),输入输出价格直降90%;超过10万token的部分降50%。除缓存命中的输入外,Haiku 5.5价格也低于DeepSeek-V4.1 Flash。
- OSWorld 2.1测试中,Haiku 5.5 Low档准确率42.0%、单次成本$0.07;Max档72.4%、$0.61。Haiku 4.5仅Max档15.7%、$1.45。
- GDPval-AA v2.1测试中,Haiku 5.5 Low档Elo 1125、$0.01;Max档1620、$0.87。Haiku 4.5 Max档仅735、$0.24。
- Terminal-Bench 4.0上Haiku 5.5得39.2%,Sonnet 5.5得70.6%。
Haiku 5.5更换了tokenizer(与Sonnet 5.5、Opus 5.5同款),同样任务会消耗更多token,实际节省费用低于标价折扣,代码、表格、非英语内容的膨胀可能更高。AA测评显示,其"完成任务的平均成本"未达理想区间。Anthropic建议复杂agent编码优先使用Sonnet 5.5或Opus 5.5。目前Opus 5.5负责复杂推理、Sonnet 5.5负责通用执行、Haiku 5.5负责跑量和速度。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

