价格暴降90%,多项测试超GPT-6 Luna,Anthropic最便宜模型来了 - 开云中国站

  • Shipgo
  • 2025年8月29日
  • 03 评论

精品工艺专注精品工艺,为用户提供专业可靠的体验。

精品工艺

Anthropic 再次掀起价格战,这次轮到 Claude 系列中最经济实惠的 Haiku。

10月7日,Anthropic 正式推出 Claude Haiku 5.5,宣称这是其旗下目前速度最快、性能最强、价格最低的小型模型。

最引人注目的是定价,每百万输入 Token 最低仅需 0.1 美元,相比前代产品直降 90%。

性能方面同样不逊色。根据 Anthropic 公布的测试数据,Haiku 5.5 在计算机操作、知识工作、Agent 编程等多个基准测试中超越了 OpenAI 的 GPT-6 Luna,部分项目甚至领先显著。

此外,Haiku 5.5 首次引入了可调节的推理强度,支持 100 万 Token 的上下文窗口,以及最高 12.8 万 Token 的输出能力。

至此,Anthropic 在短短 15 天内完成了 Claude 5.5 全家桶的更新:9 月 22 日 Opus 5.5 亮相,9 月 28 日 Sonnet 5.5 发布,如今 Haiku 5.5 也正式加入。

此次,Anthropic 将重点放在了那些调用量巨大、对价格极为敏感的 AI 任务上。

多项成绩超越 GPT-6 Luna,计算机操作成功率 72.4%

根据 Anthropic 公布的 Benchmark 成绩,Haiku 5.5 相比上一代实现了显著提升,在部分测试中甚至优于 GPT-6 Luna。

其中最突出的成绩来自 OSWorld。这是一项评估 AI Agent 操作真实计算机能力的测试,要求模型完成跨应用、多步骤的操作任务。

在 OSWorld 2.1 离线任务子集中,Haiku 5.5 达到了 72.4% 的成功率,而上一代 Haiku 4.5 仅为 15.7%,GPT-6 Luna 则为 48.9%。

在知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 中获得了 1620 分,超过了 GPT-6 Luna 的 1437 分。在 Agent 编程测试 Terminal-Bench 4.0 中,两者的成绩分别为 39.2% 和 16.4%。

不过,这些数据背后有一个重要细节。Haiku 5.5 的最佳 Benchmark 成绩,通常需要投入更多的推理计算。

Haiku 5.5 首次在 Haiku 系列中引入了可调节的推理强度,开发者可以通过 effort 参数控制模型投入的计算资源。

媒体 VentureBeat 注意到,在 Anthropic 公布的 Terminal-Bench 测试中,39.2% 的成绩对应的是最大推理强度。切换至中等推理强度后,成绩降至约 20%,而中等强度正是 Haiku 5.5 的默认设置。

第三方评测机构 Artificial Analysis 也观察到了类似现象。在其 Intelligence Index 评测中,Haiku 5.5 在最大推理强度下获得 43 分,中等推理强度下为 34 分。同一评测中,平均每项任务成本分别约为 0.21 美元和 0.05 美元。

也就是说,模型可以通过增加推理预算来换取更好的任务表现,但实际花费也可能显著增加。

Artificial Analysis 在其 Terminal-Bench 4.0 测试中,测得最大推理强度下 33%、中等强度下 15% 的成绩。由于评测设置不同,这组数字与 Anthropic 官方结果存在差异。

这也是为什么在评估小型模型性能时,需要同时考虑推理强度、任务完成率和实际成本。

在更复杂的 Agent 编程任务上,Sonnet 5.5 依然具有明显优势:Terminal-Bench 4.0 成绩达到 70.6%。

Anthropic 也明确表示,Sonnet 和 Opus 仍然更适合复杂的 Agent 编程任务,Haiku 的优势集中在高频、范围明确的工作中。

价格直接砍到一折,与 GPT-6 Luna 正面竞争

如果说性能提升让 Haiku 5.5 具备了竞争力,那么价格可能才是此次发布最重要的看点。Anthropic 为新模型设计了两档 API 价格。

对于提示长度不超过 10 万 Token 的请求,Haiku 5.5 的输入、输出单价都比上一代降低了 90%。超过这个门槛,价格仍比 Haiku 4.5 低 50%。

Anthropic 表示,上一代 Haiku 约 90% 的请求都处于 10 万 Token 以内。结合不同请求长度和 Token 消耗变化,公司预计 Haiku 5.5 完成同类任务的平均成本下降约 75%。

这里还有一个容易忽略的细节——Haiku 5.5 换用了新的 Tokenizer。根据官方开发者文档,同一段文本在新模型中产生的 Token 数量,可能比 Haiku 4.5 多约 30%,具体增幅取决于内容。因此,API 单价下降 90%,并不代表每项任务的账单都能减少 90%。

另一个值得关注的对手是 GPT-6 Luna。OpenAI 给出的 Luna 基础定价同样为每百万输入 Token 0.1 美元、输出 0.5 美元,缓存读取价格也与 Haiku 5.5 的低价档一致。

不过,两家公司的长上下文计费门槛存在明显差异。

Haiku 5.5 在提示超过 10 万 Token 后进入更高价格档;GPT-6 Luna 则在输入超过 27.2 万 Token 后才触发长上下文加价。这意味着,在 10 万至 27.2 万 Token 之间的请求中,Luna 的单位 Token 价格具有优势。

至于最终完成一项任务哪款模型更省钱,还需要结合实际 Token 用量、推理预算和任务成功率来判断。

放到整个市场来看,Anthropic 也在向其他低价模型施加压力。

VentureBeat 列出的同期 API 价格显示,Google Gemini 3.5 Flash-Lite 每百万输入 Token 价格为 0.3 美元、输出 2.5 美元;Gemini 3.8 Flash 分别为 0.75 美元和 3.75 美元。

当然,不同模型的能力定位、缓存策略和任务表现各不相同,这些数字首先反映的是 API 价格竞争。

小型模型的价格战,正在进一步升级。

一周 800 万次调用,企业开始让小模型给大模型打工

Haiku 5.5 到底适合干什么?

Anthropic 给出的场景包括文档摘要、信息分类、数据库查询、上下文压缩,以及在复杂 Agent 工作流中担任 Subagent。

这背后有一个很现实的问题:如今的 Agent 越来越复杂,一项任务往往需要多次调用模型。如果每个步骤都交给大模型处理,成本会快速累积。

金融 AI 公司 Rogo 提供了一个例子。在其工作流中,一个能力更强的大模型负责制作财务演示文稿。处理其中某张幻灯片时,Haiku 5.5 Subagent 进入企业 10-K 年报,找到需要的业务收入数据,再把结果交给主模型。

对于这种任务,模型需要快速、准确地完成信息查找和提取。Rogo 认为,Haiku 5.5 在准确率、速度和价格之间达到了适合大量重复调用的平衡。

企业内容管理平台 Box 也给出了早期测试结果。相比 Haiku 4.5,Haiku 5.5 的内部评测成绩提高了 11 分,延迟下降了约 50%。

Box 表示,这让新模型适合成本报告、财务摘要、周期性审查等需要规模化运行的分析工作。不过,Box 没有公开完整的评测标准。

Asana 的测试则覆盖了 Bug 分类、项目建立、大型项目组合搜索等 Agent 任务。根据其披露的结果,相比当前使用的模型,Haiku 5.5 让任务完成延迟降低了超过 30%,单轮 Agent 推理速度最高提升了 2.5 倍。

另一个更能体现成本价值的例子来自 AlphaSense。这家公司的 Ask in Document 功能每周需要处理约 800 万次调用,主要回答针对一份或几份文档的具体问题。

在 400 个测试查询中,Haiku 5.5 的内部评测得分达到 0.84,而 Haiku 4.5 为 0.76。

如果一款模型每周要被调用数百万次,哪怕每次只节省很少的钱,长期累积下来的成本变化也可能相当可观。

这些数据来自 Anthropic 披露的早期客户反馈,具体工作负载、对照模型及评价标准并不完全一致,还需要更多独立测试。

Sonnet 跟着降价,Claude 5.5 全家桶开始拼成本

除了 Haiku 5.5,Anthropic 还同步调整了 Sonnet 5.5 的定价。从 10 月 7 日起,Sonnet 5.5 的缓存读取费用降低了 50%,从每百万 Token 0.2 美元降至 0.1 美元。

Anthropic 预计,这项调整可以让多数 Agent 工作负载的成本再降低约 20%,实际降幅取决于应用重复使用缓存上下文的程度。

对于需要反复读取长对话历史、工具说明和任务上下文的 Agent 来说,缓存成本会直接影响系统的长期运行开销。

Anthropic 同时为 Claude Max 和 Team 订阅用户推出了每月 API 额度:Max 5x 用户 100 美元,Max 20x 用户 200 美元,Team 用户共享最高 500 美元。

这些额度可用于 Claude 平台上的模型调用,鼓励更多订阅用户尝试构建自己的 Agent 和应用。

开发者方面,Haiku 5.5 已通过 Anthropic API、Amazon Bedrock、Google Cloud 和 Microsoft Azure 等平台提供服务,API 模型 ID 为 claude-haiku-5-5。

Anthropic 也更新了 Python 和 TypeScript SDK,新增处于 Beta 阶段的浏览器操作与计算机操作支持。

至此,Claude 5.5 系列的产品分工已经相当清楚。

Opus 5.5 负责高难度、复杂推理任务,Sonnet 5.5 覆盖日常复杂工作与编程,Haiku 5.5 则主攻调用量大、成本敏感、要求快速响应的任务。

从 9 月 22 日到 10 月 7 日,Anthropic 用了 15 天完成这一轮产品更新,三个型号都在强调性能和成本效率。

Haiku 5.5 的发布,也让一个趋势更加明显。随着 Agent 逐渐从演示走向实际应用,开发者必须考虑整套系统的调用成本。一次任务中哪些步骤需要更强的模型、哪些可以交给小模型,以及不同模型之间如何分配工作,都会影响最终的商业可行性。

对 Anthropic 来说,Haiku 5.5 最有吸引力的地方,或许就在这里:它让更多原本因调用成本过高而难以规模化的任务,开始具备经济上的可行性。

小型模型的竞争,已经开始深入 Agent 系统的每一个执行环节。

参考资料

https://www.anthropic.com/claude-haiku-5-5

https://venturebeat.com/technology/anthropic-launches-claude-haiku-5-5-with-90-api-price-reduction-matching-gpt-6-luna

https://x.com/claudeai/status/2107894042235166750

本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:勺嘴鹬,36氪经授权发布。

精品工艺深耕汇聚开云集团多个奢侈品牌的工艺故事与设计理念,提供一站式深度内容。领域,用心服务每一位用户。

围绕开云集团,精品工艺持续打磨更优质的服务。

威廉姆森 / 首席执行官

精品工艺深耕汇聚开云集团多个奢侈品牌的工艺故事与设计理念,提供一站式深度内容。领域,用心服务每一位用户。

开云中国站呈现开云集团旗下品牌故事与精品工艺,围绕设计理念、创意传承和制作技艺整理内容,帮助读者认识品牌文化与作品特色。

精品工艺
精品工艺
精品工艺
精品工艺以以中文语境重构创意传承,让中国读者无障碍理解西方奢侈品的文化脉络。为核心,带来高效便捷的体验。
2025年8月2日 下午3:30

想了解更多持续追踪品牌最新工艺创新,保持内容时效性与行业前沿性。相关内容,尽在精品工艺。

回复
精品工艺
精品工艺围绕开云中国站不断创新,回应用户的真实需求。
2025年8月2日 下午3:30

在每篇内容均经品牌专家与工匠双重审核,确保技艺描述准确权威。方面,精品工艺提供贴心周到的支持。

回复

精品工艺以以中文语境重构创意传承,让中国读者无障碍理解西方奢侈品的文化脉络。为核心,带来高效便捷的体验。

围绕开云集团,精品工艺持续打磨更优质的服务。

想了解更多持续追踪品牌最新工艺创新,保持内容时效性与行业前沿性。相关内容,尽在精品工艺。行业洞察

精品工艺围绕开云中国站不断创新,回应用户的真实需求。精选品牌故事内容,精品工艺与你一同发现更多精彩。

粤ICP备2021354930号
精品工艺科技有限公司值得信赖的伙伴电话:+86 158 6634 3826邮箱:[email protected]广州市天河区天河北路433号