Anthropic 发布 Claude Opus 5.5,这是 Claude 5.5 系列的首款模型。Anthropic 称,新模型在多数任务上的表现与 Claude Fable 5.1 相当,但默认设置下的典型任务成本较上一代 Opus 5 降低 40%,输出速度提升超过 30%。发布约两小时后,OpenAI 也推出了 GPT-6 Sol 和 GPT-6 Luna,GPT-6“宇宙”再添新成员。

成本降四成、速度提三成,编程测试领跑
在官方公布的 9 项测试中,Opus 5.5 有 7 项成绩领先 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。其中三项编程测试(Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0)均拿下最高分,分别为 66.4%、54.4% 和 57.8%;但在业务流程和科研 Agent 测试上仍落后于 GPT-6 Astra。第三方机构 Artificial Analysis 的 Intelligence 榜单上,Opus 5.5 以 58 分位列第一,领先 Fable 5.1 与 GPT-6 Astra 的 53 分。

价格方面,Opus 5.5 每百万输入、输出 Token 分别收费 4 美元(约 26.8 元)和 20 美元(约 134 元),较 Opus 5 下调 20%,缓存读取价格下降 60%。Claude Code 与 Claude Platform 还提供快速模式,速度最高达普通模式 2.5 倍,相应收费为输入 8 美元、输出 40 美元每百万 Token。Anthropic 同时提高了多个付费套餐的五小时使用额度,并向订阅用户提供一次可自选时间的额度重置机会。
9.5 小时改写 HAProxy,长任务成卖点
Opus 5.5 的升级重点明显偏向长时间任务。Anthropic 称,一名早期测试者用不到一天完成了涉及 68 万行代码的迁移;对 20 万行代码库的审查与修复,Opus 5.5 用时不到 3 小时,而 Opus 5 需超 20 小时、消耗 Token 为前者 2.5 倍。
内部测试中,双方被要求将负载均衡软件 HAProxy 从 C 语言改写为 Rust,改写版本均通过几乎全部回归测试——Opus 5.5 用时 9.5 小时、成本比 Fable 5.1 低 51%。财报研究测试更考验“零编造”:模型只能在难找的网页副本中检索并撰写季度业绩报告,自动评分逐一核对数字与引语。结果 Opus 5.5 生成的 18 份报告中 16 份达标,Fable 5.1 与 Opus 5 均未通过。知识工作方面,其在 GDPval-AA v2.1 取得 1846 分,高于 Fable 5.1 的 1735 分。

写作与沟通上,Opus 5.5 被调整为优先呈现关键信息、回答更简洁;安全评估中,其尝试突破隔离边界的频率较 Opus 5 或 Claude Mythos 5.1 降低约 85%,在 Gray Swan 提示词注入测试中攻击成功率与 Fable 5.1 并列最低。不过部分专业任务仍受限制——大多数网络安全任务会被转交 Opus 4.8 处理。
Opus 5.5 已上线 Claude 及亚马逊云科技、谷歌云、微软 Azure 等平台,开发者可通过标识 claude-opus-5-5 调用,并继续提供零数据保留选项。Claude Sonnet 5.5 与 Haiku 5.5 计划在未来几周推出。
VIP会员