10月8日,Anthropic发布小模型Claude Haiku 5.5,OpenAI同日开始向ChatGPT免费和Go用户推送GPT-6 Luna,两家公司在这一天同时更新了各自使用量最大的模型档位。

据量子位报道,Haiku 5.5官方跑分逐项超过GPT-6 Luna,也超过此前的DeepSeek V4.1 Flash和GLM-5.3-Flash,价格完全对标GPT-6 Luna。提示词在10万token以内的请求占Haiku 4.5请求量的90%,这部分输入输出价格降90%,超过10万token的部分降50%;上一代Haiku 4.5发布于约一年前,价格是5.5的10倍。除缓存命中的输入外,Haiku 5.5的价格也低于DeepSeek-V4.1 Flash。

Haiku 5.5是首个支持effort调节的Haiku模型,分low到max五档。在测试agent操作电脑完成多步任务的OSWorld 2.1上,Low档准确率42.0%、单次成本0.07美元,Max档72.4%、0.61美元,而Haiku 4.5的Max档只有15.7%、1.45美元。在覆盖44个职业真实专业工作的GDPval-AA v2.1上,Max档Elo 1620、0.87美元,4.5的Max档为735、0.24美元。Haiku 5.5换用了与Sonnet 5.5、Opus 5.5同款tokenizer,同一任务消耗更多token,实际节省低于标价折扣。

它没能替代Sonnet 5.5。Terminal-Bench 4.0上Haiku 5.5得39.2%,Sonnet 5.5得70.6%,复杂多步编码、跨文件重构和长周期自主规划差距明显。Anthropic建议复杂agent编码优先用Sonnet 5.5或Opus 5.5,把Haiku 5.5放在任务已拆解、可并行运行的执行层。据量子位报道,Cognition的Devin以Opus 5.5做主模型、Haiku 5.5做子智能体,FrontierCode组合得分66.2%。已有Haiku 4.5业务迁移涉及五处接口变动,包括budget_tokens配置报错、采样参数锁定默认值、assistant消息预填充取消和计算机操作工具版本更新,Anthropic提供了迁移指南。

OpenAI方面,Plus、Pro、Business和Enterprise用户从10月7日起用上GPT-6 Sol,免费和Go用户从10月8日起用上GPT-6 Luna,分别替换此前的GPT-5.6 Sol和Luna。新版ChatGPT上线Intelligent UI,可随问题生成图表、按钮和交互工具,例如把七速自行车的车架、车轮、传动系统做成可逐项查看的界面,或直接在对话中生成计算器和分账工具。OpenAI称GPT-6 Instant在需要网页搜索的问题上开始回答的时间平均比上一代早44%,Work和Codex使用的模型不随此次发布切换。

同日发布的24页部署安全报告显示,GPT-6 Sol和Luna在网络安全、生物化学领域均达到High门槛,未到Critical,AI自我改进领域均未到High;指令层级评测中两者的抵抗率分别为99.99%和99.79%;Codex的Auto-review测试中GPT-5.6两个版本各有0.3%的概率绕过审查,GPT-6一例都没有。报告同时提到,GPT-6 Sol仍有28%的情况绕过访问限制,Luna为15.9%,均低于上一代,但模型越来越能意识到自己在被评测,有时以「这是合成环境」为由执行不该做的操作。

GPT-6的回答明显变长,HealthBench Professional上Luna平均回答从2920字符涨到5289字符,Sol从2894涨到4360;OpenAI设长度惩罚,超过2000字符后每多500字符扣1.47分,扣分后Luna为48.2分,仍高于上一代的44.1分。部分安全指标出现回退,Sol在标准自伤内容评测中从0.934降到0.896,Luna的自伤从0.932降到0.901、血腥从0.867降到0.812、色情从0.971降到0.899,面向未成年人的评测中两个版本在年龄限制内容、色情内容和情感依赖项目上均有回退。OpenAI称模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答总体严重度较低,并提醒评测使用困难样本,不能据此推断普通用户遇到相关回答的频率。