当地时间9月22日,OpenAI与Anthropic在相隔约一个半小时的时间内先后发布新模型。
便捷配资炒股与此前频繁以刷新能力上限作为主要卖点不同,此次两家公司都将重点放在了降低推理成本、提升速度以及扩大实际使用规模上。
OpenAI当天发布GPT-6 Sol和GPT-6 Luna,称两款模型继承了GPT-6 Astra的部分能力,并通过改进缓存和推理效率降低成本。官方表示,两款模型的API价格较GPT-5.6此前的促销价格下降50%。
目前GPT-6 Astra仍是OpenAI用于最复杂推理和编码任务的旗舰模型,Sol定位于复杂编码和Agent工作流,Luna则面向成本敏感、高调用量的任务。
OpenAI称,GPT-6 Sol和Luna在智能、对齐、编码、计算机使用等方面均较GPT-5.6对应产品有所改进,且API价格永久下降50%,从而使更多应用场景具备经济可行性。

约一个半小时后,Anthropic发布Claude Opus 5.5。这是Claude 5.5系列的首款模型。Anthropic称,Opus 5.5在大多数任务上的表现达到Claude Fable 5.1水平,但运行成本较上一代Opus 5降低40%;输入和输出token(词元)价格分别下降20%,缓存读取价格下降60%,生成速度提高超过30%。
两家公司并非停止追求模型性能。Anthropic公布的测试数据显示,Opus 5.5在Terminal-Bench 4.0等编程测试中超过Opus 5和Fable 5.1,并在部分测试中超过GPT-6 Astra。Anthropic承认,随着模型能力接近,基准测试分数之间的微小差距越来越难以直接代表真实使用体验。
但来自开发者社区的反馈声音褒贬不一。GPT-6 Sol发布后,AI编程社区创始人韦斯・温德(Wes Winder)质疑称,Sol在DeepSWE测试中的表现低于GPT-5.6 Sol,新模型并非在所有指标上都实现提升。对此,OpenAI核心产品负责人蒂博・索蒂奥(Thibault Sottiaux,Tibo)回应称,Sol是“各方面都更好的模型”,重点在于综合体验和效率,而不是追求单项基准的极限成绩。
对于这个说法,温德并不买账,他称:如果高端产品反而更差,为什么整体性能会更好?在基准测试中表现出色并不代表什么,但在基准测试中表现糟糕却意义重大。

这一争论也反映出,当模型能力逐渐逼近,单纯刷新榜单已经越来越难以解释产品价值,实际任务成本开始成为模型竞争的重要指标。
此次两家公司降价提供更高性能模型的背后,是行业趋势的变化。安全的重要性正越过模型性能,同时中国开源模型凭借更优性价比占领更多的市场份额,倒逼美国模型厂商在数月前也开始走性价比路线。
放慢前沿开发并不意味着停止模型迭代,头部公司仍在持续推进模型能力,只是竞争重点从过去单纯争夺“谁的模型更强”,逐渐转向谁能以更低成本、更快速度,把接近前沿水平的能力部署到更多真实任务中。
这意味着,AI模型行业的下一阶段竞争不再只是能力上限的竞争,而是能力、成本、速度和规模化应用效率的综合竞争。对于开发者和企业而言,模型是否能够以更低成本完成一次编程、研究或Agent任务,比随时会被推翻的榜单分数更为重要。
举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。如需获得授权请联系第一财经版权部:banquan@yicai.com 文章作者
吕倩
原创精选 相关阅读
AI进化速递丨摩尔线程打通Protenix-v2全链路AI进化速递丨摩尔线程打通Protenix-v2全链路
8980 09-24 20:47
AI是现在、量子是未来!陆家嘴金融沙龙第32期热议资管下一代基础设施建设路径量子计算作为前沿下一代计算技术,开始从实验室走向金融场景试点。
3493 09-24 18:40
AI进化速递丨智谱推出GLM-5.3-FlashXAI进化速递丨智谱推出GLM-5.3-FlashX
元股证券:ygzq.hk
17629 09-18 20:30
AI进化速递丨昇腾960超节点明年三季度上市AI进化速递丨昇腾960超节点明年三季度上市
10096 09-17 20:41
OpenAI披露六起模型“错位”事件,发布系统性披露框架此次报告仅为初步披露元股优配,未来OpenAI会持续发布符合框架的案例。
9 13165 09-17 09:55 一财最热 点击关闭配资管理监察网 - 元股证券提示:本文来自互联网,不代表本网站观点。