事件概述

2026年6月12日,OpenAI o1推理模型核心缔造者、被业内称为「AI推理之父」的Noam Brown发布个人长文《大规模推理计算的启示》,直接炮轰当前全球所有AI跑分排行榜的可信度,抛出核心论断:当前公开的所有AI模型benchmark信息「基本上是错的」。

作为主导OpenAI o系列推理模型研发的核心人物,Noam Brown的论点直指当前模型评估体系的底层缺陷:所有公开排行榜都刻意忽略了「推理预算」这个核心变量——同一个AI模型,给它1美元的算力预算让它处理任务,和给它1万美元的预算让它充分「思考」,最终产出的结果质量、任务准确率天差地别,但所有公开的benchmark表格都不会披露模型拿到对应分数实际消耗了多少成本。

文中给出的典型例证直接戳破了行业默认的潜规则:OpenAI GPT-5.4 Pro的官方定价为输入30美元/百万token、输出180美元/百万token,而迭代版本GPT-5.5的定价仅为输入5美元/百万token、输出30美元/百万token,成本仅为前者的1/6到1/4。在传统的固定推理预算benchmark表格中,GPT-5.5的综合表现仅比GPT-5.4高不到10%,看起来提升十分有限;但如果控制相同的推理预算,GPT-5.5在网络安全评估、复杂代码调试等专业任务上的表现会大幅拉开与GPT-5.4的差距。

更极端的案例来自超长上下文测试:在MRCR v2(多轮上下文推理基准测试)的100万token长度测试项中,GPT-5.5拿到了74.0%的准确率,而GPT-5.4仅拿到36.6%,性能直接翻倍,而这个测试维度在几乎所有主流公开benchmark表格中根本不存在。

Noam Brown在文末呼吁全行业尽快建立「每美元性能(Performance per Dollar)」和「每token质量(Quality per Token)」的标准化评估框架,从成本效率的维度重新定义AI模型的真实能力。


详细解读

推理预算:被所有排行榜刻意忽略的核心变量

要理解Noam Brown的炮轰为何一针见血,首先要明确大模型推理的底层逻辑和传统软件的本质区别:传统软件的运行结果是确定性的,相同的输入必然产出相同的输出,性能只和代码效率、硬件配置相关;但大模型的推理过程是「弹性」的,它可以根据投入的计算资源(即推理预算,通常对应该任务消耗的token数、算力成本)调整思考深度,最终结果的准确率、完成质量会随着推理预算的提升而显著提升。

比如处理一道复杂的数学推理题,给模型1美元的预算,它可能只做一轮直接输出结果,准确率可能只有30%;给10美元的预算,它可以做多轮思维链推导、自我验证、甚至调用工具反复迭代,准确率可能提升到80%;给100美元的预算,它可以将任务拆解成多个子任务分别推理、交叉验证,准确率可能提升到95%。

但当前几乎所有公开排行榜,包括LMSYS Chatbot Arena、Hugging Face Open LLM Leaderboard、以及各家厂商官方发布的benchmark对比表,全部采用「固定推理预算」的测试方式:给所有参测模型设定完全相同的token生成限制、完全相同的采样参数,测出来的分数只能反映「固定成本下的最优表现」,完全无法体现模型在更高推理预算下的能力上限,也无法反映拿到对应性能实际需要花费的成本,因此Noam Brown才直言这些排行榜的信息「基本上是错的」。

GPT-5.4 vs GPT-5.5的定价陷阱:你看到的benchmark可能是「降维打击」后的结果

为什么GPT-5.5的定价比GPT-5.4低了数倍,但在传统benchmark上的表现看起来仅强了不到10%?本质是传统benchmark的推理预算设置太低,根本无法发挥GPT-5.5的架构优势。

GPT-5.5的核心优化方向是推理效率,它可以在相同的低推理预算下,比GPT-5.4产出更高质量的结果,但优势并不明显;一旦放开推理预算限制,允许模型根据任务难度动态分配计算资源,GPT-5.5的性能提升幅度会远高于GPT-5.4。比如在网络安全漏洞挖掘的专项评估中,当推理预算限制为1000token时,GPT-5.5的漏洞识别准确率仅比GPT-5.4高5个百分点;但当推理预算放宽到10000token时,GPT-5.5的准确率比GPT-5.4高出了27个百分点,这个差距在传统固定预算的benchmark中完全无法体现。

更关键的是成本维度的差异:GPT-5.5的定价仅为GPT-5.4的1/6,意味着花费相同的成本,用户可以调用GPT-5.5的推理次数是GPT-5.4的6倍,相同预算下可完成的任务量是GPT-5.4的6倍,而传统benchmark完全不会披露这类性价比信息,用户很容易被表面的分数误导。

MRCR v2百万token测试:被隐藏的核心能力维度

此次文中提到的MRCR v2测试,是当下少数支持100万token超长上下文的基准测试集,主要评估模型在超长文本输入下的推理、记忆、信息提取、逻辑关联能力,而这个能力维度是绝大多数传统benchmark的盲区。

当前主流公开benchmark的上下文长度最多仅支持12.8万token,大量仅支持8k、32k上下文,完全无法测试模型在百万token级别下的能力表现。但在实际业务中,超长上下文处理能力是大量专业场景的核心需求:比如法律合同审查需要输入上百页的合同文本、代码库分析需要输入整个项目的代码文件、长视频内容总结需要输入数小时的字幕文本,这些场景都需要模型具备稳定的百万token级别上下文处理能力。

GPT-5.5在MRCR v2测试中拿到74.0%的准确率,而GPT-5.4仅拿到36.6%,本质是两个模型在长上下文推理架构上的代际差异,而这个差异在普通benchmark中完全看不到,进一步印证了单一跑分体系的误导性。

token经济学与模型能力的关系曲线:不是越贵越好,而是边际收益递增

Noam Brown的文章中还提到了一个被行业忽略的核心规律:模型的能力和token成本之间并不是线性关系,强模型的推理预算边际收益远高于弱模型。

所谓「边际收益」,是指每多投入1美元的推理成本,能换来的模型性能提升幅度。对于弱模型来说,推理架构的优化程度低,增加推理预算带来的性能提升会越来越小,甚至出现边际收益递减;但对于强模型来说,架构优化更充分,更擅长利用额外的计算资源做深度思考,增加推理预算带来的性能提升会持续处于高位,边际收益远高于弱模型。

这意味着评估模型价值不能只看「固定预算下的单一分数」,更要看「推理预算-性能」的关系曲线,这条曲线下的面积才是模型真正的商用价值。而当前的benchmark仅测试了曲线上的一个点,完全无法反映整条曲线的形态,对用户的参考价值极低。

Noam Brown提出的新评估框架:Performance per Dollar与Quality per Token

针对当前评估体系的缺陷,Noam Brown呼吁行业建立两个核心的标准化评估指标:

  1. 每美元性能(Performance per Dollar):计算方式为「任务准确率 / 完成该任务消耗的美元成本」,单位为「每花费1美元能拿到的任务准确率/完成量」,这个指标可以直接衡量模型的性价比,用户花费相同的成本能买到多少性能一目了然,彻底解决「高分模型用不起」的问题。
  2. 每token质量(Quality per Token):计算方式为「任务效果提升幅度 / 消耗的token数」,单位为「每消耗1个输出token能带来的任务效果提升」,这个指标可以衡量模型的推理效率,判断模型是否存在无意义的思维链冗余、是否会「过度思考」浪费计算资源,避免用户为无用的token付费。

Noam Brown建议将这两个指标和传统准确率、上下文长度、响应速度等指标共同作为模型评估的核心维度,要求厂商在发布benchmark成绩时必须同步披露对应的推理预算、成本消耗,才能让用户拿到全面、真实的模型能力信息。

对当前主流排行榜体系的冲击:刷榜时代即将结束

当前AI行业的「刷榜」潜规则已经存在多年:大量厂商为了拿到好看的benchmark成绩,会针对测试集做定向优化、甚至微调模型,拿到远高于实际可用水平的分数,而固定推理预算的测试方式让这种「应试优化」变得十分容易。

如果Noam Brown提出的新评估框架落地,厂商将再也无法靠刷榜忽悠用户:所有benchmark成绩必须同步披露推理预算、成本消耗、不同推理预算下的分数波动,针对测试集的定向优化将直接暴露在成本指标下——比如某模型在固定预算下拿到了高分,但每美元性能远低于同梯队模型,用户可以直接判断该模型是「刷榜产品」,没有实际商用价值。

这对当前的benchmark行业也会产生巨大冲击:传统仅测试固定预算下准确率的benchmark将失去参考价值,必须升级测试框架,纳入成本效率、动态推理预算等维度,才能继续在行业中存活。


行业影响

Noam Brown的这篇长文发布后,已经在AI行业引发巨大反响,其带来的影响将覆盖模型厂商、企业用户、投资机构等全产业链环节:

  1. 模型厂商的营销逻辑彻底改变:过去靠刷榜、发布片面benchmark成绩做营销的方式将不再可行,厂商必须披露完整的成本、推理预算信息,性价比将成为新的核心竞争力,那些仅擅长刷榜但实际推理成本过高、效率过低的模型将逐渐被市场淘汰。
  2. 企业AI落地的成本将大幅降低:过去企业选型时仅看benchmark分数,经常买到「高分低能」的模型,落地时出现成本高、效果差的问题;新的评估体系落地后,企业可以根据自身的业务场景、成本预算选择最合适的模型和推理配置,避免为无用的性能支付过高成本。
  3. AI投资的逻辑将回归理性:过去投资人评估AI创业公司的价值时,仅看benchmark排名、模型参数规模,经常出现高估的情况;未来投资将更关注模型的token经济学指标、每美元性能、实际落地案例的成本效率,真正有技术实力的团队将获得更符合其价值的估值。
  4. AI落地速度将大幅提升:过去大模型落地难的核心原因之一,就是评估体系和实际需求脱节,用户拿到的高分模型实际用起来要么效果差、要么成本高到无法承担;新的评估体系将推动模型能力评估从「刷榜导向」转向「实用导向」,加速大模型在各行各业的落地。

对开发者的意义

对于普通开发者、AI应用创业者来说,Noam Brown的文章也给出了非常明确的行动指引:

  1. 调用API时必须做成本优化:不要一味追求高推理预算,要根据任务难度动态调整推理预算:简单分类、信息提取任务给低预算,复杂推理、代码生成任务给高预算,平衡成本和效果,计算每美元性能,找到最优的成本效率平衡点。
  2. 模型选型不要迷信跑分:不要被厂商宣传的benchmark高分忽悠,要自己测试不同推理预算下的模型表现,计算每美元性能、每token质量,选择最适合自己业务场景的模型,而不是分数最高的模型。
  3. 应用设计要纳入成本考量:开发AI Agent、智能应用的时候,要设计推理预算的动态分配机制,根据任务的复杂程度、用户的需求层级动态分配计算资源,避免无意义的成本浪费,提升应用的整体性价比。
  4. 提前关注新的评估指标:未来模型能力评估将越来越多地纳入成本效率维度,开发者要提前了解Performance per Dollar、Quality per Token等指标的计算方式,在做技术选型、性能优化时将这些指标作为核心参考,避免被行业趋势甩在后面。

总结

Noam Brown的这篇《大规模推理计算的启示》,本质上是给整个AI行业敲了一记警钟:在大模型进入规模化落地阶段之后,单纯的跑分已经没有任何实际意义,成本和效率才是决定模型能不能真正创造价值的核?

从2024年大模型行业进入「落地元年」开始,行业就一直在喊「大模型落地难」,很大一部分原因就是传统的评估体系和实际业务需求完全脱节:用户拿到的高分模型要么实际用起来效果差,要么成本高到无法承担,根本无法创造商业价值。

此次Noam Brown提出的新的评估框架,如果能推动行业形成共识并落地,将彻底改变AI模型评估的底层逻辑,让模型的能力评估从「刷榜导向」转向「实用导向」,真正推动大模型从「实验室玩具」变成「生产力工具」。对于开发者和企业来说,也要尽快转变认知,不要再迷信单一跑分,学会从成本、效率、场景适配度等多个维度评估模型,才能真正选到适合自己需求的AI能力,在大模型的浪潮中拿到真正的红利。


📌 作者说:如果这篇文章对你有帮助,欢迎点赞👍收藏📁关注🔔,你的支持是我持续创作的动力! 💬 有问题欢迎在评论区讨论,我会一一回复。

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐