外挂补不了模型智商,《苦涩的教训》再次上演。


这两天在 X 上,一款蹭 DeepSeek 热度的 Harness 工具被打假了。


这是一个名为 J-Space Cognition Suite 的开源项目,它声称无需修改模型权重,仅靠 DeepSeek V4 Flash 加其精巧的外部 Harness,就能在 Agent 任务中追平 GLM-5.3;若换成 DeepSeek V4 Pro,甚至能直接超越Claude Fable 5。同时速度提升 2.53倍,Token 效率提升 2.21倍。


如果这是真的,这无疑是 AI 工程史上的奇迹。这意味着J-Space能用几十分之一的成本复刻顶级大模型的效果。


然而,泡沫破裂的速度比想象中更快。


GitHub 用户 GoForceX 严格按照项目说明,使用 Terminal Bench 完成了独立复测,最终结果与宣传完全相反。加入 J-Space 后,基准测试分数不升反降,Token 消耗量明显增加,推理速度也比原生模型更慢。


当社区进一步要求公开完整原始实验数据时,作者承认数据 "确实夸张",却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


几乎在同一时间,Open AI 思维链(CoT)核心发明者 Jason Wei  在 X 上发布了一篇长文,精准戳破了 "小模型 + 万能工具" 的幻想。


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


他用自己学羽毛球的经历做比,“在球场上,我就像一个 1B 参数的认知核心。教练教的每个击球动作我都能做,但要在高速回合里把架拍、转体、击球点、随挥这些要点全部串联起来,几乎要耗尽全部精力。这跟那些练了上万次、将动作化为肌肉记忆的专业选手完全不是一个级别。”


Jason Wei隐喻的正是“小模型+ 工具”与“大模型内化能力”的本质区别。他强调“模型不依赖外部工具,自然且快速地完成任务,这件事至关重要”。一旦承认高维认知应该以内生的方式处理,那么 1B、甚至 10B 的核心显然都是不够的。


01

J-Space 神话切中的行业焦虑


J-Space之所以能在 48 小时内引发全行业狂欢,在于它精准地切中了当前 AI 产业的两大行业焦虑:大模型太贵,算力烧不起怎么办?大模型要落地,端侧设备太弱怎么跑?


事实上,业内一直在寻找一种可能,小模型 + 工具也能干掉顶级大模型。


AI大牛吴恩达正是这一路线支持者之一。他曾多次在公开演讲中展示数据:用版本更早、参数量更小的 GPT-3.5,搭配包含反思、工具调用、任务规划的迭代式 Agent 工作流,在很多基准测试上的表现能够超越当时最强的 GPT-4。


微软 Phi-4、Mistral 等小模型,也靠着高质量数据训练,在代码、数学等垂直任务上,以 3B 到 14B 的体量击败过上一代千亿参数模型。这让很多开发者产生了一种错觉:Scaling Law 的边际效应正在递减,只要工具配得好,小模型就能逆袭。


今年 7 月,卡内基梅隆大学发布的一篇论文《Better Harnesses, Smaller Models》,更是把这种讨论推向了高潮。


论文用详实的测试数据提出,经过高度优化的 Harness 框架,小模型在特定任务上可以恢复大模型 90% 以上的性能,而成本却可以忽略不计。


在 “Scaling 撞墙论” 此起彼伏、端侧 NPU 刚刚普及的当下,这场围绕 "小模型 + 工具能否干掉顶级大模型" 的集体讨论成为 AI 行业最核心的路线之争之一。毕竟,行业急需一个能把“高智能”和“低成本”同时落实的工程解法。


02

小模型+工具三大硬伤:

速度、深度、可靠性


Jason Wei 用他多年的技术直觉,直接点破了 "小模型 + 万能工具" 幻想的三个软肋。


最直观的差距是速度。


你问一个常识问题,肯定希望 AI 立刻给出答案,而不是等它先去搜三五个网页、再花十几秒整理归纳。大模型把知识内化在数万亿参数的连接中,端到端直接输出,延迟最低。


而小模型 + 工具的路径,注定要经历“判断是否调用工具→构造查询指令→等待工具返回→筛选有效信息→整合最终答案” 的完整链路。每多一步,延迟就增加一截。如果是多步推理任务,工具调用还要反复进行,耗时更是指数级上升。


J-Space 宣称的 “速度提升 2.53 倍” 本身就违背基本逻辑,Harness 本质上是在模型外面加了一层控制逻辑,每一轮推理都要多做判断、多走流程。它怎么可能反而比原生模型更快?


社区复测的结果验证了这个常识:加装 J-Space 后,Token 消耗更多,推理速度更慢。因为所谓的 "外部控制" 本身就需要消耗计算资源和 Token 预算。


比速度更本质的差距,是思维的深度与归纳能力。


很多人以为,大模型知道的东西网上都有,让小模型去搜就行了。但 Jason Wei 举了一个例子:如果你问 "大家对香巴拉音乐节的普遍看法是什么",小模型可能只翻热帖下面的前三条评论,而大模型却能像一个真正的业内专家,在看完几万条各种各样的评价后,给你提炼出一个客观、综合的总体印象。


这就是大模型预训练的真正价值,它可以在海量数据中,把海量的知识消化成了自己的见识和常识。这种对世界的洞察力,也是我们要追求的终极智能之一。


J-Space 这类 Harness 工具,恰恰在这个层面最无力。它可以优化搜索路径、规范调用格式,但它没法凭空赋予小模型更高维的抽象归纳能力。


第三重差距,还在于处理复杂长任务的可靠性上。


Jason Wei 提到,在复杂的长周期任务中,每一步的微小误差,会像滚雪球一样越滚越大。到最后,整个任务会彻底跑偏甚至崩溃。


大模型因为有全局的语义理解和自我纠错能力,能感知路线是否偏移,并对局部偏差进行修正。但小模型本身元认知能力就弱,再加上它每干一个活儿都要层层转接外部工具,这种“现学现卖”的模式,出错的概率更高。


J-Space 复测中出现的 “性能小幅下降”,就是典型表现。复杂的外部 Harness 不仅没帮上忙,反而把本就不强的小模型绕得更混乱。


说到底,工具只是放大器,不是发动机。


在限定 Benchmark、限定提示词、人工筛选样本的条件下,小模型+工具能跑出漂亮的数字,但在真正的开放任务、长任务、模糊约束、多工具协作的真实场景呢?内化的本能,永远比临场查手册更快、更稳、更准。


03

从工程派到规模论,

Jason Wei 的认知转变


很有趣的一件事是,Jason Wei 当初也是“大模型规模论”的怀疑者,而今天,他坚定站在 "大模型不可替代" 这一边。


他的认知转变之路,几乎就是过去五年大模型行业发展的缩影。


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


2021年时,Jason Wei 在 Google Brain 还是一个典型的工程派他和团队发现,只要在提示词中给出逻辑推导的示例,让大模型学会“把思考过程一步步写出来”,模型的推理能力就会大幅提升,这就是后来改变行业的“思维链(Chain-of-Thought)”。


那段时间,他沉迷于通过精巧的 Prompt 设计、指令微调来挖掘模型潜能,试图用轻量化的工程手段撬动更大的智能产出。


但随着研究深入,两个关键发现彻底改变了他的看法。


第一个发现是涌现能力。在他那篇里程碑式的论文《Emergent Abilities of Large Language Models》里,他将“涌现能力”定义为“An ability is emergent if it is not present in smaller models but is present in larger models.”(即小模型不具备而大模型具备的能力),这个定义已成为模型扩展定律研究的经典基石。


他用数据证明了,很多高级能力,比如三位数加法、多步推理,在小模型上无论你怎么调提示词、怎么加外挂,正确率都几乎是零。但一旦参数规模跨过某个临界点,大约 100B 量级,许多高阶能力开始涌现。


这意味着,小模型没有高阶智商。


第二个发现是思维链只在大模型上有效。在思维链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中,很多人只记得思维链能提升推理能力,却忽略了论文里一个关键结论:在小模型上使用思维链,不仅不会提升性能,反而会因为引出错误的中间推理步骤而导致成绩下降。


因为逻辑推理本身,就是规模的产物。


这两个发现彻底堵死了 "小模型靠精巧 Prompt或者Harness 实现高阶推理" 的幻想。


在 OpenAI 期间,他作为核心成员参与了 o1 系列等前沿推理项目的研发,对大模型内生能力的价值有了更深的理解。他在一篇博客里写道:“想让大模型超越人类老师,就必须用强化学习,去逼出它内生的高阶思考能力。”


04

DSPy 框架之父的数学呼应


Jason Wei 的观点也得到了另一位技术大牛的呼应。


DSPy 框架的作者,MIT 助理教授Omar Khattab在 Jason 发推后不久,从学术和系统层面的视角,再次佐证了“内化优于外挂”这一核心判断。


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


他用底层数学逻辑,精准指出了两者的计算差异。


他认为大模型使用的是注意力机制它将所有上下文完整保留在显存中,每次以“全知视角”重新审视所有信息。这对应的正是 Jason 说的大模型的“内化能力”


而小模型+工具本质上是一种压缩与递归它必须把复杂的外部世界塞进工具的输入输出里,在这种一轮一轮强行“信息脱水”和往下传递的过程中,大量高维信息丢失了。


Omar 指出,“虽然我们在工程上可以用各种‘外挂’来模拟出智能的表象,但在数学层面上,靠一轮轮压缩的‘递归’,永远无法完美模拟‘注意力机制’对全局的掌控力。”


不仅如此,Omar 团队还在其重磅论文Machine Studying中,重新定义了什么是 AI 的“专业能力”他们认为,判断一个系统专不专业,不该看它闭卷考试拿了多少分,要看它用多少推理计算量,能换来多高的准确率。


对于新手型 Agent 来说,它必须靠疯狂搜索、反复试错,消耗大量 Token 才能勉强答对;而专家型 Agent 搜索次数少、命中率高,在低计算预算下就能有很好的表现。


05

《苦涩的教训》的回响


这场争论走到最后,终究绕不开 AI 领域那个经典之作,来自强化学习教父、人工智能先驱 Rich Sutton 的《苦涩的教训》


“人类在 AI 领域的所有精巧工程设计,最终都会被绝对的算力和数据规模碾得粉碎。”


从这个视角来看,小模型加工具本质上就是一种精巧工程,试图用人类擅长的工程链路去弥补模型本身容量的不足,而大模型则是纯粹规模定律的胜利。


回顾 AI 发展史,这样的故事已经上演过无数次。


七十年代专家系统盛行,人们相信把人类专家的知识写成规则就能造出智能,最终走向失败;九十年代到 2010 年代,自然语言处理依赖精心设计的特征工程与统计模型,语言学家们一点点打磨系统性能,直到深度学习出现,端到端的大规模训练直接重构了整个领域;2010 年代末知识图谱再度兴起,人们以为结构化的实体关系能让 AI 真正 “理解” 世界,结果预训练大模型证明,从海量数据中自发学到的隐式知识,远比人工构建的结构化知识更强大。


每一次,人们都试图用巧思走捷径;每一次,最终胜出的都是更简单、更吃算力的方法。


既然苦涩的教训一再应验,为什么人们还是一次次地投入 "工程派" 的怀抱?因为太贵了。万亿参数模型的训练成本是天文数字,不是每家公司都能承担得起,而且每个日常场景也并不都需要顶级智能。


比如开发者 Matthew Auburn 曾公开表示,“对于小模型,Harness 就是一切”。他认为在商业场景里,90% 的任务只需要 60 分的智能 + 100 分的执行。性价比才是王道,顶级智能反而是浪费。


也有开发者提出了更折中的未来方向:行业最终会走向一种中间状态,核心认知能力会被拆分为多个十亿级的专家模型协同工作,就像混合专家(MoE)架构的延伸。


这些专家模块更灵活、可替换、可审计,而不是现在这样用一个粗放的 Harness 试图包打天下。


Harness 神器 J-Space 造假案背后,思维链作者暴论,小模型 + 工具干不掉顶级大模型


事实上 Omar Khattab 本人就是 Harness 优化的重要推动者,他的 DSPy 框架、Meta-Harness 研究,本质都是在提升工具链的自动化水平,他不认为 Harness 能替代模型本身的能力,却从未否认 Harness 的工程价值。


参考链接:

https://x.com/maxforai/status/2089734195002445912?s=46

https://x.com/_jasonwei/status/2089429555371024577?s=46

https://x.com/lateinteraction/status/1909011076605518124


文章来自于"AI科技评论",作者 "高允毅"。