经济学里的杰文斯悖论认为:一种资源的使用效率越高、单位成本越低,它的总消耗量往往不降反升。当前,大模型行业正被这个定律演绎得淋漓尽致——模型越便宜、速度越快,调用量就越呈现爆发式增长。
而最近席卷硅谷的新物种 Jev,与杰文斯悖论同名的“大模型”,正把这套攻势推向极致。
它拒绝为你写诗、拒绝跟你探讨人生,甚至连一句完整的废话都不屑于生成。但就是这样一个冷酷的“哑巴”模型,发布不到 48 小时,就在 X 上引发了超 3000 万的狂热围观,吸引了 2.5 万名开发者涌入内测;上线大模型托管平台 Vercel 的 24 小时后,近 13% 的付费团队火速接入——这个渗透速度,是当年 GPT-4 的两倍。

天下武功,唯快不破。Jev 的杀手锏亦是如此:极速,且极度便宜。作为前 OpenAI 核心研究员、RLHF 技术的共同发明者,Jev 创始人 Diogo Almeida 甚至放出豪言:“下一个时代并不属于 Claude Code 这种辅助工具,Jev 才是未来!它比通用模型快 200 倍,便宜 400 倍,而且零幻觉。这将是继 RLHF 之后的 next big thing。”
从毫秒级响应的浏览器插件,到高频执行的链上交易决策,再到每秒 10 次决策、吊打人类玩家的《毁灭战士》的通关外挂,开发者围绕 Jev 打造的应用案例呈井喷之势。
然而,面对这样一个估值一夜之间飙至 2 亿美元、却至今将训练方案与底层权重捂得严严实实的“黑箱”,业界的好奇心与质疑声也达到了高潮:它到底是模型架构革命,还是被营销包装的“分类器”(Classifier)?

开发者把 Jev 接进 Monad 链上交易系统,模型每 0.3 秒即可读取一次盘口并完成一次买卖决策
就在昨日上午,国内人工智能企业 APUS(麒麟合盛)旗下 AI 实验室,公开了全球最早一批针对 Jev 的独立开源复现成果,并将其封装为开箱即用的 Agent Skill fast-browser-use。该项目支持纯本地模型离线执行,横跨 macOS、Linux、Windows 三大桌面与服务器操作系统,甚至无需独立 GPU,在普通 Mac 和 PC 上也能本地跑通。

目前,该项目完整代码已通过 MIT 协议向社区开放 (https://github.com/APUS-AI-Lab/fast-browser-use)。

张旭博士,清华大学本硕博连读,工学博士,APUS AI 首席科学家
笔者第一时间联系到了该项目的负责人——APUS AI 首席科学家张旭博士。我们围绕Jev 的底层技术逻辑和路线、APUS 的复现与改造逻辑,这类快速决策模型的应用潜力,以及 Agent 未来的“快慢分工”趋势等话题进行了详尽探讨。
准确来说,张旭团队并没有拿到 Jev 的模型权重、完整架构和训练方法;而是通过公开资料和实际输入输出反推其工作机制,基于 Qwen3.5 系列、Google Gemma 系列等开源模型还原了 Jev 最核心的工作流,并在推理速度上实现了对标。
开源当天(9 月 20 日)上午 APUS 公布首轮结果:真实浏览器任务里,维基百科检索约 18 秒完成,表单填写、站内跳转等更短链任务则在数秒内完成,全程无需调用云端模型;下午采访,张旭团队把测试迁移到了RTX PRO 6000,单次决策时间压缩到了 79 毫秒,与Jev 响应时间 70~500 毫秒成功看齐。
他还透露,其内部自研模型可实现更小 9B、4B 参数规模复现 Jev 的性能,并将于近期开源。(截至发稿前,已开源https://huggingface.co/apus-ailab/APUS-OpenJev-v1)
以下为笔者与张旭博士的访谈精要。为便于阅读,本文对原始对话进行了提炼与整合。
拆解 Jev 的底层逻辑
AI 前线:如果抛开官方的概念话术,您能不能用更直观的方式解释一下,Jev 和今天常见的大模型到底有什么差别?它本质是什么?
张旭:理解这个问题的关键,在于看透大模型工作的两个基本步骤。第一步是 Prefill,也就是输入处理;第二步是 Decode,也就是自回归生成。

当大模型走完第一步 Prefill 时,它神经网络内部的“隐状态(Hidden States)”其实已经理解了你输入的文字和图片细节。
第二步的 Decode,是一个字一个字往外吐 Token,这一步纯粹是为了“翻译给人看”。
但人类语言的带宽很窄,存在极高的信息损耗。比如这张包含猫、树枝纹理和复杂光影的图片,无论你怎么用文字描述,都不可能毫无遗漏地还原给另一个人。
Jev 的核心本质,就是它砍掉了第二步(Decode),只保留了第一步。它不再为了迎合人类而去逐字生成文本,而是直接在模型理解完信息的“隐空间”(Latent Space)里计算出结果。
AI 前线:那它最后到底输出什么?就是 Choice、Score/概率这类东西吗?
张旭:对。普通大模型每生成一个 Token,本质上都是在十几、二十万词汇的词表里计算全量概率,再选择一个吐出来。
Jev 则是把这个过程极度收敛,变成了对有限选项的概率测算。比如你问“这份提纲完整了吗”,只给“完整”和“不完整”两个选项,它只返回这两个选项的概率得分(Score)。
这也是为什么它说自己不会出现幻觉。并不是说它不会判断错,而是说你只给它 A、B、C,它不会凭空给你编出一个 D。
但不出现幻觉和不出错是两回事。
AI 前线:既然只是给出固定选项的概率,业界有人质疑它只是被包装过的“动作分类器”,您怎么看?它到底新在哪里?
张旭:这么说也没错。但我觉得还要看到它背后更大的研究趋势。
比如一张图片里面包含非常丰富的信息,你不管用多长的文字去描述,都很难把全部细节还原出来。语言本身就会造成信息损失。
所以现在一个前沿方向是:既然模型内部已经有这些信息,我们是不是一定要先把它变成人类语言,再拿语言继续处理?
Jev 可以看成这个方向里的一个具体特例。它把后面的语言生成省掉,直接从模型内部状态里去完成判断。
AI 前线:所以您说的这个更大的方向,具体是什么?就是把“理解”和“生成”进一步解耦吗?
张旭:这是其中一个方面。行业里会把更大的一类思路叫作隐空间计算。
比如两个 Agent 之间通信,它们都不是人,为什么一定要把第一个 Agent 脑子里的信息翻译成人类语言,再让第二个 Agent 读一遍?理论上可以直接在模型内部状态之间做处理。
模型路由、Agent 之间通信、模型内部思考,都可以沿着这个方向做。Jev 只是拿这个思路去做了一件具体的事情:有限选项的概率判断和决策。
AI 前线:作为行业共识,那目前头部大厂在这方面的探索进展如何?Jev 的做法和他们有什么不同?
张旭: 是的,比如 DeepSeek-v4.1 Flash 版本,就已经在尝试把 Prefill 和 Decode 的能力解耦。更典型的代表是目前最新的 GPT-6(Astra),业界探讨的 Loop Transformer 机制,其本质就是让模型的思维链和思考过程,在“隐空间”内部进行循环计算,而不再转化为低效的人类文字吐出来。
对比而言,Jev 则是把隐空间计算的成果,讨巧地“产品化”了,它说明,把隐空间的中间结果直接拿出来用,已经足以颠覆当下的应用形态。
AI 前线:Jev 最明显的特点就是快。除了省掉长文本生成,它为什么还能快这么多?
张旭:不生成文本是最大原因,因为相当于“只吐第一个 Token”,只做判断。但除此之外,还有计算维度的降级。
第二个,原来是开放式生成,现在你给它的可能只有几个、几十个候选,计算范围更小。
第三个,这些候选之间相互独立,可以更多地并行判断;而传统的自回归生成前后有依赖,每一个 Token 都要等前一个。
我们自己的实现里也做了类似 KV Cache 广播这样的处理。所以总结下来就是:少生成、候选范围更小、还能并行。
AI 前线:那除了速度,它还有什么本质上的性能优势吗?
张旭:其他方面在我们看来,它跟大模型没有本质区别。它其实也就是一个大模型,只是只用了一半。
效果好不好,最终还是取决于模型本身训练得好不好。
如何复现 Jev
AI 前线:Jev 没有开源权重、完整架构和训练方案。在这种情况下,你们所谓的“复现”,严谨来说复现的是什么?
张旭:严谨来说,我们复现的是它的功能。
我把他们所有公开资料都看了一遍,也研究了创始人的背景,再自己实际调用 Jev,看它的输入和输出。
可以理解成我把它当成一个黑盒。如果我可以实现相同类型的输入、相同类型的输出,那我们认为基本复现出了它公开出来的功能。
AI 前线:那你们在千问上具体做了什么改动?
张旭:原版的 Qwen3.5 就可以。
模型本身不用改,主要是在外面的工作方式上处理。这次开源的东西,也是从我们公司已有的 Agent Harness 里抽了一部分出来,再精简以后放出来。
AI 前线:那是不是随便拿一个小模型也能跑?对底座模型能力、参数规模有没有要求?
张旭:这个实际测试以后还是有要求。
我看到开源社区有人拿五六亿参数模型复现,确实能跑起来,“能用两下”,但你会发现它很傻,没办法真正实用。
所以我自己把千问从小模型一路往上试。最后看下来,9B 基本上是最低的可用门槛,再小就很难实用;35B 效果会更好。选 9B 也是因为希望普通网友自己的电脑就能运行,不需要特别好的设备。此外,我们也在训练自己的模型,很快也会开源,初步看已经超过了 Jev 的效果。
AI 前线:这次复现有没有什么超出你预期的结果?比如原来以为很难,做完以后发现其实没那么复杂?
张旭:没有特别意外。
反而我们为什么能这么快做出来,就是因为过去在这个方向已经积累了很多,直接把已有的东西拿过来用了。
AI 前线:所以反过来说,你们这么快就复现出来,是不是说明 Jev 目前公开出来的东西,本身并没有特别高的技术门槛?
张旭:更客观地说,它背后还有没有别的东西我不知道。
但至少目前拿出来的部分,在我们看来,就是这个研究领域里的一个特例,没有什么特别神秘的地方。
“79 毫秒”能用在哪
AI 前线:你们为什么第一时间把复现做成一个 Browser Agent?
张旭:我们第一天先看了行业里大家拿 Jev 做什么,发现最多的就是操作浏览器。
而且我们希望开源出去的东西是有实际用途的,而不是一个技术 Demo 或者玩具,所以先把浏览器这个场景做出来。
以前很多 Agent 操作浏览器,需要让大模型先生成操作代码,再去执行。我们现在是把网页上可以交互的元素先列出来,比如输入框、链接、上下翻页,再让模型直接做选择:现在应该输入、点哪个链接,还是翻页。
后来模型本身已经做到毫秒级以后,我们统计发现,完整任务里大部分时间反而花在等网页加载、等网页刷新。
AI 前线:那你们为什么长期会往本地模型、CPU、小算力、模型路由这些方向走?这些看上去是很多单点技术,背后的逻辑是什么?
张旭:核心还是 AI 普惠。
我们一直在想,模型能不能不用很昂贵的 GPU,靠 CPU 也能有一个可以接受的速度和效果。因为绝大多数普通用户不会在电脑里装 5090,更不可能买 H100、B200。
如果 AI 最后真的要进入大规模 C 端产品,全部推理都依赖中心化大算力,本身会是一个限制。所以我们希望把一部分计算分散出去,分到 CPU 服务器,甚至分到用户手机上。
这也是我们做模型解耦、路由、本地推理这些事情背后的共同逻辑:用更高的性价比,让 AI 真正能够大规模普及。
AI 前线:如果不只看浏览器,这种模型还能用在哪里?
张旭:其实能落的场景很多。
比如我们经常会访问到一些网站上显示大量的广告、欺诈信息、杂乱的内容,那么浏览器有了这个能力加持,就可以快速筛选和过滤。

开发者 Movez 基于 Jev 分析了 10 万条 X 帖子,耗时仅为 20.4 秒,花费 0.67 美元
推荐系统也是很典型的场景。A 文章用户感兴趣的概率是多少,B 是多少,再把概率高的内容推荐出来。
我还看到有人拿它批量审文档,因为很多判断可以并行,所以一次处理上千份文档,速度和成本会有优势。
AI 前线:现在也有人拿 Jev 做炒股、交易。它因为决策快,会不会特别适合这一类场景?
张旭:快不代表它炒股水平高。
炒股最后还是看模型本身的智力水平,以及有没有针对金融这个方向做优化。Jev 现在应该没有专门针对这个方向优化。
所以不能因为它能很快做决策,就认为它一定能赚钱。
AI 前线:那再往长远一点看,还有什么你觉得值得关注的应用?
张旭:更长期可能会到工业自动化、智能家居这些领域,因为它们都需要很快做出行动。
现在不是已经有人拿 Jev 玩游戏了吗?
它能玩游戏,其实就能够操控机器人。
Agent 走向快慢分工
AI 前线:决策变得这么快以后,下一个挑战会在哪里?