神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


电影圈的“牛来”刚刚火遍全网,大模型圈也来了一头身份不明的“牛”。


今天上午,OpenRouter 没有举行发布会,也没有公布技术报告,只用一个忍者表情放出了一款代号为“Ox Alpha”的神秘模型。“Ox”在英文中正有“牛”的意思,于是,一场属于 AI 行业的“牛来”也开始了。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


OpenRouter 对这款神秘模型的介绍很短,基本就一句话概括了:这是一款面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有 100 万 Token 上下文窗口,同时支持文本、图像和视频输入。


除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。


神秘模型 Ox Alpha 引发热议


目前能够确定的是,Ox Alpha 并不是 OpenRouter 自己开发的模型。OpenRouter 只负责将用户请求路由给背后的第三方供应商,而后者选择在预览期间保持匿名。


这让 Ox Alpha 在上线几小时后迅速变成一场大型“猜模型”游戏。


从 Google Gemini、小米 MiMo V3 到腾讯混元新模型,不同猜测陆续出现。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


更重要的是,在人们试图识别它到底是谁之前,OpenRouter 表示它目前是免费的。


根据 OpenRouter 公布的信息,Ox Alpha 的完整模型标识为:


stealth/ox-alpha


它是一款以推理和编程为主要方向的模型,重点面向三类任务:长周期软件工程、复杂推理,同时结合文本与视觉信息的 Agent 工作流。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


据介绍,Ox Alpha 拥有超 100 万 Token 上下文窗口,最大输出长度达到 13 万 Token。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


这意味着,它理论上可以一次读取规模较大的代码仓库、长时间积累的 Agent 执行记录,或者由文本、图片和视频共同组成的复杂任务。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


模型支持文本、图片和视频输入,但输出形式仍然只有文本。


值得一提的是,在 Ox Alpha 介绍页面的 FAQ 部分,有一个问题是问 Ox Alpha 是否支持工具调用和结构化输出?


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


显示的回答是:它能够支持工具调用、tool_choice以及 JSON 格式的结构化输出,不过暂不支持严格的 JSON Schema 约束。


这些特征说明,Ox Alpha 并不只是面向聊天或单次代码补全,还可能是为了 Coding Agent 准备的执行模型。


长时间 Agent 任务对模型的要求,与普通编程问答并不相同。


它不仅要生成一段正确代码,还需要持续读取文件、调用工具、跟踪修改状态、运行测试,并在失败后重新规划。如果上下文稍长就忘记目标,或者连续调用几次工具后开始偏离任务,即便模型在代码基准上得分很高,也很难真正进入生产环境。


OpenRouter 因此没有把 Ox Alpha 描述为单纯的“代码模型”,而是反复强调“sustained agentic work”,即能够持续进行的 Agent 工作。


截至目前,OpenRouter 页面显示,Ox Alpha 的中位首 Token 延迟约为 1.95 秒,输出速度约为每秒 49 Token,最近三天的可用率接近 100%。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


不过模型刚刚上线,这些数据的采样周期和调用规模都非常有限,后续很可能继续变化。


更值得注意的是,OpenRouter 没有公布任何 SWE-bench、Terminal-Bench 或其他编程与 Agent 基准成绩。


换句话说,OpenRouter 使用了“frontier model” 这一定位,但目前还没有公开证据证明 Ox Alpha 在性能上已经进入 GPT、Claude 或 Gemini 旗舰模型所在的第一梯队。


它究竟是新的旗舰模型,还是针对速度、成本和 Agent 任务优化的中型模型,根据已知信息,还暂时无法判断。


不过,这款模型目前虽然还不知道出自谁手,但最大的好处是,它现在免费呀!


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


Ox Alpha 目前在 OpenRouter 上的输入和输出价格均为零。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


对于一款拥有 100 万 Token 上下文、支持视频输入和工具调用的模型而言,完全免费的 API 并不常见。


作为对比,同样拥有百万级上下文的 Gemini 3.7 Flash,在 OpenRouter 上的价格为每百万 Token 输入 0.375 美元、输出 1.875 美元;GPT-5.6 Sol Pro 则为每百万 Token 输入 2.5 美元、输出 15 美元。


不过,Ox Alpha 的免费并不是永久定价。


OpenCode 随后宣布,Ox Alpha 将在其平台上免费开放一周,提供较宽松的速率限制和接近无限的使用额度。


OpenCode 发文称他们为这次测试准备了每天 100T Token(Trillion,表示万亿)的容量,其联合创始人 Dax 在 X 上向开发者喊话:“快来猜猜是啥模型吧!”


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


有一说一,100 万亿 Token 确实是一个很有诚意的公开测试邀请了。


这意味着,隐藏在 Ox Alpha 背后的模型厂商可能不只是想收集几百条聊天反馈,而是希望观察模型在真实 Agent Harness、代码仓库和长周期任务中的表现:它会在哪些工具调用中失败,面对多长上下文开始遗忘,连续修改几十个文件后是否仍能维持目标,以及开发者最终是否愿意继续使用。


测试效果如何?


模型放出后,在国外技术社区引发了一波集中测试。


在 X 平台,有用户测试过后,表示用起来很不错。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


还有用户拿出了最难的 AI 测试题——鹈鹕骑自行车 SVG 任务。


该用户对 Ox Alpha 的不同推理档位进行了 15 次对照测试:在相同提示词、相同温度下,分别以 low、high 和 max 三档推理强度各生成 5 次。


从结果看,模型基本都理解了任务,能够稳定画出鹈鹕、自行车、车轮和骑行动作,说明其代码生成与空间关系表达具备一定稳定性。


但仔细观察仍能发现,部分样本中鹈鹕的腿没有踩在踏板上,车架结构不完整,翅膀、身体与车把之间也偶尔出现不合理连接。


更值得注意的是,推理强度提高后,质量提升并没有与计算开销保持同步。


low 档通常只需约 13 至 21 秒,推理字段几乎为空或只有十几个字符。


high 档耗时仍维持在 19 至 23 秒左右,画面细节和结构一致性有所改善。


最后到了 max 档,模型的推理字段骤增至约 1.7 万至 6.2 万个字符,单次生成耗时也拉长至 124 至 355 秒,Token 消耗最高超过 2.6 万。


最终图像确实增加了云朵、太阳、头盔、速度线和更复杂的车轮结构,但核心构图并没有出现同等幅度的提升,个别样本甚至仍存在脚与踏板错位、车架比例失衡等问题。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


这组测试其实很能说明问题:一是它能够比较稳定地完成需要生成可视化代码的任务;二是其最高推理档位存在明显的“过度思考”倾向——模型花费数十倍的推理字符和十几倍的时间,换来的主要是装饰细节,而不是结构准确性的根本改善。


另一部分用户更关注它是否适合 Agent 任务。


有人表示,Ox Alpha 能够在经过两次需求澄清后,完成自己预期的功能;也有人尚未开始测试,就已经因为免费额度和百万上下文把它接入 OpenCode。


还有用户把注意力放在“100 万亿 Token”上,认为这更像一场公开压力测试,而不是常规产品发布。


社区中目前比较一致的态度是:免费、上下文足够长,可以尝试;但在身份、稳定性和真实能力得到确认之前,不适合仅凭“frontier”标签替代成熟的生产模型。


这种谨慎并非多余。OpenRouter 此前已经上线过多款 Alpha 匿名模型。社区往往会在发布初期把它们猜成下一代 GPT、Gemini 或 Grok,但模型身份揭晓后的实际定位,未必与最初的想象一致。


免费开放还带来了另一个现实作用:为模型进行极大规模的真人压力测试。


相比模型厂商自己设计的 Benchmark,开发者会把模型接入 OpenCode、Claude Code 类 Harness,放进真实项目,要求它修复依赖冲突、阅读混乱代码、操作终端、浏览网页,甚至连续工作几个小时。这些失败案例对准备正式发布的模型厂商可能比排行榜分数更有价值。


免费并不是没有代价,只是测试费用由模型公司承担,开发者则贡献真实任务和反馈。


此外,在 x 上,有用户对该模型与其他模型进行了更详细的对比测试,该用户让 Ox Alpha 在 10 个具体的任务中跑一遍。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


从结果看出,Ox Alpha 最终通过 8 个、失败 2 个,因此是 80%。


其他模型每个任务测试了 4 次,有的模型在 4 次任务中全部成功,有的任务某个模型成功 2 次;


还有的全部失败了。


最后一行是这 10 项任务的平均通过率:


  • Fable 5:65%
  • GLM-5.3:62%
  • GPT-5.6 Sol:52%
  • Grok-4.6:62%
  • Ox Alpha:80%


从表面结果看,Ox Alpha 在这 10 项任务里排名第一,比第二名 Fable 5 高 15 个百分点。


综合结果来看,Ox Alpha 表现出了接近甚至超过前沿模型的潜力,但样本太少,测试口径也不完全一致,也不能直接判断它已经击败 GPT、GLM 或 Fable。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


在这条测评贴下面,一些用户看到结果后评论,“感觉把 Fable 5 都干掉了”。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


因此有人猜测,这是智谱的能力水平。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


 关于模型归属的猜测


匿名模型上线后,社区最关心的问题不是怎么用,而是“它到底是谁”。目前主要出现了四类猜测。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


第一种猜测:小米 MiMo V3


在 Reddit、x 等平台上,MiMo V3 是目前出现频率较高的答案。


这种猜测主要建立在三条线索上。


第一,时间点接近。8 月 18 日,小米集团 CFO 林世伟在财报电话会上透露,新一代 MiMo 模型正在训练,有望很快发布。但小米并未公布具体型号,因此“MiMo 3.0”只是网友暂时使用的称呼,并非官方名称。


第二,小米此前有过在 OpenRouter 匿名测试模型的先例。


今年 3 月,代号 Hunter Alpha 的神秘模型在 OpenRouter 免费上线,一度被外界猜测为 DeepSeek V4,随后小米确认,它实际上是 MiMo-V2-Pro 的早期内部测试版本。


Hunter Alpha 同样拥有 100 万 Token 上下文,且面向 Agent 任务,上线后很快突破 1 万亿 Token 调用量。


第三,两者的产品定位存在重合。Ox Alpha 被描述为面向高效编程、持续 Agent 任务和生产环境;目前的 MiMo 系列同样把代码、工具调用和长周期 Agent 执行作为重点方向。


Ox Alpha 的 100 万 Token 上下文,也与 MiMo-V2.5 和 MiMo-V2.5-Pro 的百万级上下文接近。


所以在 Reddit 上,有一位用户猜测,这款模型就是 MiMo V3,后面有用户继续提问,他的猜测理由是什么。


有另一位用户回答了这个问题,他写道:“Mimo 确实经常以 100 万亿 Token 为单位进行预算。例如,Mimo 100 万亿 Token 计划。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


更有一名用户直接判断:“这很可能就是 MiMo V3,趁它还开放的时候用吧。”


这类猜测目前主要来自发布时间、免费测试策略和模型定位,并没有确凿技术证据。


第二种猜测:腾讯混元 HY 4


另一部分网友认为,Ox Alpha 可能来自腾讯混元。


一篇 Reddit 帖子直接将模型指向“HY 4”,理由是能够支撑如此大规模免费调用的厂商并不多,腾讯在算力和推理基础设施上具备相应条件,同时也可能需要在正式发布前收集真实 Agent 任务数据。


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米


神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米 原文链接: https://www.aitntnews.com/newDetail.html?newId=28481