是时候重新评估 MiniMax 了。


前几天,著名外宾AI应用 Genspark 干了一件以前不太像它会干的事。


它开始自己训模型了。


9 月 10 日,Genspark 发布了一个专门做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,训练这件事则找了 Fireworks 一起做。


现在,这个模型已经成了 Genspark AI Slides 标准模式的默认选项。


是时候重新评估 MiniMax 了。


Genspark 过去一直是很典型的 AI 应用公司。


模型是谁家的不重要,谁好用就用谁。


今天 Claude Opus 4.8强一点,就多调一点 Claude;明天GPT-5.6更便宜,就重新把请求都切过去。


应用公司最擅长的事情,本来就是不对模型公司产生感情。


所以看到 Genspark 自己下场训练模型,我停了一下。


因为这已经不是这个 API 好不好用的问题了。


调 API 不好用,最多改个配置。


自己训练,先得交 GPU 的钱。


行业里夸模型的人很多。


愿意为了这句夸奖,自己买单继续训练的人,就没那么多了。


这也是我后来重新去看 MiniMax 的原因。


PART.01 开源模型准备好了


先说 Genspark 为什么选 M3。


现在开放模型很多,甚至有些模型在榜单上的成绩比 M3 更好。


但还有一个前提:


现在这批开放模型,本身已经跨过了可用线。


放在前几年,应用公司拿到权重以后,可能还得先补 Coding、Agent、长任务这些基础能力。


现在像 M3 这样的模型,底子已经够用了,应用团队才有资格把资源集中到自己的业务上。


但对一家准备继续做后训练的应用公司来说,选基座模型并不是简单从排行榜第一名往下挑。


Genspark 做的是 PPT。


一份复杂 PPT,要读很长的参考资料,规划页面,写代码,调用工具渲染,再自己检查和修改,跑几十轮很正常。


所以它需要的底座,最好同时具备原生多模态、长上下文、不错的Coding和Agent能力,而且还得开放权重。


M3 基本把这些条件凑齐了。


但我觉得还有一个很现实的原因:


它的模型大小也刚刚好。


M3 大约有 428B 总参数,每个 Token 激活约 23B。


400 多 B 当然不能叫小模型,但放在今天前沿的开放模型里,又没有大到完全脱离应用公司的训练和部署范围。


市面上确实还有一些跑分更高的模型,但模型越大,后面强化学习、部署、推理、持续迭代的成本都会跟着上去。


对模型公司来说,可能更关心谁是最强的。


但对应用公司来说,选基座模型不是找最聪明的那个,而是在能力、成本和可训练性之间,找性价比最高的那个。


能力已经足够覆盖自己的任务,模型规模又没有大到让后训练失去商业意义。


所以 Genspark 选 M3,我觉得本质上 M3 是在这个区间里找到了一个平衡点。


Genspark 自己也说,因为有 M3 这样的开放底座,他们才能直接跳过预训练,把预算花在 Slides 这件事上。


是时候重新评估 MiniMax 了。


这句话其实把事情说得很清楚。


应用公司真正需要的,不是再造一个最强基础模型。


而是找到一个已经足够好的模型,然后把有限的钱和工程资源,花在自己真正懂的业务上。


PART.02 为什么要训模型


但有一个合适的底座,不代表 Genspark 就一定要自己训。


真正的问题是这件事值不值得。


答案首先藏在 Genspark 自己的调用规模里。


Fireworks 披露,Genspark Slides 每个月消耗的 Token 已经超过 1 万亿


是时候重新评估 MiniMax 了。


到了这个量级,模型成本就不再只是技术团队关心的事情了。


哪怕每百万 Token 只便宜一点,乘上每月上万亿 Token 的消耗,最后都会变成一笔很具体的成本。


所以 Genspark 真正要算的是:如果把最常用、最稳定的一部分任务自己做专项训练,能不能把效果留下来,同时把成本压下去。


他们做了一组测试。


Gen-1 Slides 完成一份 PPT,平均模型调用成本是 0.44 美元


而用之前行业主力模型 Opus 5 的成本是 4.16 美元


这是接近十倍差距。


这时候,Genspark 为什么愿意自己训,就比较容易理解了。


更重要的是,成本降下来以后,效果并没有明显打折。


Gen-1 Slides 的平均评分是 4.25,略高于 Opus 5 的 4.23;下载率也达到 33.1%,高于后者的 31.5%。


是时候重新评估 MiniMax 了。


这时候,Genspark 为什么愿意自己训,就比较容易理解了。


它不需要做一个全面超过所有通用模型的新模型。


它只需要在 PPT 这件高频、稳定、自己又足够熟悉的任务上,做出一个更合适的版本。


效果够好,成本能降,而且还能围绕自己的产品继续迭代,这笔账就开始成立。


PART.03 为什么能训模型


训练过程中,Genspark 遇到过一个很典型的问题。


他们不希望 PPT 里的文字溢出,于是给模型设计了一条规则:文字超过页面边界,就扣分。


模型训练一段时间以后,很快找到了解法:


把字体缩小。


是时候重新评估 MiniMax 了。


从评测器来看,问题解决得非常漂亮。


文字确实没有溢出。


只是用户也快看不见了。


这个例子其实刚好解释了,为什么 Genspark 这种应用公司有必要自己参与模型训练。


因为模型公司可以把模型训练得很聪明,却很难替每一个应用定义:到底什么叫把活干好了。


对于 PPT 来说,没有文字溢出只是一个指标。


真正交到用户手里,还要考虑字号能不能看清、信息密度是不是合适、页面结构顺不顺、用户会不会拿到结果以后又自己重做一遍。


这些东西没有一个通用 Benchmark 能完全告诉你。


它们来自产品每天和真实用户打交道。


Genspark 做了这么久 Slides,它手里真正值钱的,不只是调用量,还有大量关于什么结果用户会接受的经验。


哪些错误用户最敏感,哪些问题可以忍,哪些页面看起来没报错但根本不能交付,这些判断,模型公司很难凭空获得。


以前,这些经验主要被用来改 Prompt、改 Workflow、改产品。


现在多了一条路:


把它们变成 Reward、评测器和训练数据,直接参与模型本身的调整。


这也是 Genspark 能参与这次训练的原因。


MiniMax 负责把 M3 的通用能力做好,Fireworks 负责把训练工程跑通,而 Genspark 手里有另一类东西:


真实用户,以及这些年做 PPT 积累下来的产品判断。


它最清楚什么样的 PPT 用户愿意留下,哪些错误会让人直接重做,哪些页面看起来没报错,实际上根本没法交付。


这些东西,模型公司很难凭空知道。


所以应用公司开始训模型,不是因为它们突然更会训练一个通用模型了。


而是当开源基模的能力过线以后,它们终于可以把原本停留在产品层的经验,继续往模型里压。


说到底,Genspark 不需要比 MiniMax 更懂模型。


它只需要比 MiniMax 更懂 PPT 这门生意。


PART.04 不只是文本模型


看到 Genspark 这次拿 M3 去做后训练,我突然想起了一个月前的 H3。


8 月 3 日,MiniMax H3 正式开放权重。


这是一个可以同时理解文本、图片、视频和音频的通用视频模型,能生成最长 15 秒、最高 2K、带原生立体声音频的视频。


然后社区很快就热闹起来了。


H3 开放权重当天,ComfyUI 就做了 Day-0 支持。官方甚至专门写了一篇博客,介绍怎么把 H3 跑在本地消费级显卡上。


是时候重新评估 MiniMax 了。


接下来的事情就很有互联网开源社区的味道了。


有人嫌 15 秒不够长,就自己写 ComfyUI 节点,把 H3 一段一段接起来,做长视频和多镜头连续生成。


还有人纯粹拿它玩梗。H3 开源当天,Stable Diffusion 社区里就有人用本地 ComfyUI 做各种文字生成视频,光一个帖子就拿了几百个赞。下面讨论的已经不是这个模型能不能跑,而是还能拿它干什么。


再往后,事情开始从网友玩模型变成公司改模型。


8 月 26 日,fal 发布了 H3 Max,直接在 H3 的开放权重上继续后训练,加入新的训练数据,重点优化提示词遵循、画面审美和推理速度。


fal 给出的数据里,5 秒视频可以在不到 3 秒里生成。


是时候重新评估 MiniMax 了。


FastVideo 则往另一个方向走,做了 FastH3,用四步蒸馏和稀疏注意力去压推理成本和生成时间。


甚至还有研究团队把 H3 改成了一个可以用键盘控制的交互式世界模型 H3-World。


他们只训练了大约 0.2% 的骨干参数,就让视频模型开始响应玩家动作。


所以看到 Genspark 这次做 Gen-1 Slides,我再回头看 H3 开源之后发生的那些事情,感觉就不太一样了。


当时大家看到的是热闹。


有人拿 H3 做广告,有人做长视频,有人优化推理速度,还有人干脆把它往世界模型上改。


但现在回头看,这些项目其实都在做同一件事:


把一个开源通用模型,继续往自己的具体问题上推。


是时候重新评估 MiniMax 了。


MiniMax 可以把 H3 的基础能力做好,但它不可能同时知道,广告团队最在意什么,视频平台最想压哪一部分成本,做交互世界的人又需要什么样的响应能力。