mt logoMyToken
ETH Gas
EN

是时候重新评估 MiniMax 了

Favoritecollect
Shareshare

作者: Max ,01Founder

编辑|Max

前几天,著名外宾AI应用 Genspark 干了一件以前不太像它会干的事。

它开始自己训模型了。

9 月 10 日,Genspark 发布了一个专门做 PPT 的模型 Gen-1 Slides。底座是 MiniMax M3,训练这件事则找了 Fireworks 一起做。

现在,这个模型已经成了 Genspark AI Slides 标准模式的默认选项。

Image

Genspark 过去一直是很典型的 AI 应用公司。

模型是谁家的不重要,谁好用就用谁。

今天 Claude Opus 4.8强一点,就多调一点 Claude;明天GPT-5.6更便宜,就重新把请求都切过去。

应用公司最擅长的事情,本来就是不对模型公司产生感情。

所以看到 Genspark 自己下场训练模型,我停了一下。

因为这已经不是这个 API 好不好用的问题了。

调 API 不好用,最多改个配置。

自己训练,先得交 GPU 的钱。

行业里夸模型的人很多。

愿意为了这句夸奖,自己买单继续训练的人,就没那么多了。

这也是我后来重新去看 MiniMax 的原因。

PART.01、开源模型准备好了

先说 Genspark 为什么选 M3。

现在开放模型很多,甚至有些模型在榜单上的成绩比 M3 更好。

但还有一个前提:

现在这批开放模型,本身已经跨过了可用线。

放在前几年,应用公司拿到权重以后,可能还得先补 Coding、Agent、长任务这些基础能力。

现在像 M3 这样的模型,底子已经够用了,应用团队才有资格把资源集中到自己的业务上。

但对一家准备继续做后训练的应用公司来说,选基座模型并不是简单从排行榜第一名往下挑。

Genspark 做的是 PPT。

一份复杂 PPT,要读很长的参考资料,规划页面,写代码,调用工具渲染,再自己检查和修改,跑几十轮很正常。

所以它需要的底座, 最好同时具备原生多模态、长上下文、不错的Coding和Agent能力,而且还得开放权重。

M3 基本把这些条件凑齐了。

但我觉得还有一个很现实的原因:

它的模型大小也刚刚好。

M3 大约有 428B 总参数,每个 Token 激活约 23B。

400 多 B 当然不能叫小模型,但放在今天前沿的开放模型里,又没有大到完全脱离应用公司的训练和部署范围。

市面上确实还有一些跑分更高的模型,但模型越大,后面强化学习、部署、推理、持续迭代的成本都会跟着上去。

对模型公司来说,可能更关心谁是最强的。

但对应用公司来说,选基座模型不是找最聪明的那个, 而是在能力、成本和可训练性之间,找性价比最高的那个。

能力已经足够覆盖自己的任务,模型规模又没有大到让后训练失去商业意义。

所以 Genspark 选 M3,我觉得本质上 M3 是在这个区间里找到了一个平衡点。

Genspark 自己也说,因为有 M3 这样的开放底座,他们才能直接跳过预训练,把预算花在 Slides 这件事上。

Image

这句话其实把事情说得很清楚。

应用公司真正需要的,不是再造一个最强基础模型。

而是找到一个已经足够好的模型,然后把有限的钱和工程资源,花在自己真正懂的业务上。

PART.02、为什么要训模型

但有一个合适的底座,不代表 Genspark 就一定要自己训。

真正的问题是 这件事值不值得。

答案首先藏在 Genspark 自己的调用规模里。

Fireworks 披露,Genspark Slides 每个月消耗的 Token 已经超过 1 万亿

Image

到了这个量级,模型成本就不再只是技术团队关心的事情了。

哪怕每百万 Token 只便宜一点,乘上每月上万亿 Token 的消耗,最后都会变成一笔很具体的成本。

所以 Genspark 真正要算的是: 如果把最常用、最稳定的一部分任务自己做专项训练,能不能把效果留下来,同时把成本压下去。

他们做了一组测试。

Gen-1 Slides 完成一份 PPT,平均模型调用成本是 0.44 美元

而用之前行业主力模型 Opus 5 的成本是 4.16 美元

这是接近十倍差距。

这时候,Genspark 为什么愿意自己训,就比较容易理解了。

更重要的是,成本降下来以后,效果并没有明显打折。

Gen-1 Slides 的平均评分是 4.25, 略高于 Opus 5 的 4.23;下载率也达到 33.1%,高于后者的 31.5%。

Image

这时候,Genspark 为什么愿意自己训,就比较容易理解了。

它不需要做一个全面超过所有通用模型的新模型。

它只需要在 PPT 这件高频、稳定、自己又足够熟悉的任务上,做出一个更合适的版本。

效果够好,成本能降,而且还能围绕自己的产品继续迭代,这笔账就开始成立。

PART.03、为什么能训模型

训练过程中,Genspark 遇到过一个很典型的问题。

他们不希望 PPT 里的文字溢出,于是给模型设计了一条规则:文字超过页面边界,就扣分。

模型训练一段时间以后,很快找到了解法:

把字体缩小。

Image

从评测器来看,问题解决得非常漂亮。

文字确实没有溢出。

只是用户也快看不见了。

这个例子其实刚好解释了, 为什么 Genspark 这种应用公司有必要自己参与模型训练。

因为模型公司可以把模型训练得很聪明,却很难替每一个应用定义:到底什么叫把活干好了。

对于 PPT 来说,没有文字溢出只是一个指标。

真正交到用户手里,还要考虑字号能不能看清、信息密度是不是合适、页面结构顺不顺、用户会不会拿到结果以后又自己重做一遍。

这些东西没有一个通用 Benchmark 能完全告诉你。

它们来自产品每天和真实用户打交道。

Genspark 做了这么久 Slides,它手里真正值钱的,不只是调用量,还有大量关于什么结果用户会接受的经验。

哪些错误用户最敏感,哪些问题可以忍,哪些页面看起来没报错但根本不能交付,这些判断,模型公司很难凭空获得。

以前,这些经验主要被用来改 Prompt、改 Workflow、改产品。

现在多了一条路:

把它们变成 Reward、评测器和训练数据,直接参与模型本身的调整。

这也是 Genspark 能参与这次训练的原因。

MiniMax 负责把 M3 的通用能力做好,Fireworks 负责把训练工程跑通,而 Genspark 手里有另一类东西:

真实用户,以及这些年做 PPT 积累下来的产品判断。

它最清楚什么样的 PPT 用户愿意留下,哪些错误会让人直接重做,哪些页面看起来没报错,实际上根本没法交付。

这些东西,模型公司很难凭空知道。

所以应用公司开始训模型,不是因为它们突然更会训练一个通用模型了。

而是当开源基模的能力过线以后, 它们终于可以把原本停留在产品层的经验,继续往模型里压。

说到底,Genspark 不需要比 MiniMax 更懂模型。

它只需要比 MiniMax 更懂 PPT 这门生意。

PART.04、不只是文本模型

看到 Genspark 这次拿 M3 去做后训练,我突然想起了一个月前的 H3。

8 月 3 日,MiniMax H3 正式开放权重。

这是一个可以同时理解文本、图片、视频和音频的通用视频模型,能生成最长 15 秒、最高 2K、带原生立体声音频的视频。

然后社区很快就热闹起来了。

H3 开放权重当天,ComfyUI 就做了 Day-0 支持。官方甚至专门写了一篇博客,介绍怎么把 H3 跑在本地消费级显卡上。

Image

接下来的事情就很有互联网开源社区的味道了。

有人嫌 15 秒不够长,就自己写 ComfyUI 节点,把 H3 一段一段接起来,做长视频和多镜头连续生成。

还有人纯粹拿它玩梗。H3 开源当天,Stable Diffusion 社区里就有人用本地 ComfyUI 做各种文字生成视频,光一个帖子就拿了几百个赞。下面讨论的已经不是这个模型能不能跑,而是还能拿它干什么。

再往后,事情开始从网友玩模型变成公司改模型。

8 月 26 日,fal 发布了 H3 Max ,直接在 H3 的开放权重上继续后训练,加入新的训练数据,重点优化提示词遵循、画面审美和推理速度。

fal 给出的数据里,5 秒视频可以在不到 3 秒里生成。

Image

FastVideo 则往另一个方向走,做了 FastH3,用四步蒸馏和稀疏注意力去压推理成本和生成时间。

甚至还有研究团队把 H3 改成了一个可以用键盘控制的交互式世界模型 H3-World。

他们只训练了大约 0.2% 的骨干参数,就让视频模型开始响应玩家动作。

所以看到 Genspark 这次做 Gen-1 Slides,我再回头看 H3 开源之后发生的那些事情,感觉就不太一样了。

当时大家看到的是热闹。

有人拿 H3 做广告,有人做长视频,有人优化推理速度,还有人干脆把它往世界模型上改。

但现在回头看,这些项目其实都在做同一件事:

把一个开源通用模型,继续往自己的具体问题上推。

Image

MiniMax 可以把 H3 的基础能力做好,但它不可能同时知道,广告团队最在意什么,视频平台最想压哪一部分成本,做交互世界的人又需要什么样的响应能力。

这些问题,反而是下游最清楚。

Genspark 也是一样。

它不需要比 MiniMax 更懂怎么训练一个通用模型, 它只需要比 MiniMax 更懂 PPT 用户。

fal 也不需要重新造一个视频模型,它只需要知道自己的推理系统和客户,到底还缺什么。

所以开放权重真正改变的,不只是大家都可以下载模型。

它其实重新分了一部分研发工作。

基础模型公司负责把通用能力做到足够高,下游公司负责把它继续训练成更适合自己业务的东西。

这样一来,MiniMax 不需要自己提前猜中所有应用场景。

模型放出去以后,外面的公司会带着自己的数据、用户和问题,继续往不同方向走。

有些方向 MiniMax 自己可能根本不会做。

但只要底座足够好,这些探索仍然可以从它这里开始。

我觉得这才是 H3 开源之后那阵狂欢更值得看的地方。

表面上是大家在玩同一个模型。

实际上,是很多团队开始替这个模型寻找不同的去处。

PART.05、对MiniMax的价值是什么

但开放权重还有一个绕不开的问题:

这些下游的探索,最后和 MiniMax 自己有什么关系?

前面讲 H3 的时候,其实已经能看到第一层价值。

MiniMax 不需要自己去研究广告、长视频、世界模型或者 PPT。模型放出去以后,下游会带着自己的数据、用户和业务问题,替这个底座不断试新的方向。

有人做成了,就等于又多了一个案例,告诉市场:这个模型不只是 Benchmark 上能跑,它真的可以被拿去做产品。

这种价值未必马上出现在收入里,但会影响下一批开发者的选型。

而 MiniMax 显然也没有把后面的商业关系完全放掉。

我后来去翻了 M3 的 License,发现它并不是权重一开,后面随便用。

M3 使用的是自己的社区许可。

协议里明确写到, 基于 M3 做后训练、微调之后形成的商业部署,依然属于商业使用 如果相关产品和服务的年收入超过 2000 万美元,需要再取得 MiniMax 的单独书面授权。

Image

这套设计其实挺容易理解。

前期先把模型开放出来,让更多团队愿意尝试。谁适合拿它做什么,不需要 MiniMax 自己提前猜完。

如果一个项目最后只是实验,社区至少替它探索了一个方向。

如果真的跑成了一门生意,双方又有机会重新建立商业关系。

所以开放权重并不等于 MiniMax 把后面的价值全部让掉了。

它更像是先把开发边界打开,让更多人帮它把模型带进不同场景;等某些场景真正长大以后,再通过授权、API 或其他服务把关系接回来。

现在 Comfy 已经在公开销售 MiniMax 模型的商业许可,Professional 档从每月 5000 美元 起。

Image

当然,这里面有个先后顺序不能搞反。

不是因为 License 写得聪明,所以开发者会来。

还是得先有一个足够好的模型,才会有人愿意下载、继续训练,甚至把自己的产品押在它上面。

License 能做的,只是在模型已经创造价值以后,让其中一部分价值有机会再回到 MiniMax。

这样看,开源本身不是商业模式。

它更像是在扩大模型能够抵达的地方。

而商业模式,要等这些地方真的长出东西以后,才开始有意义。

PART.06、核心是有多少人愿意用你

过去评价一个基础模型,最常看的还是 Benchmark。

数学多少分,Coding 排第几,Agent 榜单有没有涨,这些当然重要。

但对 MiniMax 来说,现在还可以多看一个指标:

有多少团队,愿意拿它的模型继续训练,并真正放进自己的业务里。

这比下载一次模型重得多。

因为一旦决定做后训练,就意味着团队愿意投入工程师、算力、时间,还要把自己的任务环境和评价体系接进去,最后拿真实用户来检验结果。

没人会为了证明开源生态很繁荣,主动烧一笔算不过来的钱。

所以 Genspark 选择 M3,本身就是一次很实际的验证。

Genspark 有足够大的业务规模,也有长期积累下来的 PPT 产品经验;但另一边,MiniMax 也得先提供一个基础能力足够、值得继续训练的底座。

少任何一边,这件事都很难成立。

所以,应用公司开始往模型层走,并不意味着基础模型公司的价值变小了。

反过来看,只有底座足够成熟,下游才敢把自己的业务、工程资源和用户一起压上去。

Genspark 把 M3 训练成 PPT 模型,fal 和 FastVideo 沿着 H3 继续往下改。它们解决的都不是 MiniMax 自己定义的问题,却都在验证同一件事:这个底座值不值得继续开发。

所以以后评价 MiniMax,除了看 Benchmark、API 和自己的产品,我还会多看一个指标:

有多少公司,愿意把自己的生意建在它的模型上。

下载一个模型很容易。

愿意投入工程师、GPU 和真实用户继续往下做,难得多。

模型发布以后,还有多少人愿意接着往下做,这件事比发布会上的掌声难得多。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup