8 月 5 日,Sand.ai 把 MAGI-2 Preview 放了出来,开源了权重和代码。总参数 114B,每次前向只激活约 6B。这是全球已知第 一个把参数量做到千亿、又用 MoE 结构的视频生成模型。
作为视频模型,这个参数数字很醒目,但数字不是这件事最难的部分。MAGI-2 Preview 真正值得说的,是模型变大之后,怎么把几千个专家稳稳地跑起来。
只有画面和声音,才能代替模型说话。
视频模型的“不可能三角”
做视频生成的人,手里都有一本共同的账。模型能力要往上抬,扩大规模是绕不开的路。但视频和文本不一样,它同时占着二维空间和一维时间,还要把对白、环境声、音乐塞进同一次生成。一段视频展开成 token,是大量空间 patch 和连续帧的堆叠。
在稠密架构下,每个 token 都要跑完整个模型的全部参数。模型越大,训练和推理越贵。视频序列又天然长,参数翻一倍,每一秒视频的成本往往也跟着翻。成本、速度、效果,三者很难同时顾全。曹越在采访里把这称为视频模型的「不可能三角」。
Sand.ai 自己就撞过这堵墙。团队在做出音画同出模型 Gaga-1 之后发现,在稠密架构下继续扩大规模,成本会直线上升。
2025 年 11 月,曹越带着团队做了一个决定:把模型架构从稠密转向 MoE。他在后来的采访里说,那个时间点,国内几乎没有什么视频公司在全力推进这件事。
这不是临时的补救,而是一连串非共识押注里最新的一次。Sand.ai 一开始走的是自回归路线,当时市场主流还是 Diffusion。做出 Magi-1 之后,团队很快意识到只有画面不够,于是去探索音画同出。再到把架构转向 MoE,每一步都逆着当时的主流叙事。曹越有过一句话,大意是每一代模型,他们都在押注一个非共识。
MoE 给出的解法是:模型容量可以撑大,但每次只唤醒一小部分参数。算力和效果,第 一次被分开了算。
细粒度 MoE 怎么拆:3072 个专家单元,每层铺开
MAGI-2 Preview 的做法,是把隐藏表示拆成 12 个独立的 head,每个 head 自己选专家。有的 head 看人物,有的看动作,有的管声音和语义。一个 token 在 12 个 head 里合计激活几十个小专家,总参 114B 的情况下,单次计算只用到约 6B。
作为对照,DeepSeek-V4-Pro 是每层 384 个专家选 6 个,Kimi K3 是 896 选 16,而 MAGI-2 Preview 每层铺了 3072 个专家单元。把通才拆成专才,这种结构稠密模型做不到。
容量是 MoE 给的,但容量不等于能力。
参数多只是表面,真正难的是让几千个专家在几十台机器之间别堵在路上。MoE 模型规模一大,跨设备通信就成了瓶颈。
Sand.ai 的解法是 Head Parallel。它在动态专家路由发生之前,先把形状固定的 head 表示分发到不同设备,再在本地做专家选择和计算。设备之间传的是定形数据,不是数量乱跳的专家 token。这样一来,无论激活多少专家,跨设备的流量都更稳定,也更容易优化。
通信顺序一动,整条链路的脾气都变了。
MagiMoE 与 MagiMuon:kernel 和优化器两块硬骨头
算子层面,Sand.ai 自己开发了高性能 MoE kernel 库 MagiMoE,覆盖路由、专家排序和专家计算的完整链路。它把原本分散的步骤合并执行,减少中间结果和显存搬运,并针对 Multi-Head MoE 的计算形态优化前向和反向过程。当前走的是经过大规模训练验证的 Triton / BF16 路径。
训练优化层面,MAGI-2 Preview 用了分布式优化器 MagiMuon。它用 Muon 处理主体矩阵参数,用 AdamW 处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织和跨设备计算。这种混合设计,让优化方法能从中小规模实验稳定扩展到千亿参数 MoE,而不必用同一种更新方式去对付性质不同的参数。
参数不等于能力,数据得跟上
把专家池铺大之后,新的问题跟着来:更大的专家池,能不能被足够丰富的真实数据填满。
Sand.ai 的选择是把数据工作的重点从删减转向组织。过去行业习惯把「数据质量」等同于层层过滤,最后得到一个更小、更整齐的数据集。但对生成模型来说,过度清洗可能正好移走了最重要的东西:复杂运动、特殊镜头、罕见主体、非典型声音,以及长尾组合。
他们更在意数据的规模、多样性和分布,而不是过度清洗。预训练阶段尽量覆盖完整的数据分布,后训练才聚焦偏好对齐和产品适配。基础模型在预训练阶段学到的能力越完整,产品端依赖后处理去修补运动一致性、细节表现的需求就越少。
参数增长只是起点。发布时,MAGI-2 Preview 还不是最终正式版。它在 Artificial Analysis 的 Image to Video 榜单上排到第六,算是这条路能走通的一个证据。但 Sand.ai 至少先把一件事做实了:千亿级 MoE 不只是语言模型的玩法,视频模型也能这么玩。
更大的专家池能否被更丰富的真实数据填充,更细的路由能否被精确的标注引导,更密的计算能否被稳定的系统支撑,三者同时推进,参数的增长才算真的兑现成能力。这道题,MAGI-2 验证了一半,剩下的一半,看后续模型怎么交。