点击右上角
微信好友
朋友圈

请使用浏览器分享功能进行分享

近日,Sand.ai正式发布并开源MAGI-2 Preview。据介绍,这是其全球首个千亿级开源MoE视频生成模型,总参数约114B,单次前向计算仅激活约6B参数。在Artificial Analysis image to video视频生成榜单排名第六。按照当前8卡H100的月租金折算,其生成10秒1080P视频的推理成本约0.5元“蒸馏后模型”,每秒生成成本约为行业主流模型的十分之一。

开源地址:
https://github.com/SandAI-org/MAGI-2-preview
https://huggingface.co/sand-ai/MAGI-2-preview
单流架构统一生成画面与声音
MAGI-2 Preview是一款统一音视频生成模型。文本、视频和音频进入同一个Transformer,在每一层self-attention中持续交换信息,画面与声音由同一个模型共同生成。
人物说话时,模型也在生成相应的口型、表情和身体动作;环境里出现撞击声,画面中的物体需要在相同时间作出反应;音乐节奏发生变化,人物表演和镜头推进也要随之调整。这些细小的同步关系,会直接影响一个镜头的完整度。
传统多流方案通常为画面和声音设置不同的主干网络,再通过cross-attention或后处理完成连接。由于音频和视频在生成早期分别建模,音画对齐更依赖后续环节,链路越长,越容易累积延迟和误差。
MAGI-2 Preview延续了Sand.ai在daVinci-MagiHuman论文中提出的单流架构,从模型内部共同处理文本、视频和音频。模型还设置了共享专家与模态专属专家:共享专家处理不同模态之间的共性,专属专家分别处理语言、画面和声音独有的信息。
统一主干缩短了生成链路,也减少了多套模型串联带来的接口、等待和维护成本。对于广告、短剧、动画和游戏等内容,一次便可以生成更接近同时包含画面、声音与表演的完整镜头。
114B总参数,单次激活仅6B
统一音视频也带来了更重的计算压力。一段视频会被拆成大量空间patch和连续帧,再加入音频与文本,序列长度和信息量迅速增加。稠密模型扩大规模时,每个token都要经过全部参数,模型越大,训练和推理需要的计算越多。
MoE 架构在模型内部设置了一个庞大的专家池,每个token只选择与当前任务相关的一小部分专家参与计算。模型由此可以扩大总容量,同时控制实际调用参数量。
MAGI-2 Preview用约114B总参数容纳人物、动作、镜头、材质、语义、语音和环境声等信息,再将单次前向计算的激活参数控制在约6B。
为了让专家分工更细,它将3072维隐藏表示拆成12个256维head,并在36层主体网络中使用Multi-Head MoE。每个head拥有256个专家,每次选择其中6个。每一层由此形成3072个head-local专家单元,一个token在12个head中合计激活72个小专家。
Sand.ai将这种结构称为Ultra-fine-grained MoE。不同head可以在各自的低维子空间内独立选择专家,再将结果重新融合,为人物外观、动作时序、语言语义、语音和环境声等信息提供更细的处理单元。
自研infra突破跨设备通信瓶颈
专家数量增加后,跨设备通信会成为新的瓶颈。传统Expert Parallel通常先为token选择Top-K专家,再将token发送到专家所在的设备。路由结果随输入动态变化,容易造成设备负载不均;激活专家越多,设备之间需要传输的数据通常也越多。
MAGI-2 Preview引入Head Parallel改变了通信顺序。模型在动态路由发生前,先把固定形状的head表示分发到不同设备,数据抵达后再在本地选择和执行专家。其主要通信量由输入表示决定,避免通信规模随激活专家数量线性增长。
围绕这套架构,Sand.ai还开发了MagiMoE和分布式优化器MagiMuon。其中,MagiMoE覆盖专家路由、排序和计算的完整链路,通过融合计算步骤减少中间结果和显存搬运,并针对大量小矩阵计算优化前向与反向过程。MagiMuon则使用Muon处理主体矩阵参数,用AdamW处理更适合常规更新的参数,同时针对海量细粒度专家重新适配参数组织和跨设备计算。
MagiMoE、Head Parallel与MagiMuon共同构成了MAGI-2 Preview的千亿参数底座。Sand.ai认为,视频模型的Scaling并非单纯的参数增加,背后更难扩展的是通信效率、计算效率、数值稳定性和训练监控。MAGI-2 Preview的价值在于,它让模型设计与系统能力在同一次规模化训练中得到了验证。
低成本推理打开高频应用空间
在实际内容制作中,生成视频很少一次就完全符合预期。人物动作、镜头运动、构图和对白节奏,都可能需要反复调整。单次成本下降后,同样的预算可以测试更多提示词和生成版本,再从中筛选可用镜头。
视频创作也有机会转向多版本生成、自动筛选和人工选择。内容工具、广告系统、游戏资产生成和虚拟人互动等场景需要持续调用模型,较低的单位生成成本为这类高频应用提供了基础。
MAGI-2 Preview还将千亿级视频MoE路线带入开源社区。开发者可以围绕统一音视频、细粒度专家、低成本推理和模型部署继续测试,检验这条路线在更多任务与硬件环境中的表现。
Sand.ai表示,下一步将继续扩大模型与数据规模,探索更长时长的视频生成,提升生成质量、音画同步和长时一致性,并持续降低单位生成成本。(环球网)
