原文:MiniMax 团队 AMA 揭秘:H3 为何如此出色?!

周末不卷,随便写点。

因为这一周我觉得绝对算得上是视频生成领域最疯狂的一周了,我自己也疯狂地学习了各种视频生成相关的知识和技巧。
正好前两天看到 MiniMax 在 Reddit 上举行了一场 AMA,也就是 Ask Me Anything。
社区用户可以向开发者问自己感兴趣的任何话题,里面有一些还蛮关键的信息,也是大家会关心的问题,我索性做了一些整理给大家分享。

一个比较先吸引我的问题是,看到有网友问:
“MiniMax 以后的模型还会开源吗?”

MiniMax 的开发者关系负责人 Ryan 的回复是:
“当然了!会保持开放直到 AGI 到来。”
那也就是说,我们至少还可以期待 MiniMax 给我们带来更多更好的开源模型。
OKK,我们言归正传来。
关于 H3 生成的一个问题是:
参考生视频模式相比于图生视频模式画质更差一些?!

我自己在用 H3 的时候其实也发现了这一个问题,在一开始用参考生视频模式的时候画面效果没有想象的那么好。
而 MiniMax 的研究员 Nero 给出的解释是,这一个现象确实是存在的,他们目前正在努力提升参考生视频的质量。
出现这种画质相差很多的原因是后训练的策略不同。
图生视频与参考生视频本身是两个不同的检查点,它们表现出了不同的视觉倾向。
以及 Nero 还分享了一个小技巧:使用最高质量的参考输入来进行参考生视频,因为这个模式本身对参考条件的质量会非常敏感。
网友还关心的一个问题是:
最终用于生成 2K 分辨率的那个模型会发布吗?

MiniMax 的开发者关系负责人 Ryan 表示:
虽然还没有确认日期,但是确认会发布。
这里我稍微给不太了解的小伙伴补充一下上下文细节:
我们之前在 MiniMax 官网使用的版本是能做出 2K 分辨率的片子的,但是在开源的版本里还不行。
而把分辨率提升到 2K 的效果,采用的也不是传统的超分办法。
可能“超分”这个词还是有点专业,我举个简单的例子来说一下。
假如我们现在画了一幅画。传统的办法就是,我们拿着这幅画去放大,看细节;看不出来细节,就猜。放大器看着 768p 像素的画面,把它拉大到 2K,边拉边猜测细节到底是个啥,给它补上去。
这么做有个问题:
它只能在原有的基础上修修补补。原有的画面如果有错误,那你超分出来的高分辨率画面仍然是错的。
但是 MiniMax 这里做了一个不一样的事情:
它们最后生成 2K 的这个操作是通过重新生成得来的。
在生成 2K 的这个阶段中,会把第一阶段生成的草稿图当作参考上下文,然后在 2K 分辨率下从头跑一遍完整的生成过程。

大家对 2K 重生成的这个模型的关注度,我看下来其实是最高的。MiniMax 的研究员 Kiro 补充了一些细节:这个 2K 重生成模型是一个专门用于潜空间的 DiT 模型。
这两个方法的核心区别就在于,超分是放大加猜细节,而重生成是重新创作一遍。它做出来的细节会更加合理、真实,甚至还会把第一阶段生成的小瑕疵给修补掉。
还有一个比较有意思的问题是,有网友问,H3 的稀疏注意力是否沿用了 M3 的那一套?

Kiro 对此的回答是:
H3 的稀疏注意力并没有沿用 M3 的 MSA 那一套架构,而是更贴近 MoBA 的设计。
那可能有的朋友不是特别了解啥是稀疏注意力,H3 的设计又是怎样的,我简单解释一下这是在干嘛。
其实无论是视频生成也好,还是我们平时就纯文本输出也好,最烧算力的部分其实就是注意力计算。
一段 15 秒的视频会被切分成海量的 token,默认情况下每个 token 都要跟所有其他 token 去做矩阵运算。这里面有一个很明显的问题:序列一长,计算量直接飞升爆炸。
稀疏注意力的思路就是,既然所有 token 互相做矩阵运算容易爆炸,那我索性就不让这些 token 都互相做运算了。
先把这些 token 打包成块,粗粗扫一眼每个块的摘要,再挑出重要的部分做运算,不重要的就直接跳过。
H3 的巧思就在于挑选块的方式上。
根据 Kiro 的回复来看,他们觉得视频里相邻两个画面内容本来就高度相似,所以每个块直接取平均值当概要就够用了,这样就直接省下了一整套需要学习的索引器。
还有就是他们也说了,目前只对视频 token 做了稀疏化,它们占了整个序列的绝对大头。他们预计在不久的将来会发布一个相对保守的版本。
网友还比较关心的一个问题是,官方是否会考虑推出一个速度更快的、低步数版本。

MiniMax 对此的回应是,现在这个版本其实本身已经具备一定加速了。当然它并不是专门针对“牺牲可接受的画质而换来快速推理”的一个模型。
官方只说了在积极考虑低步数的版本,但是没有做出具体的承诺。
这里比较有意思的是,虽然官方没做出具体的承诺,但是社区确实已经有人做出了 4 步的模型变体。

我在 Hugging Face 上看到一个叫 LightX2V 的团队做出了一个快速版本,但是这个版本的效果嘛确实不太行。速度虽然快,但是画质下降,音频也会崩坏。
所以官方也说了,目前还只是在探索低步数的版本。
还有一个点我觉得值得关注的是:
MiniMax 确实打算推出一个图像生成模型!

这个图像生成模型和 H3 属于同一基座,并且是一个统一模型,支持文生图、图片编辑等等。目前还处在后训练优化阶段。
还有一个大家反馈比较多的问题是:
人物一到远景就容易糊。

有网友发现了这个问题,即使是在 25 步的情况下,也会发现视频画面中远景的东西容易出现像素化。
所以他问最推荐的配置生成参数应该是什么样的,还是说这就是 H3 的问题。
我觉得 MiniMax 好的一点是,倒也还真不藏着掖着,就是直接说,这是目前已知的模型问题,会持续调查看看到底是什么原因导致的。
目前来看,这是一个复杂的、涉及多个模型以及训练管道的系统层面原因。我们可以等后续的更新优化。
还有一个,也是我自己在测试的时候体会到的一点是:
这代 H3 明显非常遵守指令。
有网友也提出了相似的看法,并且问官方,到底是哪一部分贡献最大。

官方的回答有一种大道至简的感觉:
其实很难定义具体是哪一个部分,但是整个核心无非就是构建足够多样、够广的数据集,使用通用的架构,砍掉那些不能有效 scale 的东西。
也就是说,遵循指令只不过就是一个自然而然涌现的结果。
H3 从最开始的目标就是要能做到理解不同模态组成的上下文,从而在不同任务上都有不错的泛化表现。从实际表现来看,我觉得这套方法论其实是奏效了的。
最后还有一个比较打动我的问题:有网友问,在研发 H3 的过程中,哪个实验改变了团队对于视频模型究竟在学习什么的认知。

Nero 回答得非常真诚:
一个只训练了给首帧加文字描述去预测尾帧的模型,居然能在一堆图像编辑 Benchmark 上达到很不错的 zero-shot 成绩。
这说明模型已经学会了举一反三。
这也给了他们很大的信心:通过自然语言指令引导的上下文学习,能够在不同任务上都泛化得特别好。朝着这个方向继续 scaling,非常有前途。
整个 AMA 看下来,我其实就一个感受:MiniMax 的开放是认真的,不仅仅只是简单地把模型权重开源,还能真正把社区反馈纳入模型迭代的过程中。
这其实是我觉得开源模型生态里非常重要的一点。
因为一个开源模型真正的生命力,除了发布的那一天有多惊艳以外,它还会进入一个持续迭代的循环:
开发者发布模型,社区进行测试,用户提出问题,研究团队吸收反馈,然后推动下一版本继续进化。
这个过程某种程度上,比单纯追求某一次 Benchmark 上的成绩更加重要。
我们还不知道最终的视频模型会长成什么样,但至少从 H3 身上,我们看到了一条非常有意思的路线:
让模型尝试着真正理解这个多模态的世界。
以上。