EDITOR’S SELECTION

MiniMax 团队 AMA 揭秘:H3 为何如此出色?!

MiniMax 团队在 Reddit AMA 中回应 H3 开源、2K 重生成、稀疏注意力、低步数版本、图像模型与远景画质等关键问题。

原文:MiniMax 团队 AMA 揭秘:H3 为何如此出色?!

BubbleBrain

周末不卷,随便写点。

BubbleBrain 动画

因为这一周我觉得绝对算得上是视频生成领域最疯狂的一周了,我自己也疯狂地学习了各种视频生成相关的知识和技巧。

正好前两天看到 MiniMax 在 Reddit 上举行了一场 AMA,也就是 Ask Me Anything。

社区用户可以向开发者问自己感兴趣的任何话题,里面有一些还蛮关键的信息,也是大家会关心的问题,我索性做了一些整理给大家分享。

MiniMax H3 Reddit AMA

一个比较先吸引我的问题是,看到有网友问:

“MiniMax 以后的模型还会开源吗?”

MiniMax 对后续模型开源的回应

MiniMax 的开发者关系负责人 Ryan 的回复是:

“当然了!会保持开放直到 AGI 到来。”

那也就是说,我们至少还可以期待 MiniMax 给我们带来更多更好的开源模型。

OKK,我们言归正传来。

关于 H3 生成的一个问题是:

参考生视频模式相比于图生视频模式画质更差一些?!

MiniMax 对参考生视频画质的回应

我自己在用 H3 的时候其实也发现了这一个问题,在一开始用参考生视频模式的时候画面效果没有想象的那么好。

而 MiniMax 的研究员 Nero 给出的解释是,这一个现象确实是存在的,他们目前正在努力提升参考生视频的质量。

出现这种画质相差很多的原因是后训练的策略不同。

图生视频与参考生视频本身是两个不同的检查点,它们表现出了不同的视觉倾向。

以及 Nero 还分享了一个小技巧:使用最高质量的参考输入来进行参考生视频,因为这个模式本身对参考条件的质量会非常敏感。

网友还关心的一个问题是:

最终用于生成 2K 分辨率的那个模型会发布吗?

MiniMax 对 2K 模型发布的回应

MiniMax 的开发者关系负责人 Ryan 表示:

虽然还没有确认日期,但是确认会发布。

这里我稍微给不太了解的小伙伴补充一下上下文细节:

我们之前在 MiniMax 官网使用的版本是能做出 2K 分辨率的片子的,但是在开源的版本里还不行。

而把分辨率提升到 2K 的效果,采用的也不是传统的超分办法。

可能“超分”这个词还是有点专业,我举个简单的例子来说一下。

假如我们现在画了一幅画。传统的办法就是,我们拿着这幅画去放大,看细节;看不出来细节,就猜。放大器看着 768p 像素的画面,把它拉大到 2K,边拉边猜测细节到底是个啥,给它补上去。

这么做有个问题:

它只能在原有的基础上修修补补。原有的画面如果有错误,那你超分出来的高分辨率画面仍然是错的。

但是 MiniMax 这里做了一个不一样的事情:

它们最后生成 2K 的这个操作是通过重新生成得来的。

在生成 2K 的这个阶段中,会把第一阶段生成的草稿图当作参考上下文,然后在 2K 分辨率下从头跑一遍完整的生成过程。

MiniMax 对 2K 重生成模型的技术说明

大家对 2K 重生成的这个模型的关注度,我看下来其实是最高的。MiniMax 的研究员 Kiro 补充了一些细节:这个 2K 重生成模型是一个专门用于潜空间的 DiT 模型。

这两个方法的核心区别就在于,超分是放大加猜细节,而重生成是重新创作一遍。它做出来的细节会更加合理、真实,甚至还会把第一阶段生成的小瑕疵给修补掉。

还有一个比较有意思的问题是,有网友问,H3 的稀疏注意力是否沿用了 M3 的那一套?

MiniMax 对 H3 稀疏注意力设计的回应

Kiro 对此的回答是:

H3 的稀疏注意力并没有沿用 M3 的 MSA 那一套架构,而是更贴近 MoBA 的设计。

那可能有的朋友不是特别了解啥是稀疏注意力,H3 的设计又是怎样的,我简单解释一下这是在干嘛。

其实无论是视频生成也好,还是我们平时就纯文本输出也好,最烧算力的部分其实就是注意力计算。

一段 15 秒的视频会被切分成海量的 token,默认情况下每个 token 都要跟所有其他 token 去做矩阵运算。这里面有一个很明显的问题:序列一长,计算量直接飞升爆炸。

稀疏注意力的思路就是,既然所有 token 互相做矩阵运算容易爆炸,那我索性就不让这些 token 都互相做运算了。

先把这些 token 打包成块,粗粗扫一眼每个块的摘要,再挑出重要的部分做运算,不重要的就直接跳过。

H3 的巧思就在于挑选块的方式上。

根据 Kiro 的回复来看,他们觉得视频里相邻两个画面内容本来就高度相似,所以每个块直接取平均值当概要就够用了,这样就直接省下了一整套需要学习的索引器。

还有就是他们也说了,目前只对视频 token 做了稀疏化,它们占了整个序列的绝对大头。他们预计在不久的将来会发布一个相对保守的版本。

网友还比较关心的一个问题是,官方是否会考虑推出一个速度更快的、低步数版本。

MiniMax 对低步数 H3 版本的回应

MiniMax 对此的回应是,现在这个版本其实本身已经具备一定加速了。当然它并不是专门针对“牺牲可接受的画质而换来快速推理”的一个模型。

官方只说了在积极考虑低步数的版本,但是没有做出具体的承诺。

这里比较有意思的是,虽然官方没做出具体的承诺,但是社区确实已经有人做出了 4 步的模型变体。

LightX2V 的 H3 低步数模型变体

我在 Hugging Face 上看到一个叫 LightX2V 的团队做出了一个快速版本,但是这个版本的效果嘛确实不太行。速度虽然快,但是画质下降,音频也会崩坏。

所以官方也说了,目前还只是在探索低步数的版本。

还有一个点我觉得值得关注的是:

MiniMax 确实打算推出一个图像生成模型!

MiniMax 对图像生成模型的回应

这个图像生成模型和 H3 属于同一基座,并且是一个统一模型,支持文生图、图片编辑等等。目前还处在后训练优化阶段。

还有一个大家反馈比较多的问题是:

人物一到远景就容易糊。

MiniMax 对 H3 远景画质问题的回应

有网友发现了这个问题,即使是在 25 步的情况下,也会发现视频画面中远景的东西容易出现像素化。

所以他问最推荐的配置生成参数应该是什么样的,还是说这就是 H3 的问题。

我觉得 MiniMax 好的一点是,倒也还真不藏着掖着,就是直接说,这是目前已知的模型问题,会持续调查看看到底是什么原因导致的。

目前来看,这是一个复杂的、涉及多个模型以及训练管道的系统层面原因。我们可以等后续的更新优化。

还有一个,也是我自己在测试的时候体会到的一点是:

这代 H3 明显非常遵守指令。

有网友也提出了相似的看法,并且问官方,到底是哪一部分贡献最大。

MiniMax 对 H3 指令遵循能力的回应

官方的回答有一种大道至简的感觉:

其实很难定义具体是哪一个部分,但是整个核心无非就是构建足够多样、够广的数据集,使用通用的架构,砍掉那些不能有效 scale 的东西。

也就是说,遵循指令只不过就是一个自然而然涌现的结果。

H3 从最开始的目标就是要能做到理解不同模态组成的上下文,从而在不同任务上都有不错的泛化表现。从实际表现来看,我觉得这套方法论其实是奏效了的。

最后还有一个比较打动我的问题:有网友问,在研发 H3 的过程中,哪个实验改变了团队对于视频模型究竟在学习什么的认知。

MiniMax 对 H3 泛化能力的回应

Nero 回答得非常真诚:

一个只训练了给首帧加文字描述去预测尾帧的模型,居然能在一堆图像编辑 Benchmark 上达到很不错的 zero-shot 成绩。

这说明模型已经学会了举一反三。

这也给了他们很大的信心:通过自然语言指令引导的上下文学习,能够在不同任务上都泛化得特别好。朝着这个方向继续 scaling,非常有前途。

整个 AMA 看下来,我其实就一个感受:MiniMax 的开放是认真的,不仅仅只是简单地把模型权重开源,还能真正把社区反馈纳入模型迭代的过程中。

这其实是我觉得开源模型生态里非常重要的一点。

因为一个开源模型真正的生命力,除了发布的那一天有多惊艳以外,它还会进入一个持续迭代的循环:

开发者发布模型,社区进行测试,用户提出问题,研究团队吸收反馈,然后推动下一版本继续进化。

这个过程某种程度上,比单纯追求某一次 Benchmark 上的成绩更加重要。

我们还不知道最终的视频模型会长成什么样,但至少从 H3 身上,我们看到了一条非常有意思的路线:

让模型尝试着真正理解这个多模态的世界。

以上。

COMMUNITY NOTES · 讨论

讨论与补充

评论将在接近此处时加载。