据 MiniMax 稀宇科技消息,MiniMax H3 开源首周,技术团队在 Reddit(RDDT) AMA 和 ComfyUI Live 直播中,就模型核心架构、长视频续写、技术局限、推理优化及后续开源策略等开发者关心的问题进行集中回应,并分享了多项技术细节与使用技巧。
H3 的核心架构基于稀疏注意力机制,其策略更接近 MoBA。当前默认仅对视频 token 进行 3D 稀疏化,因为视频 token 在序列中占比最大,图像和文本 token 的稀疏化也在探索中。团队预计近期发布一个相对保守的参考实现版本,目标是在不产生可感知质量损失的前提下提供方案,并期待社区共同参与不同设备上的优化。
在视频 VAE 编码方面,将第一帧作为独立单元是为了统一图像和视频训练,使独立图像与视频首帧在数据侧被同等对待。采用独立的视觉 VAE 和音频 VAE,而非单一联合 VAE,是为了保留对多模态训练过程的控制,避免信息量较少的音频信号过早收敛和过拟合,从而更灵活地管理模态间训练进度。对于 VAE 的评估,团队更关注其潜在表示是否有利于生成建模,而非单纯追求最高重建质量。
关于指令遵循和泛化能力,团队认为关键在于构建广泛多样化的数据与任务集合,并使用通用、可扩展的架构进行训练。一个有趣的观察是,仅训练过 " 根据首帧和 caption 预测末帧 " 简单任务的模型,在零样本情况下也能在多个图像编辑基准上取得良好表现,这显示了原生上下文学习在自然语言引导下的任务泛化潜力。更多细节将在后续的技术报告中公布。
针对长视频续写,团队曾尝试使用扩展 RoPE 位置训练专门的续写任务,但因在多任务设置下泛化能力不足,最终发布模型采用标准的 reference-conditioning 来学习续写。Ref2VA 可将前序内容作为参考条件支持续写,但模型尚未原生训练过由多个递归续写片段组成的长轨迹。有开发者实践发现,通过反复让模型生成 141 帧并将上一段视频和音频的最后 51 帧作为参考,可整合出连贯的 60 秒视频,这印证了预训练中音视频续写任务的能力。
对于 Ref2VA 比 I2V 画质更糊以及纹理、远景人脸模糊等问题,部分原因在于两个模型的后训练策略存在差异,导致视觉质量倾向不同。团队正在推进提升 Ref2VA 的视觉质量,并建议用户提供高质量的参考输入。纹理和远景人脸问题已被列为后续重点,目前分析表明不能简单归因于视觉 VAE 的高压缩比或单一训练阶段,团队正在拆解主要影响因素。
在推理效率方面,当前模型已包含 CFG 蒸馏,具备一定的少步推理能力,但并非针对极端低步数专门蒸馏。团队正在探索步数蒸馏,以在不产生明显质量损失的前提下降低推理成本,并评估 4-NFE 或 8-NFE 版本,但近期无法承诺发布。H3 开放系统部分约有 600 亿参数,BF16 权重约需 120 GB 内存,远超多数消费(883434)级 GPU 容量。团队正在进行量化和权重卸载等优化工(850102)作,并建议用户使用最新版 ComfyUI、官方工作流和正确的低内存模型。
Regenerate-2K 是第二阶段条件生成模块,并非传统的超分技术,目前可通过 API 使用,后续将开源。团队还计划开源一个支持文本到图像和通用图像编辑的统一模型,该模型与 H3 共享基础谱系和同一 VAE 编码器。
在使用技巧上,官方发布过提示词指南并整合为 GitHub Skill。本地部署用户从文生视频模式入手最容易。Comfy 团队建议,输入音频参考时,在提示词中用引号写出角色对白并放在对应镜头描述中,可提升对白生成的稳定性。对于多镜头产品广告工作流,可通过输入参数定义视频时长和镜头数量,并借助 LLM 提示词增强器生成预览提示词。
关于开源计划,团队表示在 H3 发布后,社区已快速迭代出多种量化版本和硬件适配,这体现了开放协作的价值。公司的愿景是 "Intelligence with Everyone",将持续推动领域发展,并优先考虑在实际可用、资源可接受的前提下提供更强的能力。
原文:一晚两场,H3 技术团队和全球开发者聊了什么?(来源:MiniMax 稀宇科技)


登录后才可以发布评论哦
打开小程序可以发布评论哦