8月3日,MiniMax正式开源新一代通用视频模型H3。短短几天,它就在全球最大开源社区Hugging Face的趋势榜上冲到第一,甚至压过了DeepSeek V4 Flash。
更夸张的是,它在DesignArena评测平台拿下了视频编辑、多图生视频、图生视频三个类别的全球第一,把Seedance 2.0、Grok Imagine Video、Gemini Omni Flash这些闭源旗舰甩在身后。
最让人坐不住的是价格:2K分辨率+原生立体声音频,直出价格只要0.8元/秒。视频生成这个一直被认为是「烧钱游戏」的赛道,可能要被中国开源模型重新定义了。
01. 开源即登顶:H3出道就封神
过去提到视频生成,大家第一反应是Runway、Pika、Sora这些海外闭源产品。但MiniMax H3开源后,格局明显变了。
DesignArena榜单:MiniMax H3在视频编辑、多图生视频、图生视频三类均排名第一
榜单含金量 DesignArena是全球规模最大的众包AI生成设计评测平台,结果来自大量真实人类投票,比单一机构的测试分数更难刷榜。
社区热度 H3在Hugging Face趋势榜登顶,关注度超过了DeepSeek V4 Flash。这意味着全球开发者都在关注它,而不仅仅是中文媒体在自嗨。
一句话总结 H3不是在某个子任务上小胜,而是在视频生成的多个核心能力上同时做到开源社区最强。
02. 为什么能打:H3到底强在哪
MiniMax H3不是简单的「文生视频」模型,而是一个统一理解文本、图像、视频、音频的全模态生成系统。
MiniMax H3系统概览:上下文理解 → 基础生成 → 2K再生成
全模态输入 H3-Ref2VA模式最多支持9张图片、3段视频、3段音频混合输入,所有素材合计不超过12个。这意味着你可以用一段参考视频+一段参考音频+几张参考图,让模型理解整体风格并生成新内容。
原生音视频 H3不是后期配音,而是视频和立体声音频一起生成。输出分辨率最高2K、帧率24FPS、音频32kHz立体声,可直接用于短视频创作。
2K工作流 H3先用H3-Base生成768p基础视频,再通过H3-Regenerate-2K模块,结合原始上下文进行2K再生成,保留小文字和精细细节。
真正重要的区别 以前的视频模型更像「按文本出视频」;H3更像「按你给的多模态材料,重新组织出一段视频」。理解上下文的能力,是它甩开对手的关键。
03. 价格有多狠:0.8元/秒是什么概念
技术再强,落不到价格上就离普通人很远。H3真正让人兴奋的,是它把高质量视频生成的成本拉到了一个创作者完全能承受的范围。
直接对比 0.8元/秒,仅为同类主流闭源旗舰模型的三分之一甚至更低。生成一段15秒的2K短视频,只要十几块钱。
本地部署 H3-Base已经通过SGLang、vLLM、diffusers、ComfyUI等主流框架支持本地部署。企业可以私有化部署、自己微调,长期成本还会更低。
产业链响应 华为昇腾、摩尔线程、沐曦、海光、昆仑芯、天数智芯、壁仞、AMD、Intel等芯片厂商,以及Hugging Face、魔搭、ComfyUI等平台,都在开源首日完成了适配。这不是一家企业的事,是一条供应链在动。
对短视频博主、广告从业者、电商卖家来说,这意味着什么?以前拍一条产品视频要布景、模特、设备、后期;现在输入几张产品图和一段提示词,就能快速出片,成本从几千元降到几十元。
04. 普通人机会:这3类人应该关注
H3再强,也只有真正用起来才有价值。我觉得至少三类人可以开始关注了。
Hugging Face趋势榜:MiniMax H3登顶,热度超过DeepSeek V4 Flash
短视频创作者 剧情短片、产品种草、解说类内容,都可以用H3辅助生成镜头。特别是没有拍摄条件的小团队,创意终于可以不再被预算卡住。
广告与电商从业者 商品展示、场景化视频、多语言版本,都可以批量生成。0.8元/秒的定价,让A/B测试视频素材的成本几乎忽略不计。
开发者与AI从业者 H3的权重已经开源,可以本地部署和微调。视频生成领域终于有了像DeepSeek一样可深度定制的开源基座。
现实提醒 H3目前最长生成15秒,复杂长镜头、精细人物一致性仍然需要多次尝试和后期剪辑。它不是魔法,但确实把门槛降了一大截。
从DeepSeek颠覆文本模型,到MiniMax H3在视频赛道登顶,中国开源AI正在连续改写全球竞争规则。
美国巨头把顶尖模型锁在闭源高墙和高价API后面讲故事;中国企业则选择开放权重,把芯片厂商、开发者社区、云平台一起拉进生态。
这条路能不能最终胜出还不确定,但有一点已经很明显:开源不再意味着性能妥协,而是成本、生态和自主可控的新基准。对于普通创作者来说,最大的好消息是——好用的AI工具,正在变得越来越便宜。