越过生产门槛,开源才不是空谈。
定焦One(dingjiaoone)原创
作者 | 苏友宁
编辑 | 阮梅
视频模型又卷起来了。
7月31日,MiniMax和字节跳动先后发布了各自的视频模型。
Seedance 2.5将单次生成时长延长至30秒,增加了参考素材数量和局部编辑功能,提供480P和720P两档输出。H3最长仍为15秒,但可以同时接收文字、图片、视频和音频,输出带双声道声音的2K视频。MiniMax还承诺在数日内开放模型权重。
字节继续拉长镜头,MiniMax准备放开模型。后者给这轮竞争增加了一个变量。
过去这个行业的规则是,谁手里的模型最强,谁就掌握价格、入口和分发。即便有视频模型开源,但能真正能嵌入真实制作流程的少之又少,要么画质不够稳,要么复杂指令易失真,或是改一处就牵动整段。这次,H3把旗舰模型开源,动的正是这条规则。
它试图成为行业首个达到商用级水平、同时开放权重的多模态视频基座模型,在发布时交出了画质、精准编辑和音画协同能力。如果第三方能够复现这些能力,H3的开源就不只是一场社区事件,还可能成为一次产业事件。
视频模型的下一程,也因此不只比谁的镜头更长、画面更好,还要比谁能进入更多工具和工作流,并最终把技术优势转化为换成实打实的调用量和收入。
一位独立电影创作者的吐槽,或许比跑分更能解释H3想解决什么。
创作者chukwuDEJI在X上说,他曾将同一条提示词反复提交给Seedance,十多次被拒后只能放弃。换用刚刚发布的H3后,这个镜头很快生成,价格也更低。他感叹,如果H3早些发布,自己的电影或许已经能用上。
另一位创作者padphone只上传了一张产品图和一句提示词,H3便生成了一段2K广告。真正打动他的除了清晰度本身,还有模型自行把光线、镜头和品牌调性都处理好了。
个案不能代替系统评测,但它们代表的方向一致,视频模型的竞争,正在从能不能生成转向能不能交付。
当分辨率、时长等指标被迅速追平,创作者在意模型能否理解真实任务、稳定执行指令,并让结果顺利进入后期。这也正好是理解H3的三个入口。
先看它如何理解素材。
过去,创作者得把人物、动作、运镜和声音全部翻译成提示词。需求越复杂,转述中的信息损耗越大。H3允许素材本身成为指令:一次最多接收9张图片、3段视频和3段音频,但混合素材总数不超过12份。广告导演可以直接提交产品图、品牌视觉、参考片和配乐;动画团队也可以把角色设定、动作样片和分镜一并交给模型。
在测试中,一些创作者只提供少量人物图片和一段音乐,模型便能自行组织画面。甚至有用户发现,参考图给得过多,反而会限制H3的发挥。这说明模型不只是在复刻素材,也在尝试理解素材之间的关系。
输出端同样在提升。H3覆盖文生视频、图生视频和参考素材生成,最长可以输出15秒、带原生双声道音频的2K视频。它仍主要服务于单个镜头,不是一次生成完整影片,但能力范围已经进入头部视频模型的竞争区间。
其次是精准执行。
多位AIGC导演曾向「定焦One」表示,实际生产中最头疼的往往不是生成,而是修改。只想替换桌上的商品,模型却可能连人物姿态、镜头节奏和画面色调一起改掉;一处局部调整,甚至会污染整段视频,团队只能重新“抽卡”。
H3将人物替换、背景更换和动作迁移等能力整合进同一模型,核心是识别哪些内容需要改变、哪些内容必须保留。它可以沿用参考动作只替换人物,保留主体关系只更换背景,也可以局部调整服装、声音或镜头节奏。多位测试者因此将“指令遵循”视为H3最突出的能力之一。
这项能力直接关系到成本。一段AI视频的真实价格,并不是模型标出的单次生成费用,得用“生成价格×抽卡次数”,再加上人工返工成本。编辑越稳定,可用镜头的综合成本就越低。
第三,是能否进入后期。
过去,视频模型更擅长制造原料。团队拿到生成片段后,仍要分别处理字幕、动效、声音、转场和包装。每增加一个工具,都会多一次格式转换,也多一次素材错位的风险。
H3开始把部分后期能力收进生成过程。它能基于已有视频补镜头、换元素、调风格,完成转场、卡点和视觉增强;也可以保持标题、品牌名和游戏UI的可读性,让文字服从画面的透视和运动;还能接收参考音频,完成音色克隆和音画协同,直接输出双声道声音。
H3还不能取代完整后期,调色、混音、版权审核和精细剪辑,仍然需要专业人员。变化在于,它交付的是一份更接近制作要求、可以继续加工的镜头素材。
这也是讨论H3开源的前提。开源的分量,取决于被开放的能力站在什么位置。一款只能展示Demo的模型开放权重,无非是给市场添个备选;一款越过生产门槛的模型开源,才可能改变产业分工。
H3试图做的正是后者,把画质、精准编辑和音画协同等核心能力带进开源体系,让开源视频模型有机会与闭源旗舰坐到同一张牌桌上。
当“开源”不再等于“次一级”,视频生成的竞争规则也开始松动了。
H3开源的分量,可以先从一组差距看起。
在Artificial Analysis基于盲选投票的视频榜单中,H3以1242分位列有声文生视频第二,仅比第一名Gemini Omni Flash低4分,高于Seedance 2.0;在无声图生视频榜单中,它同样排名第二;在视频编辑榜单中,则以1130分位列第一。
图源 / Artificial Analysis
榜单会随投票变化,也替代不了真实生产中的长期检验。但它至少说明,开源与旗舰之间的差距在收窄。
过去使用视频模型,往往是一道取舍题:要最好的效果,就接受闭源厂商的产品、价格和规则;要部署自由,就接受相对落后的画质与能力。H3想打破这种取舍。
最先改变的,是这项能力由谁提供。
闭源模型触达用户通常只有两条路:进入厂商自己的产品,或者通过官方接口对外收费。模型部署在哪里、运行在哪种芯片上、价格如何调整,主动权都掌握在模型公司手中。
开放权重相当于把一部分主动权交了出去。H3发布当天,开发者平台Vercel将其接入自家服务,SeaArt也宣布上线。这类接入依靠官方服务,可以迅速扩大模型触达范围;权重开放则更进一步,让第三方有机会改变模型的运行方式。
图源 / X
ComfyUI核心开发者账号comfyanonymous在Reddit表示,团队已经提前拿到H3的权重和代码,将提供首日支持。经过优化,模型甚至可以在RTX 3060上运行,只是速度会慢一些。更关键的是,据其介绍,团队拿到的是与API一致的权重。
图源 / Reddit
这意味着,H3交给社区的不是一个缩水版。MiniMax还表示,H3能够适配多款国产芯片,2K视频的生成成本0.8元/秒,不到主流产品的三分之一。若这些条件能够被第三方稳定复现,视频模型的供应方就会从单一厂商扩展到云平台、推理服务商和本地部署团队。
第二层变化,是模型会从一款独立产品变成工具的底层。
大多数创作者不会下载权重,也不关心模型部署在哪块芯片上。他们接触H3的方式,更可能是剪辑软件里的一个按钮、设计工具里的一组功能,或电商后台里的一条自动化流程。所以模型能铺多广,不仅取决于海螺AI拥有多少用户,更要看多少产品愿意将H3做进自己的功能。
有些开源视频模型已经走过这条路。LTX-2发布后很快获得ComfyUI支持;万相Wan2.2开放后,社区陆续补上各种适配,让它进入了更多工具、运行在更便宜的显卡,也能以较低成本训练出定制风格和角色。一款模型由此不再对应一个固定入口,它可以被拆进不同工具,与剪辑、配音、放大和角色控制自由组合。
H3的不同在于,这回进入这套生态的,是一项已经接近闭源头部模型的能力。第三方产品不用先替基础画质“补课”,可以直接围绕广告、电商、游戏和影视的工作流做产品。
更深一层的变化发生在企业内部:开源让模型有机会成为企业可控制的生产基础设施。
广告公司需要商品、Logo和品牌色在每条视频中保持稳定;游戏公司需要角色与画风长期一致;影视团队还要考虑未公开素材和版权资产能否上传公有云。对这些客户而言,画质只是准入门槛,数据能否留在本地、模型能否围绕自有资产调整、成本能否被长期控制,才是真正的采购理由。
在许可允许、工具链成熟的前提下,企业可以私有部署H3,并围绕品牌素材和业务流程继续训练。模型就不再是一个按次付费的外部服务,更像是企业自己掌握的一段生产链。第三方服务商也可以据此搭建工作流,将同一套能力带入广告、游戏、影视和电商等不同场景。
如果说闭源模型主要争夺用户,开源旗舰争夺的就是参与者。当更多公司能够部署、改造和分发同一项前沿能力,这场竞争就从几家厂商拼模型,扩展为不同生态之间的比拼。
不过,截至发布时,H3的权重仍处于“即将开放”状态。ComfyUI等合作方的提前适配,并不等于普通开发者已经可以自由部署。许可协议、完整配套代码和实际部署所需的算力成本,也尚未完全公布。
H3能否真正成为产业底座,最终要看这些条件是否足够友好,以及第三方能否在官方产品之外,复现它所展示的画质、编辑能力和成本优势。
开源不等于退出商业竞争,是换一种方式参与竞争。
对于字节跳动这类平台型公司,开放模型并不是扩大分发的必要条件。它已经拥有一套内部生态,可以独自完成能力的应用、反馈和变现。
以Seedance为例。模型发布后,可以迅速进入即梦、剪映等创作工具。用户从脚本、分镜、生成到编辑、导出,都不必离开同一套产品;生成的内容还可以继续进入抖音、红果和TikTok的内容场。
一位AIGC从业者曾向「定焦One」概括字节跳动的优势:番茄提供IP,即梦、剪映等工具完成制作,抖音、红果和TikTok承担分发,巨量引擎承接投流。她看到是生产、分发和变现链路同时向一家公司集中。保持闭源,可以将能力优势留在内部,进一步强化不同产品之间的协同。
MiniMax具备的条件不一样。
与抖音、快手相比,海螺AI仍是一款相对独立的创作产品。MiniMax短期内或许难以补齐内容平台、流量入口和商业化网络,但它换了个方式进场:不完全依靠自有产品触达用户,而是把云厂商、企业服务商、创作工具和开发者变成新的分发节点。
这并非H3发布时的临时选择。从M2、M2.1、M2.5、M2.7到M3,MiniMax持续开放模型权重;H3只是第一次将这条路线延伸至旗舰视频模型。MiniMax的财务数据也印证了这条路的分量。
5月28日,MiniMax披露,过去两个月年化经常性收入(ARR)增长超过100%;以今年2月已超过1.5亿美元的基数计算,最新ARR已超过3亿美元。其收入结构也由2025年的C端约占七成、B端约占三成,转为B端与C端各占一半。同期,MiniMax服务的全球企业和开发者客户超过100万,半年增长5倍,全球用户约3亿。对MiniMax而言,外部平台、企业客户和全球开发者,本就是其增长的重要来源。
图源 / Minimax官网截图
由此看,“Intelligence with Everyone”这句品牌口号,慢慢长成了一套商业策略:MiniMax负责训练基础模型,外部生态参与部署、优化和场景改造,再由API、企业服务和自有产品承接商业价值。
把几家公司的选择放在一起,是一场典型的非对称竞争。
字节跳动、快手依靠纵向一体化,将模型嵌入自己的产品、内容平台和商业化体系;MiniMax则横向开放模型,争取成为更多产品共同使用的技术底座。前者追求对完整链路的控制,后者让渡一部分控制权,换取更广泛的分发。
这种差异,也把视频生成推向了下一程。
一位AIGC导演向「定焦One」判断,往后头部模型的能力会越来越接近,用户留存将成为更大的考验。到那时,画质和榜单仍然重要,但不足以定胜负。价格、稳定性、部署方式和工作流适配能力,将更直接地影响用户调用与企业采购。
开源也并非没有代价。权重开放后,MiniMax产品侧也许会失去一部分产品独占性,生态创造的价值也可能被云厂商和工具平台分走一部分。因此,判断H3开源是否成功,不能只看下载量和社区热度,得看它能否转化为持续调用、企业部署和真实收入。
字节跳动、快手选择把模型变成内部系统的增量,MiniMax则试图让模型成为外部生态都愿意用的公约数。两条路线尚未分出胜负,但竞争的尺度已经改变:视频模型从“比谁强”变成了谁能进入更多生产流程,并在那里长期留下来。这条以开放换分发的路,MiniMax已经走了很久。
*题图来源于Minimax稀宇科技视频号截图。