部署开源视频模型前,先看三条边界
"开放权重"不等于"开放完整链路"。决定自建部署一个开源视频模型之前,先看清三条边界:许可证边界、权重体量边界、接口兼容边界。任何一条没看清,都会在投入 GPU 之后才暴露。
边界一:许可证不是 Apache/MIT
以 MiniMax-H3 为例,模型采用 MiniMax H3 Community License,不是 Apache 或 MIT。这带来三个具体约束:
- 地域排除:许可适用地域明确排除美国、欧盟、英国和韩国。租用 GPU 时必须核对服务器的物理地域,不能只看云厂商的品牌或账户归属地。
- 营收门槛:年营收超过 2000 万美元的商业产品或服务,需要事先取得书面授权。
- 署名要求:商业产品界面需要显著展示模型名称。
开源不等于无条件可用。部署前先读许可证,比先买卡便宜得多。
边界二:权重体量不能只按参数量估算
H3 的 Transformer 是 33B dense 模型,但 BF16 权重的实际体量远不止 33B 对应的大小。公开的组件清单包括:两个 DiT 各约 66.3GB、Qwen3-VL encoder 约 51.5GB、视频 VAE 约 10GB、音频 VAE 约 0.6GB。
这意味着两件事:第一,磁盘和显存预算要按组件清单算,不能按参数量拍脑袋;第二,只部署一个任务分区可以显著减少压力——初次验证优先只下载 FL2VA(文生/首尾帧生视频),避免同时加载两个 DiT。
官方实测的三个档位可作参照:低成本验证用 2 张 RTX 5090 32GB(约 384GiB 内存,768p、5 秒、50 步约 560 秒,用 Turbo LoRA 可压到约 78 秒);推荐生产起点是单机 4 张 H100 80GB(峰值约 66GB/GPU);大显存生产用 4 张 H200 141GB(同规格约 74-84 秒端到端)。
边界三:开放的部分不等于完整的官方链路
H3-Base 的 FL2VA 与 Ref2VA checkpoint 已经开放,可用 SGLang、vLLM-Omni、Diffusers 或 ComfyUI 私有部署。但官方完整 2K 链路中的 H3-Context-IR 与 H3-Regenerate-2K 尚未开源。本地 768p 可以完全私有运行,但不能对外宣称等同于官方 2K API 的效果。
接口层面也有坑:路径同名不等于已兼容。我们的 AI 画布项目通用视频分支虽然也用 /v1/videos,但请求是 multipart 格式(seconds、size、preset、input_reference[] 等参数);而 H3 本地服务示例用的是 JSON(task、conditions、target)。接入前必须新增 adapter 或做明确的参数映射,并跑真实 E2E 验证,不能看到路径一样就假设能通。
小结
自建部署开源视频模型,真正的成本不在 GPU,而在三条边界:许可证决定你能不能用,权重体量决定你要花多少钱,接口兼容决定你要写多少代码。三条都看清了,再下单买卡。