MiniMaxH3本地部署教程:硬件选型、安装与出片验证

作者:超级管理员发布于 2026-08-09 22:33:57更新于 2026-08-09 22:36:34
MiniMaxH3本地部署教程:硬件选型、安装与出片验证
核心答案:可以本地部署MiniMax H3,但当前纯本地开源部分是H3-Base,主要输出768p、24 FPS、带32 kHz双声道的4~15秒MP4。个人测试优先ComfyUI,生产服务优先SGLang;官方完整2K链路仍需Context-IR和Regenerate-2K API。

MiniMaxH3本地部署可以实现,但截至2026年8月9日,纯本地开源范围是H3-Base的768p音视频生成,不是完整2K链路。H3-Context-IR和H3-Regenerate-2K尚未开源;要复现官方完整2K流程,仍需调用MiniMax开放平台API。官方仓库将输出定义为4~15秒、24 FPS、32 kHz双声道,并提供FL2VA与Ref2VA两类权重。MiniMax H3官方仓库

多GPU工作站接收文本图像视频音频并输出同步音视频的MiniMax H3本地部署场景

本地部署到底能获得哪些能力

本地H3-Base能完成文生音视频、首尾帧生音视频和多模态参考生音视频。FL2VA权重同时服务t2va和fl2va:不传图片即文生视频,传首帧、尾帧或两帧即可控制起止画面;Ref2VA可组合图片、视频和音频参考,用于人物、风格、运动、镜头或音色迁移。官方限制为最多9张图、3段视频、3段音频,混合输入最多12个文件,音频不能作为唯一参考。

H3 Context IR、可本地部署的H3 Base与H3 Regenerate 2K能力边界图

先按硬件和用途选择部署路线

个人创作优先ComfyUI,团队API服务优先SGLang。ComfyUI 0.30.0起原生提供T2V、I2V和R2V模板,并提供裁剪、INT8与量化文本编码器组合;SGLang更适合固定端口、异步任务、批量调用和多GPU并行。

  • 消费级单机:选择ComfyUI量化权重,从低分辨率、5秒短片开始;实际速度受显存、系统内存、磁盘和卸载策略共同影响,官方没有给出统一最低显存承诺。
  • 工作站:SGLang已验证2×RTX 5090 32 GB的分层卸载方案,但同时使用约384 GiB级主机内存;50步、1344×768、5秒样例约需560秒。
  • 生产服务器:官方验证配置包括4×H100 80 GB、4×H200及B200/B300等。4×H100推荐TP2+Ulysses2,实测峰值约66 GB/卡。

ComfyUI个人创作路线与SGLang多卡服务路线对比图

用ComfyUI完成最容易复现的本地部署

最短路径是更新ComfyUI后直接加载官方模板。先安装最新版ComfyUI并确认版本不低于0.30.0;手动安装可在独立环境中依次执行:

git clone https://github.com/comfy-org/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
python main.py

浏览器打开本地地址后,进入“Template Library → Video”,搜索“MiniMax H3 T2V”。按弹窗下载模型,或将minimax_h3_fl2va_pruned_int8_convrot.safetensors放入models/diffusion_models/,将qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors放入models/text_encoders/,两个视频/音频VAE放入models/vae/。首次测试建议使用模板默认预览分辨率、5秒、固定seed;确认能输出同时含画面和音轨的MP4后,再升至约1344×768。ComfyUI官方H3教程

用SGLang部署可调用的视频生成服务

SGLang适合把H3做成局域网API。Linux服务器准备可用CUDA环境、FFmpeg与足够磁盘后,安装扩散依赖并启动FL2VA服务:

uv pip install "sglang[diffusion]" --prerelease=allow
sglang serve --model-path MiniMaxAI/MiniMax-H3 --model-variant fl2va --num-gpus 4 --tp-size 2 --ulysses-degree 2 --performance-mode speed --host 0.0.0.0 --port 30010

需要参考图、参考视频或参考音频时,另起服务并把--model-variant改为ref2va。不要把--model-path指向手工下载的FL2VA子目录;SGLang会从模型根目录完成组件映射。首次启动会下载大量权重,生产环境应先固定版本、校验文件完整性,并把模型缓存放在高速SSD。SGLang官方部署指南

如何验证服务确实部署成功

成功标准不是“端口能访问”,而是任务能完成并下载到带立体声音轨的MP4。POST /v1/videos提交task=t2va、5秒、16:9、短边768、50步的请求,保存返回的任务ID;轮询GET /v1/videos/{id}直到状态为completed,再从/v1/videos/{id}/content下载文件。使用ffprobe -show_streams output.mp4检查视频应为24 FPS,并存在AAC双声道音轨。先固定prompt和seed保存基准样片,再调整并行、量化或缓存参数。

常见故障、性能优化与合规边界

OOM优先降低时长和分辨率,再处理卸载与并行,不要一开始就改采样算法。模型找不到通常是目录放错或ComfyUI版本过旧;只有画面没有声音,应检查Audio VAE、FFmpeg和工作流音频节点;SGLang的file://输入必须在服务进程或容器内可见。2K并非本地H3-Base的直接输出,不要把普通插值放大描述为官方Regenerate-2K。

上线前必须阅读MiniMax H3 Community License。当前适用地域明确排除欧盟、英国、韩国和美国;商业产品界面还需显著展示“MiniMax H3”,年收入超过2000万美元的商业产品或服务须事先取得书面授权。公开发布生成内容还应清晰标注AI生成。H3许可证原文

总结

MiniMaxH3本地部署的稳妥顺序是:先确认许可证与硬件,再用ComfyUI跑通5秒768p样片,最后按吞吐需求迁移到SGLang。当前纯本地重点是H3-Base;完整2K仍是“官方Context-IR API+本地H3-Base+官方Regenerate-2K API”的混合链路。把首个基准样片、固定依赖版本、显存峰值和耗时记录下来,才能形成可维护的生产部署。

常见问题

MiniMaxH3本地部署最低需要多少显存?

官方没有给出统一最低显存。SGLang验证过4×H100/H200和2×RTX 5090等配置;消费级单卡应使用ComfyUI量化权重与动态卸载,并从低分辨率、5秒短片开始测试。

MiniMaxH3本地部署能直接生成2K视频吗?

不能把当前开源H3-Base等同于完整2K系统。H3-Base纯本地主要输出768p;官方2K效果还需要尚未开源的H3-Context-IR和H3-Regenerate-2K模块或其API。

MiniMaxH3本地部署用ComfyUI还是SGLang?

个人创作和节点调参优先ComfyUI,部署步骤更直观;需要局域网API、多GPU并行、队列和批量调用时选择SGLang,并按官方验证过的硬件拓扑配置。

MiniMaxH3本地部署后为什么只有画面没有声音?

先确认Audio VAE文件位于正确目录,工作流已连接音频解码与合并节点,同时检查FFmpeg是否可执行。SGLang还应验证输出MP4中存在AAC双声道音轨。