HuMoAIGC字节跳动 ByteDance2025-09-10模型简介字节的人本视频模型,同时吃文本、参考图和音频,音画同步与主体身份保持是它的重点。HuggingFace ↗论文 ↗输出类型生视频架构DiT(文本 + 参考图 + 音频三条件,17B)参数量17B所属HuMo商用可商用许可Apache-2.0发布2025-09-10收录2026-10-03