Wan2.2-S2V-14BAIGC阿里巴巴通义万相2025-08-26模型简介万相的语音驱动视频模型,音频加一张图就能生成分钟级的说话视频,长时序稳定性是重点。HuggingFace ↗GitHub ↗输出类型生视频架构DiT(音频驱动视频)参数量16.3B所属Wan商用可商用许可Apache-2.0发布2025-08-26收录2026-10-03