XGEN 实验室的第一人称交互体验模型,用输入信号实时驱动视角与画面,面向沉浸式内容与仿真。
时间全部时间
所属全部所属
筛选全部
2026 年 9 月 2
蚂蚁灵波为消费级单卡设计的 1.3B 实时世界模型,让个人开发者也能在本地跑起实时交互视频生成。
2026 年 8 月 7
Viggle 开源的角色替换模型,只要重画一帧就能把整段视频里的人物换成新角色,身份与时序都保得住。
蚂蚁开源的 4D 人物重建模型,用一段普通手机视频生成多视角视频,接上 4DGS 就能重建可动的三维人物。
Lightricks 最新的开源音视频世界模型,原生多镜头一次成片并支持 4K HDR,是当前开源视频模型的头部选手。
万相的角色动画第二代,取消中间动作提取器实现端到端驱动,还能用文本解耦出想要的镜头视角。
京东的指令式视频编辑模型,用自然语言改视频内容并保持时序一致,Apache-2.0 可商用。
Sand.ai 开源的千亿级 MoE 视频模型,114B 总参数单次只激活 6B,把超大模型的推理成本压了下来。
MiniMax 开源的全模态音视频生成模型,最高 2K、15 秒、原生立体声,是国产开源视频模型的性能标杆。
2026 年 7 月 5
Sber 的世界模型新作,2B 权重以 MIT 开放,主打物理一致的短视频世界推演。
阿里万相的分钟级音乐驱动舞蹈视频模型,用全局关键帧加局部精修实现长程动作连贯。
面向单张桌面显卡的无限交互世界模型,把「实时可玩」的世界生成压到消费级硬件上。
蚂蚁灵波面向具身智能的 MoE 视频模型,用 7 万小时具身数据训练,30B 总参只激活 3B,推理效率提升约三倍。
蚂蚁灵波的小时级实时交互世界模型,720p/60fps 稳定输出,并首次把 Agent 机制引入世界模型。
2026 年 6 月 3
智谱开源的角色动画模型,用端到端驱动替代骨骼等中间表示,换了角色或换成动物也能驱动。
京东的长时音视频生成模型,面向连续故事与可交互世界,一次能续出带同步音频的长视频。
字节的视频生成渲染器,先用语义规划把「要发生什么」排好再交给扩散渲染,复杂多主体场景更稳。
2026 年 5 月 5
百度 6.3B 的音视频生成模型,把口型、音效与画面同步做进同一套权重,音画对齐是它的核心卖点。
美团开源的商用级音频驱动数字人视频模型,支持单人多人对话与长视频续写,MIT 许可可直接商用。
Cosmos 3 世界模型平台的图生视频入口,64.6B 参数面向机器人、自动驾驶这类物理 AI 场景。
NVIDIA 的分钟级世界模型,单卡就能生成 60 秒 720p 视频并支持 6 自由度相机轨迹控制。
NVIDIA 的多镜头长视频生成模型,在 Wan2.2 基础上解决长时序一致性,面向长叙事视频。
2026 年 4 月 1
腾讯混元把 MLLM 接进视频生成,支持多图组合、参考图与视频编辑等自由形态输入,还带了一套智能视频生成基准。
2026 年 3 月 4
Netflix 开源的视频物体擦除模型,连物体删掉后引发的物理连锁变化一起重绘,是目前最会「擦」的开源视频模型。
Matrix-Game 的 3.0 版,交互世界模型的稳定性与长时一致性继续提升,许可也换成了更干净的 Apache-2.0。
SII-GAIR 与 Sand.ai 合作的开源音视频基础模型,用单流架构换速度,说话人视频一次成片。
Lightricks 的 20.9B 多模态视频模型,主打消费级显卡本地推理与 4K 输出,把开源视频生成推向商用可用。
2026 年 1 月 3
蚂蚁灵波首个开源实时交互世界模型,可稳定生成长达分钟级的高保真视频,是国产开源世界模型的代表。
昆仑万维的多模态上下文视频模型,一个框架同时覆盖参考图生视频、视频续写与音频驱动数字人。
Lightricks 首个开源音视频联合生成基础模型,一次生成自带同步音频的视频,是 2026 年开源视频模型的序章。
2025 年 12 月 5
美团开源的长视频数字人模型,支持单人、多人对话与长视频续写,MIT 许可下可直接商用。
上海 AI Lab 的超长视频世界模型,靠深度与点图控制信号在分钟尺度上维持几何与时序一致。
腾讯混元的世界模型新作,把动作控制与场景一致性结合,做可交互的连续世界探索。
把 SANA-Video 与 LongLive 的长上下文扩展拼起来,单卡能做到 27FPS 生成分钟级连续视频。
智谱的角色动画预览版,用 3D 一致姿态做上下文学习,大幅动作与风格化角色下结构都还稳。
2025 年 11 月 4
混元视频的 1.5 版,把参数量压到 8.3B 却把画质与运动做上去,单卡可跑,是 2025 年底最强的一档开源视频模型。
Kandinsky 5.0 的 19B 旗舰版本,文生视频与图生视频同时开放,曾在 LMArena 开源文生视频榜登顶。
Sber 的轻量图生视频权重,MIT 许可,俄语与英语提示都能用,是俄语区开源视频方案的代表。
让多个主体在复杂空间关系与时间逻辑下保持一致,明显缓解多主体视频里的语义漂移。
2025 年 10 月 5
智谱的多主体参考图生视频框架,多张参考图条件下同时保持主体一致并把背景解耦开。
NVIDIA 把 SANA 的高效路线搬到视频上,2B 权重就能出 720P 视频,对消费级显卡很友好。
美团开源的 13.6B 视频模型,一套权重覆盖文生、图生与视频续写,MIT 许可可直接商用。
把一段参考视频当成「提示词」来做统一语义控制,不用按任务重训就能迁移运动、风格与主体语义。
统一 Text2World / Image2World / Video2World 的世界基础模型,为机器人与自动驾驶预测物理合理的未来画面。
2025 年 9 月 6
把画面与声音放进同一次生成过程的双塔模型,音效、音乐与口型天然同步,不用再事后对齐。
只有 2B 的轻量文生视频模型,预训练、SFT、CFG 蒸馏与少步蒸馏权重一次放齐。
字节从单张人像生成个性化视频的方案,用轻量身份适配器守住人脸一致性,另配 24fps 的 Lite 版本。
万相的角色动画模型,把参考视频里的动作迁移到任意角色并替换场景,是开源角色动画的分水岭。
Decart 开源的实时视频编辑模型,换衣服、改场景这类指令在单卡上就能做到接近实时。
字节的人本视频模型,同时吃文本、参考图和音频,音画同步与主体身份保持是它的重点。
2025 年 8 月 4
腾讯开源的世界模型,用「边走边生成」的方式做可探索的 3D 场景视频,面向游戏与仿真。
万相的语音驱动视频模型,音频加一张图就能生成分钟级的说话视频,长时序稳定性是重点。
腾讯开源的游戏世界模型,用动作信号驱动可控游戏画面生成,面向「边玩边生成」的互动内容。
Matrix-Game 的 2.0 版,把实时流式交互做到 25fps 级别,开源世界模型第一次逼近「可玩」体验。
2025 年 7 月 4
Wan2.2 的图生视频版本,延续 MoE 设计,在保持首帧一致的同时把运动幅度做上去。
Wan2.2 的文生视频版本,用 MoE 把「高画质」和「低显存」拆成两个专家,电影感美学是它的招牌。
Wan2.2 里最轻的一档,5B 权重在单张消费级显卡上跑 720P,把这一代的可用门槛压到最低。
LTX-Video 的 0.9.8 版,画质与运动稳定性继续提升,蒸馏版几步就能出片。
2025 年 5 月 5
字节把 Phantom 的主体一致性框架移植到 Wan2.1 上,单张或多张参考图就能生成主体一致的视频。
腾讯开源的音频驱动数字人模型,一张图加一段音频就能出口型同步的说话视频,支持多角色对话。
VACE 的 14B 正式版本,把参考、遮罩与控制信号统一到 Wan2.1 上,是当时最通用的开源视频编辑底座。
腾讯混元的定制化视频模型,支持主体保持、身份参考与音频驱动,把「让指定的人或物动起来」做成开源能力。
昆仑万维开源的交互式世界模型,用键盘鼠标信号实时驱动画面,是「可玩的开源世界模型」第一批尝试。
2025 年 4 月 5
Cosmos 的第二代预测模型,2B 与 14B 两档同时覆盖视频生成与世界状态预测。
Sand.ai 的 24B 视频模型,用自回归分块生成做到「边生成边播放」,把可控性与长视频续写带进开源方案。
昆仑万维的开源视频模型,用扩散强迫把长视频的一致性做上去,540P / 720P 与 1.3B / 14B 一并放出。
Wan2.1 的首尾帧生视频模型,给定首帧与尾帧就能补出连贯过渡,中文提示词场景优化得比较到位。
阿里 VACE 把参考图、遮罩、姿态、深度等控制信号统一成一套视频编辑接口,先放 1.3B 预览权重试水。
2025 年 3 月 4
Step-Video 的图生视频版本,30B 权重继续以 MIT 开放,镜头运动与物理一致性在当时属第一梯队。
Lightricks 的 LTX-Video 首版实时模型,30FPS 下生成速度快于播放速度,2B 权重配 Open RAIL-M 可直接商用。
腾讯把 HunyuanVideo 补上图生视频能力,同时给出角色参考与镜头控制示例,是当时中文场景最好用的开源视频模型。
以约 20 万美元成本训练出的 11B 开源视频模型,一套权重同时覆盖文生与图生视频,把 Sora 级效果的成本门槛压了下来。
2025 年 2 月 5
字节开源的身份保持人像视频模型,一张照片加文本就能生成人物视频,重点解决语义冲突与生硬贴脸。
Wan2.1 的图生视频版本,720P 权重让「一张照片动起来」第一次有了可商用的开源方案。
同批放出的 1.3B 小模型,8G 显存的消费级显卡就能出 480P 视频,把视频生成的门槛真正拉了下来。
阿里万相的 14B 文生视频模型,用 Apache-2.0 开放权重,是 2025 年开源视频生态里被复用最多的一套底座。
阶跃星辰开源的 30B 文生视频模型,发布时是参数规模最大的开源视频模型,MIT 许可让商用没有后顾之忧。
2025 年 1 月 1
NVIDIA 世界基础模型平台的第一代扩散模型,把「按文字生成可交互世界」做成了开放权重的一整套工具链。