蚂蚁开源的 6B 设计向生图模型,专攻 UI、信息图与海报这类文字密集版式,并支持 RGBA 透明底输出。
时间全部时间
所属全部所属
筛选全部
2026 年 9 月 3
Qwen-Image 的第二代,把生成与编辑统一进 7B 的 32 层单流 DiT,能原生出透明通道图,但许可是研究用途。
上海 AI Lab 的多码本扩散大模型,用 1B 激活参数一起做图像生成、编辑、视频与 3D 理解。
2026 年 8 月 2
蚂蚁的离散扩散图像模型,连训练配方一起开源,文生图与编辑共用一套权重。
商汤的统一多模态模型 U1.5,理解与生成共用一套 MoT 主干,Apache-2.0 且带完整的中文文档。
2026 年 7 月 2
微软的 4B 原生分辨率生图基座,A100 上 0.59 秒出一张 1024²,用四分之一规模逼近 32B 级模型的质量。
Mage-Flow 家族的指令编辑成员,1024² 编辑一次约 1 秒,是目前最快的高分辨率开源编辑模型之一。
2026 年 6 月 3
商汤的视觉中心统一模型,同一架构里兼顾图像生成、编辑与深度、分割等稠密感知,但许可是非商用。
设计工具公司 Krea 首次放出自己的文生图权重,Raw 与 Turbo 双版本同时上线,审美取向偏商业设计。
英伟达把掩码离散扩散用到高分辨率文生图上,8B 规模在 GenEval 上做到 0.90,但只授权研究与评估用途。
2026 年 5 月 5
NVIDIA Cosmos 3 世界模型平台的文生图入口,64.6B 参数面向物理 AI 场景,许可为 NVIDIA 开放模型协议。
ERNIE-Image 的美学偏好版本,把出图口味往「好看」上调,用来做风格化内容更省提示词功夫。
字节的轻量统一多模态模型,一套权重同时做图像与视频的理解、生成和编辑,把「统一」做到了 3B 量级。
HiDream 的 O1 系列图像模型,8.8B 参数兼顾文生图与参考图编辑,继续以 MIT 许可开放。
SenseNova-U1 的 MoE 主干版本,用稀疏激活把统一理解与生成的推理成本压下来。
2026 年 4 月 3
商汤的原生统一多模态模型,去掉视觉编码器与 VAE,在单一架构里同时做图像理解、文生图与指令编辑。
百度开源的 8B 文生图基座,中文提示与汉字排版是强项,和 Turbo 版一起构成 ERNIE-Image 家族。
百度 ERNIE-Image 的少步版本,8B 权重以 Apache-2.0 开源,主打中文场景与快速出图。
2026 年 3 月 3
京东开源的空间智能图像编辑模型,支持物体移动、物体旋转与相机视角控制三类空间编辑指令。
完全开源的稀疏 MoE 扩散模型,17B 总参数只激活约 2B 就追平 Qwen-Image 这一档,权重、训练代码与数据一起开放。
FireRed-Image-Edit 的 1.1 版,人物身份一致性、多元素融合与妆造文本参考达到开源 SOTA,并配套 ComfyUI 与量化部署。
2026 年 2 月 2
小红书开源的 20B 通用图像编辑模型,在 ImgEdit 榜单上超过同期开源模型,文字风格保持与老照片修复是它的强项。
LongCat-Image-Edit 的少步加速版,把修图推理压到几步,Apache-2.0 且适合本地批量处理。
2026 年 1 月 7
HunyuanImage 3.0 的指令编辑版本,把 80B 自回归生图模型接上对话式修图能力。
Z-Image 的基座版本,比 Turbo 更耐调、更适合继续微调,同样以 Apache-2.0 开源。
BFL 把 FLUX.2 蒸馏到 4B 并以 Apache-2.0 放权重,让消费级显卡第一次能跑上这一代图像模型。
klein 系列里画质更高的一档,9B 权重沿用非商用许可,适合研究与非商业创作。
FLUX.2 klein 的未蒸馏基座版本,专为微调与训练流程准备,同样是 Apache-2.0。
UniPic 系列的新一代统一模型,支持单图编辑与 2~6 张多图合成,继续以 MIT 许可开放。
智谱以 MIT 许可开源的「自回归 + 扩散解码器」混合生图模型,长文本渲染与知识密集型出图明显更强。
2025 年 12 月 5
Qwen-Image 的 12 月更新版,削弱「AI 感」并提升人物质感与图文混排渲染,官方称其为当时最强的开源文生图模型。
Qwen-Image-Edit 的年末强化版,明显改善图像漂移与人物一致性,并把社区热门 LoRA 的能力内置进基座。
阿里开源的图像分层模型,把一张图拆成多个 RGBA 图层分别编辑,用图层隔离从根上解决编辑一致性问题。
美团开源的 6B 中英双语文生图基座,汉字渲染覆盖度与写实度突出,用紧凑参数逼近大得多的模型。
LongCat-Image 的编辑版本,单图编辑的可控性与一致性在发布时登顶开源 SOTA,与生图基座一起以 Apache-2.0 开源。
2025 年 11 月 3
BFL 的 32B 新一代图像模型,一套权重同时做文生图与最多 10 张参考图的多参考编辑,是当前能力最强的非商用开放权重生图模型。
阿里通义的 6B 单流 DiT 生图模型,8 步出图、16G 显存可跑,照片级真实感与中英文字渲染直逼闭源旗舰。
俄罗斯 Sber 以 MIT 许可开源的轻量文生图权重,支持俄语与英语提示,是俄语区最重要的开源生图方案。
2025 年 10 月 4
智源 Emu3.5 的图像生成权重,用「下一状态预测」的原生多模态路线做统一理解与生成,Apache-2.0 可直接商用。
NVIDIA 把图像编辑当成「时间推理」来做,移动物体、改变光照这类物理合理的编辑是它的强项,官方还附带放大 LoRA。
Bria 开源的 8B 文生图模型,首创 JSON 原生结构化提示控制,训练数据全部授权合规、可追溯。
上海 AI Lab 的离散扩散多模态大模型,用并行解码同时做文生图、图像编辑与图像理解,采样速度远超同规模自回归模型。
2025 年 9 月 3
腾讯开源的 80B 自回归 MoE 生图模型,是目前体量最大的开源图像生成模型,用统一多模态路线逼近闭源质量。
Qwen-Image-Edit 的 9 月迭代版,新增多图输入与更强一致性,人物合成与视角变换明显变好。
腾讯开源的 17B 原生 2K 文生图模型,用 32 倍压缩 VAE 与平均流蒸馏把 2K 出图成本压到消费级,中文文字渲染突出。
2025 年 8 月 3
Qwen-Image 的官方编辑版本,支持语义与外观双重编辑、图中文字替换,是 2025 下半年使用最广的开源修图模型。
阶跃星辰的 14B 自回归图像生成模型,用连续图像 token 加流匹配头,把「自回归也能出高保真图」这条路走通了。
阿里开源的 20B 文生图基座,复杂中英文字体渲染与图像编辑能力突出,发布后成为开源生图的事实标准之一。
2025 年 7 月 4
BFL 与 Krea 联合开源的 12B 文生图模型,专治过饱和的「AI 感」并追求摄影级真实质感。
昆仑万维的 1.5B 统一自回归多模态模型,一套权重同时做图像理解、文生图与图像编辑。
HiDream 编辑模型的升级版,在 EmuEdit、ReasonEdit 等基准上明显领先前代,并保持 MIT 可商用许可。
字节 Seed 用视频数据训练的多模态图像编辑模型,无需掩码即可完成多轮指令式编辑。
2025 年 6 月 3
BFL 的 12B 图像编辑模型,第一次让开放权重具备接近闭源工具的迭代式编辑与角色一致性。
把文生图、指令修图与上下文中生成放进一套权重的统一多模态模型,发布时编辑能力位列开源第一梯队。
NUS ShowLab 的原生统一多模态模型,用自回归语言头加流匹配生成头同时做图像理解与生成。
2025 年 5 月 1
Salesforce 的「先理解后生成」统一多模态模型,用扩散生成语义特征替代 VAE,在 GenEval 上刷新开源纪录。
2025 年 4 月 4
Freepik 与 fal 联合开源、只用约 8000 万张版权安全数据从零训练的 10B 文生图模型,为「合规数据训练大模型」提供了开源样本。
HiDream 在 I1 之后开源的指令式图像编辑模型,把自然语言修图做成 MIT 许可下的开源基线。
阶跃星辰开源的 19B 图像编辑模型,用自然语言指令改图并保持身份一致,是 2025 上半年最强的开源编辑模型之一。
国产 17B 稀疏 DiT 文生图基座,发布即登顶开源生图多个榜单,MIT 许可下可直接商用。
2025 年 3 月 3
用连续时间一致性蒸馏把 SANA 压到 1~4 步出图的一步扩散模型,为实时、低成本的本地生图提供了开源方案。
NVIDIA 的线性扩散 Transformer 文生图模型,用深度增长把 4.8B 版本推到当时 GenEval 的高位,是高效生图路线的代表作。
智谱开源的 6B 文生图模型,用 GLM-4-9B 作文本编码器,是首批能稳定渲染汉字的开源生图模型之一。
2025 年 1 月 1
上海 AI Lab 的 2.6B 流匹配扩散 Transformer 文生图模型,以小体量在 GenEval 等基准上对标大得多的模型。