开源图片模型

背景

2026-09-03 调研:视频短剧摸不到门后确认的正确路线——先出图、再让图动起来(角色设定图固定 → 逐镜头图生视频)。图片是整条流水线的地基。

装机方案(2026-09-03 吐司实测后定稿)✅

实测过程:在线对比两种风格——NoobAI 二次元线「根本生不出我要的东西」(出局),Qwen-Image 写实效果不错。DeepSeek Harness 同步确认:Z-Image 本身就能出写实图。方向定为写实路线。

最终清单(ComfyUI 装两个,比最初的方案更简):

Z-Image TurboQwen-Image
角色日常草稿、构图试错、场景图角色定妆主力(写实画质开源第一)
理由快、省(GGUF 约 8GB)、中文友好定妆图的质量直接决定图生视频的质量,这一环值得用最好的;量化约 13GB
  • 写实角色一致性:Qwen-Image-Edit(改图保脸)+ H3 Ref2VA 喂 9 张参考图
  • Illustrious / SDXL 基座:缓装——二次元出局后暂无用武之地;哪天回头做二次元再补(LiblibAI/吐司 的 LoRA 生态随时都在)
  • 实测小知识:NoobAI 类二次元模型习惯英文标签式提示词,对自然语言中文不友好——不是用户用错,是它挑用法

名词小贴士:底模 vs LoRA

  • 底模(checkpoint)= 几个 GB 的基础模型文件,相当于「画师本体」:决定会不会画人体、光影质感,以及默认画风(写实 or 二次元)。放在 ComfyUI 的 models/checkpoints 目录,用 Load Checkpoint 节点加载
  • LoRA = 几百 MB 的小补丁文件,相当于「塞给画师的专项速成教材」:专精某种画风/服装/角色,必须搭配同家族底模使用
  • 分工:底模打地基,LoRA 加专长,两者在 ComfyUI 里一起加载
  • 选底模就是选画风:写实底模(FLUX/Qwen-Image)出照片脸,二次元底模(Illustrious/NoobAI)出漫画脸——做漫剧地基选错,LoRA 救不回来

通用开源文生图模型(2026-09 现状)

模型出品方 / 协议规模擅长Mac (64GB) 可跑性
Qwen-Image(含 2512 版)阿里 / Apache 2.020B开源文生图竞技场第一(1139 分);中文文字渲染、中式审美最强;有配套编辑模型GGUF 量化后约 13GB,轻松
Z-Image / Turbo阿里 / Apache 2.06B快、省资源、中文好,适合批量出图试错;Mac 部署教程成熟峰值约 24GB;GGUF 仅约 8GB,轻松
FLUX.2(Dev / Klein)BFL / Dev 权重开放(商用受限)12B / 4B-9B画质天花板;Klein 4B 专为苹果芯片优化,16GB 内存即可Klein 走 MLX 16GB 就够;Dev 量化可跑
HunyuanImage 3.0腾讯 / 权重开放80B MoE中文、多模态,开源里最大太重,Mac 不现实,跳过
GLM-Image智谱 / MIT-开源第二梯队可跑
SD 3.5 LargeStability / 开源8BControlNet 生态最全(控图神器)轻松

二次元社区路线(已出局,存档备用)

  • 底模:Illustrious XL、NoobAI-XL(SDXL 系二次元专用);LoRA 生态在 LiblibAI、吐司
  • 曾规划的国风 LoRA / 古装角色四视图 / IP-Adapter 锁脸方案随二次元路线一并搁置——实测 NoobAI 对自然语言中文提示词不友好,出图不合预期
  • H3 的「AI 厚涂感」本适合动漫画风,但图片环节过不了关就没有然后了

和写实短剧流水线的接法

  1. Z-Image Turbo 快速试构图、出场景图(秒级、无限抽)
  2. 角色形象满意后,用 Qwen-Image 出高画质角色定妆图(多角度),必要时 Qwen-Image-Edit 修脸保细节
  3. 定稿图 → MiniMax H3 图生视频(Ref2VA 最多 9 张参考图,把定妆图全套喂进去锁角色)
  4. 全程 ComfyUI 一个工具搞定出图和视频

相关笔记

相关日记

  • 2026-09-03 - 视频受挫后确认”从图开始”路线建档;吐司实测后定稿写实路线(NoobAI 出局、Qwen-Image 转正)