官方介绍
GLM-Image 是智谱(Z.ai)的新旗舰图像生成模型,官方称其为首个开源的工业表现级离散自回归图像生成模型。模型全程基于国产芯片完成训练,采用独创的**「自回归 + 扩散解码器」混合架构**:自回归模块采用并初始化自 GLM-4-9B-0414(参数量 9B),扩散解码器沿用 CogView4 的单流 DiT 结构(参数量 7B)。该架构兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景的生成难题,被视为面向「认知型生成」技术范式的重要探索。
核心功能
| 能力 | 说明 |
|---|---|
| 文字渲染 | 官方标注「文字渲染开源 SOTA」,读懂指令、写对文字 |
| 指令理解 | 兼顾全局指令理解与局部细节刻画 |
| 适用场景 | 海报、PPT、科普图等知识密集型场景 |
| 架构 | 9B 自回归 + 7B DiT 混合(非纯扩散) |
使用说明
- 在智谱开放平台(bigmodel.cn)开通后,通过 API 调用,模型名为
glm-image - 图像生成提供异步接口,传入 prompt 与 size(如 1280x1280)即可生成
- 价格为 0.1 元/张(官方文档标注)
官方链接
- 官方模型文档(智谱开放平台):https://docs.bigmodel.cn/cn/guide/models/image-generation/glm-image
- GLM-Image 发布说明(Z.ai 官网):https://www.zhipuai.cn/zh/glmImage
- 图像生成异步 API 参考:https://docs.bigmodel.cn/api-reference/模型-api/图像生成异步