官方介绍

GLM-Image 是智谱(Z.ai)的新旗舰图像生成模型,官方称其为首个开源的工业表现级离散自回归图像生成模型。模型全程基于国产芯片完成训练,采用独创的**「自回归 + 扩散解码器」混合架构**:自回归模块采用并初始化自 GLM-4-9B-0414(参数量 9B),扩散解码器沿用 CogView4 的单流 DiT 结构(参数量 7B)。该架构兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景的生成难题,被视为面向「认知型生成」技术范式的重要探索。

核心功能

能力说明
文字渲染官方标注「文字渲染开源 SOTA」,读懂指令、写对文字
指令理解兼顾全局指令理解与局部细节刻画
适用场景海报、PPT、科普图等知识密集型场景
架构9B 自回归 + 7B DiT 混合(非纯扩散)

使用说明

  1. 在智谱开放平台(bigmodel.cn)开通后,通过 API 调用,模型名为 glm-image
  2. 图像生成提供异步接口,传入 prompt 与 size(如 1280x1280)即可生成
  3. 价格为 0.1 元/张(官方文档标注)
许可提醒:该模型开源许可的具体条款需以官方许可原文为准,商用前务必逐条核对,不要默认可自由商用。

官方链接