模型接入协议

模型接入的几种接口有什么区别。接口协议 = 你和模型说话时用的「菜单格式」——同样的菜,两家餐厅的菜单长得不一样。协议 ≠ 计费模式,协议 ≠ 模型本身,这是最容易混的两件事。

一、两大主流「对话协议」

OpenAI 兼容协议Anthropic 协议
出身OpenAI 的格式,成了行业普通话Claude 的格式,编程工具圈方言
现状几乎家家都兼容:DeepSeek、GLM、MiniMax、火山方舟、本地 Ollama 全有被广泛采用:Qwen、GLM、MiniMax 的 Coding 套餐都兼容它
特点结构简单:消息进、文本出为编程工具设计:系统提示单独放、工具调用格式更严格
典型端点/v1/chat/completions/v1/messages

怎么选:看手头工具支持哪种——TraeWork 和 OCR 都两种都吃。同一句「帮我改代码」,用哪种协议结果差不多,区别在格式。

二、OpenAI 的三代接口(2026-09 现状:三代只剩两代)

  1. Chat Completions(/v1/chat/completions)——行业普通话。无状态:消息进、文本出,对话历史和工具循环全由调用方自己管。几乎所有厂商都兼容它

  2. Assistants API——已于 2026-08-26 完全退役。它曾由服务端托管对话(Threads)+ 自带文件检索/代码解释器,但 OpenAI 已用 Responses 取代,旧调用全部失效

  3. Responses API(/v1/responses)——现任旗舰接口,合并了前两者的优点:

    • 可选有状态(previous_response_id 让服务端记住上文)
    • 自带工具:联网搜索、文件检索、代码解释器、电脑操作、MCP
    • Agent 工具循环可以在服务端跑完,不用客户端一次次转

2026 年新增的三项改进(GPT-5.6 开发者指南)

改进说明
跨轮保留推理 + 原生压缩长对话不再因为反复重述上下文而爆 token
WebSocket 持久连接此前 GPT-5/5.2 旗舰约 65 TPS,WebSocket 显著提速——长时 Agent 任务的体感差别很大
工具集扩容2025-05-21 起内置:远程 MCP 服务器、图像生成、代码解释器、升级版文件搜索,另加 background mode 与加密内容

官方口径仍是「用 Agents SDK 与 Responses API 构建智能体」,Agents SDK 默认走 Responses API;2026-04 Agents SDK 新增原生沙箱执行。

白话类比:Chat Completions 是「点单现做、吃完走人」;Assistants 是「雇了个记性好的服务员,已退休」;Responses 是「新店长——记性好还自带后厨,能代跑整个流程」。

对我的意义:国内模型(deepseek、GLM、MiniMax)走的是 OpenAI 兼容或 Anthropic 协议,与 Responses 无关;Responses 只在直接用 OpenAI 官方 API 搭 Agent 时才需要选。若有老项目用了 Assistants API,必须迁移(接口已下线)。

三、按用途分的特殊接口

接口干什么例子
Embedding把文字变成「坐标」,查相似度知识库搜索、RAG 检索
图像/视频生成提交任务 → 等待 → 取结果(异步)Seedance、Seedream
Realtime 语音边听边说的实时音视频流SeedRealtime、实时语音助手

四、最容易混淆的两件事

协议 ≠ 计费模式:协议管「格式」(OpenAI 式还是 Anthropic 式),计费管「怎么收钱」(按 token 按量 vs 包月订阅)。百炼 Coding Plan 的教训:订阅 Key 必须走 Anthropic 协议的专用端点——格式和计费要配套,错配就 401。

协议 ≠ 模型:同一个模型可以同时开好几种协议接口(如 GLM 同时提供两种格式),选哪个不影响模型本身。

五、配模型口诀

配任何模型 = 三件套:地址(端点 URL)+ 钥匙(API Key)+ 格式(协议类型),三个必须配套。

相关笔记

相关日记