WikiSkill
产品介绍
WikiSkill 是 Google Research(联合弗吉尼亚理工)于 2026-08-29 发布的研究框架:给 AI Agent 配一个持续积累的知识库(wiki),把每次执行任务的成功、失败经验自动沉淀下来,让 Agent 不用重新训练模型就能越用越强。
当前状态:研究阶段(论文),尚无正式产品。
核心思路
Agent 每次干完活 → 自动总结经验(哪里失败、哪里成功)→ 存进永久知识库 → 下次干类似的活先翻经验、照着改进。灵感来自 Andrej Karpathy 的「LLM Wiki」设想:把经验编译成持久、可累积的知识。
三层结构
| 层 | 作用 | 特点 |
|---|---|---|
| 原始记录层(Raw) | 存每次执行的完整过程(工具调用、结果) | 一字不改,不可变 |
| 知识层(Wiki) | 从记录提炼「失败模式 + 成功策略」 | 只增不清,永久积累 |
| 技能层(Skill) | Agent 实际干活用的操作指南 | 可更新,改坏了可回滚 |
运作循环(4 步)
- 执行:推理 Agent 按当前技能干活,留下执行记录
- 总结:「Wiki 管理员」分析记录,把失败模式和成功策略写进知识库
- 提议:「技能提议者」根据新知识提出技能修改方案
- 把关:验证机制测试修改是否真的有效——有效才采纳;无效就回滚,但知识库保留「试过什么、为什么失败」,避免重复踩坑
效果数据(论文,5 个测试集平均)
| 模型 | 用前 | 用后 |
|---|---|---|
| Gemini 3.5 Flash | 49.5% | 68.1% |
| Qwen 3.6 27B | 39.4% | 63.3% |
- 数学推理提升最大:Gemini 3.5 Flash 在 LiveMath 从 33.0% → 72.6%
- 表格操作:Qwen 27B 在 SpreadSheetBench 从 40.8% → 81.7%
- 长文档问答提升相对小
关键发现
- 小模型用了 WikiSkill,能追平不用它的大模型
- 技能可迁移:一个模型总结的技能换到另一个模型经常也能用,有时效果还更好(不保证,需逐例验证)
与「复盘」的关系
思路和人工复盘完全一致:看回放 → 挑毛病 → 找原因 → 攒经验。WikiSkill 把这个流程自动化,让 AI 自己给自己写「经验手册」。
当前状态与尝试计划
- 研究阶段(2026-08-29 发论文),尚无正式产品
- 尝试计划(2026-09-01 定):等 Google 正式发布产品后试一试
官方链接
相关日记
- 2026-09-01 - 得知 WikiSkill 发布,决定等正式产品出来再尝试