WikiSkill

产品介绍

WikiSkill 是 Google Research(联合弗吉尼亚理工)于 2026-08-29 发布的研究框架:给 AI Agent 配一个持续积累的知识库(wiki),把每次执行任务的成功、失败经验自动沉淀下来,让 Agent 不用重新训练模型就能越用越强。

当前状态:研究阶段(论文),尚无正式产品。

核心思路

Agent 每次干完活 → 自动总结经验(哪里失败、哪里成功)→ 存进永久知识库 → 下次干类似的活先翻经验、照着改进。灵感来自 Andrej Karpathy 的「LLM Wiki」设想:把经验编译成持久、可累积的知识。

三层结构

层作用特点
原始记录层(Raw)存每次执行的完整过程(工具调用、结果)一字不改,不可变
知识层(Wiki)从记录提炼「失败模式 + 成功策略」只增不清,永久积累
技能层(Skill)Agent 实际干活用的操作指南可更新,改坏了可回滚

运作循环(4 步)

  1. 执行:推理 Agent 按当前技能干活,留下执行记录
  2. 总结:「Wiki 管理员」分析记录,把失败模式和成功策略写进知识库
  3. 提议:「技能提议者」根据新知识提出技能修改方案
  4. 把关:验证机制测试修改是否真的有效——有效才采纳;无效就回滚,但知识库保留「试过什么、为什么失败」,避免重复踩坑

效果数据(论文,5 个测试集平均)

模型用前用后
Gemini 3.5 Flash49.5%68.1%
Qwen 3.6 27B39.4%63.3%
  • 数学推理提升最大:Gemini 3.5 Flash 在 LiveMath 从 33.0% → 72.6%
  • 表格操作:Qwen 27B 在 SpreadSheetBench 从 40.8% → 81.7%
  • 长文档问答提升相对小

关键发现

  • 小模型用了 WikiSkill,能追平不用它的大模型
  • 技能可迁移:一个模型总结的技能换到另一个模型经常也能用,有时效果还更好(不保证,需逐例验证)

与「复盘」的关系

思路和人工复盘完全一致:看回放 → 挑毛病 → 找原因 → 攒经验。WikiSkill 把这个流程自动化,让 AI 自己给自己写「经验手册」。

当前状态与尝试计划

  • 研究阶段(2026-08-29 发论文),尚无正式产品
  • 尝试计划(2026-09-01 定):等 Google 正式发布产品后试一试

官方链接

相关日记

  • 2026-09-01 - 得知 WikiSkill 发布,决定等正式产品出来再尝试