LongMemEval(长期记忆基准)
官方介绍
LongMemEval 是评测聊天助手长期交互记忆的学术基准(ICLR 2025 收录,论文 arXiv 2410.10813):500 道精编问题嵌入可自由扩展的用户-助手多轮会话历史中,系统化检验「跨会话长期记忆」能力。它已成为 Mem0、Zep、Hindsight 等 Agent 记忆系统的事实评测标准。
核心功能
| 维度 | 说明 |
|---|---|
| 五项核心能力 | 信息提取、多会话推理、时序推理、知识更新(用户改主意后用新信息)、弃答(该说不知道时不编造) |
| 两个规模 | LongMemEval-S(约 115K token、每题约 48 个会话)与 LongMemEval-M(约 500K token) |
| 主要发现 | 商业聊天助手与长上下文大模型在跨会话记忆上准确率下降约 30%——单纯堆长上下文不能替代记忆机制 |
使用说明
- 数据集与评测方法随论文开放,供记忆系统研究者在公开口径下对比
- 记忆系统厂商常在其上发布公开成绩(如 Hindsight 官方报告 Hindsight 加 Gemini-3 达 91.4%);横向比较时需注意所用模型与配置是否一致,「记忆层的真实贡献」应看同模型有无记忆层的对照差值