记忆方法与评测
从保留经历、检索与更新,到跨会话和时间关系的检验。
2024 · 长期对话记忆评测作者报告 · 仅核对摘要
Di Wu, Hongwei Wang, Wenhao Yu 等
- 研究问题
- 聊天助手能否在持续多轮互动后准确提取、更新和使用过去的信息?
- 方法与条件
- 构建含 500 个问题的 LongMemEval,覆盖信息提取、跨会话推理、时间推理、知识更新与拒答;将记忆系统拆为索引、检索、阅读三个阶段进行实验。
- 作者报告
- 作者报告,现有聊天助手和长上下文模型在持续互动的记忆问题上仍有明显困难;他们提出的索引与查询优化在该基准上改善了记忆召回及问答。
- 局限与适用边界
- 该结论来自 LongMemEval 的特定问题与实验设置;摘要不能证明真实产品中的长期稳定性,也不能证明本站项目的表现。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2024 · 超长对话记忆与 LoCoMo作者报告 · 仅核对摘要
Adyasha Maharana, Dong-Ho Lee, Sergey Tulyakov 等
- 研究问题
- 模型面对跨许多会话的长对话时,能否回答问题并理解事件的时间与因果关系?
- 方法与条件
- 以人物设定和时间事件图生成长期对话,再由人工核对;用 LoCoMo 评测问答、事件总结和多模态对话生成。
- 作者报告
- 作者报告,受测模型对长对话及跨时段的时间、因果关系仍理解不足;长上下文和检索增强方法有帮助,但在该基准上仍落后于人类。
- 局限与适用边界
- LoCoMo 对话由机器与人工共同构建;摘要未证明这些结果可直接推广到真实用户的所有长期互动或本站项目。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2023 · 分层记忆与上下文管理作者报告 · 仅核对摘要
Charles Packer, Sarah Wooders, Kevin Lin 等
- 研究问题
- 有限上下文窗口下,系统怎样利用更长的文档与跨会话历史?
- 方法与条件
- 借鉴操作系统的分层存储,提出虚拟上下文管理,在不同记忆层之间移动信息;在文档分析和多会话聊天中评估。
- 作者报告
- 作者报告,MemGPT 在实验中可处理超出底层模型上下文窗口的大文档,并支持跨会话聊天中的记忆与反思。
- 局限与适用边界
- 摘要描述的是系统设计及两个实验领域;不能据此推断所有任务或生产环境中的可靠性,也不能证明本站项目具有相同能力。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2023 · 记忆更新与个性化对话作者报告 · 仅核对摘要
Wanjun Zhong, Lianghong Guo, Qiqi Gao 等
- 研究问题
- 对话系统怎样保留、更新并调用与用户相关的历史信息?
- 方法与条件
- 提出 MemoryBank,按时间与重要性更新记忆,并在陪伴聊天机器人 SiliconFriend 中结合真实对话定性分析和模拟对话定量分析。
- 作者报告
- 作者报告,在其陪伴对话实验中,接入 MemoryBank 的 SiliconFriend 能回忆相关信息并对用户特征作出回应。
- 局限与适用边界
- 实验集中在陪伴场景,且定量对话由 ChatGPT 模拟用户生成;摘要不足以支持心理咨询效果或其他场景的泛化结论。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2023 · 记忆、反思与规划作者报告 · 仅核对摘要
Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai 等
- 研究问题
- 把经验记录、反思和检索结合起来,能否让模拟角色产生连贯行为?
- 方法与条件
- 让生成式代理以自然语言保存经历、汇总为反思并动态检索以规划行动;在小镇沙盒中观察行为,并做组件消融。
- 作者报告
- 作者报告,沙盒中的代理产生了较可信的个体与群体行为;消融实验显示观察、规划和反思组件分别影响行为可信度。
- 局限与适用边界
- 研究对象是模拟环境中的角色;“可信”不等同于真实人的心理或社会行为,也不证明通用自主智能。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
行动与评测方法
从具体工具行动,到交互任务和多维语言模型评价。
2022 · 推理与行动交替作者报告 · 仅核对摘要
Shunyu Yao, Jeffrey Zhao, Dian Yu 等
- 研究问题
- 让模型交替生成推理步骤和外部操作,能否改善任务求解?
- 方法与条件
- 提出 ReAct,交错生成推理轨迹与任务操作,在问答、事实核查及互动决策任务中与基线比较。
- 作者报告
- 作者报告,ReAct 在所测试任务中改善了部分结果和过程可解释性;在问答与事实核查中,外部信息交互帮助处理纯推理链的幻觉与错误传播。
- 局限与适用边界
- 结论依赖特定任务、工具接口和基线;摘要未证明推理轨迹可靠,亦不能直接推出开放环境中的安全自主行动。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2023 · 交互环境中的智能体评测作者报告 · 仅核对摘要
Xiao Liu, Hao Yu, Hanchen Zhang 等
- 研究问题
- 怎样在多种交互环境中比较语言模型作为代理的推理与决策能力?
- 方法与条件
- 构建覆盖八类环境的 AgentBench,并测试 API 模型与开源模型的任务表现和失败原因。
- 作者报告
- 作者报告,受测模型在交互环境中的能力存在差异;长期推理、决策和遵循指令不足是其观察到的常见失败原因。
- 局限与适用边界
- 这是特定版本模型与八类环境的比较,结果会随模型和设置变化;摘要不能为本站项目作性能背书。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
2022 · 多维语言模型评测作者报告 · 仅核对摘要
Percy Liang, Rishi Bommasani, Tony Lee 等
- 研究问题
- 只看单一准确率会遗漏哪些模型表现与风险?
- 方法与条件
- HELM 梳理场景和指标,在共同条件下对多种模型进行多指标评测,涵盖准确性、校准、稳健性、公平性、偏见、毒性与效率。
- 作者报告
- 作者报告,统一场景和多指标评测能暴露模型之间的取舍,也使此前缺乏可比性的模型评测更透明。
- 局限与适用边界
- HELM 主要评测语言模型,不能直接代表完整代理系统或长期记忆;其所选场景和模型也有覆盖边界。
- 独立复现
- 未核查独立复现
核对日期: · 原始摘要与全文入口 ↗
维护与修订
:首次整理8篇研究,记录摘要阅读范围与未核查的复现状态。新增全文核验、复现资料或更正时,更新对应条目及日期。
编辑准则 → 回到ASI入门 →