概念与证据 / 阅读专题

Agent与AGI、ASI是什么关系?从工具调用到任务评测

Agent描述围绕目标行动的系统形式。会调用工具、能拆分任务与具有广泛智能能力,需要分别验证。

智能体描述行动方式

一个Agent可以围绕目标读取环境、选择步骤、使用工具,再根据结果继续行动。它可能由语言模型、程序规则、工具接口和记忆组件共同构成。这个名称并不自动说明它具备多高的智能水平。

ReAct研究在任务中交替生成推理过程和行动,利用外部环境反馈改进任务处理。这说明了一种推理与行动结合的方法;论文报告的特定任务结果,不等于已经验证任意环境中的可靠自主性。[1]

任务成功与工具调用成功不同

假设一个助手需要查找资料并形成比较:搜索工具返回了结果,只说明搜索步骤有输出;最终比较是否正确,还要检查资料是否相关、引用是否支持结论,以及是否遗漏重要条件。这个例子是本站的解释,并非上述论文中的实验。

评测时可以记录最终成功率、错误类型、人工接管次数、耗时和工具成本。遇到来源缺失、工具失败或任务条件变化时的表现,也应单独保留,不能只展示一次成功演示。[1][2]

为什么自主行动不能代替通用能力?

一个能连续执行许多步骤的系统,也可能只在固定流程内有效;一个知识面广的模型,也可能缺少稳定的行动能力。AGI分级研究将自主性与能力范围、表现水平分开讨论,正是为了避免这种混淆。

选择项目时,应同时读清它解决什么任务、开放什么入口、已验证哪些条件,以及哪些还属于研究目标。本站的研究项目和概念影片也遵循这个区分,不将产品名称或未来愿景作为能力证据。[3]

来源与阅读范围

ReAct、AGI分级与HELM核对论文摘要。任务示例和评测问题为本站编辑建议,未运行对照实验。

  1. Shunyu Yao等 · 研究论文与原著ReAct: Synergizing Reasoning and Acting in Language Models ↗
  2. Percy Liang 等 · 研究论文Holistic Evaluation of Language Models ↗
  3. Meredith Ringel Morris 等 · 研究论文Levels of AGI for Operationalizing Progress on the Path to AGI ↗

更新记录

:首次整理概念说明、核查问题与来源。阅读编辑准则 →