幕 / 能够行动的AI,仍待回答的问题

当回答变成下一步行动

智能体把规划、工具与反馈联系起来,也把错误带进了真实的任务过程。

本篇目录 +

“帮我整理一份旅行方案。”只提供建议是一种任务;查询资料、比较选项、安排日程,甚至执行预订,则让系统面对一连串行动。

观察、行动,再观察

智能体,常称Agent,可以围绕目标选择步骤、使用工具并根据结果继续行动。2022年的ReAct研究,把推理与行动交替组织,是语言模型智能体研究中的一个重要例子。

工具使系统能够查询新信息或操作软件,但工具返回的内容也可能有误。每一步都影响下一步,因此一串行动的可靠性,不能只靠一次回答是否精彩来判断。[1]

更多思考,能带来什么

研究者也探索在回答时投入更多计算,以改善复杂任务的表现。2025年DeepSeek-R1的研究讨论了强化学习与推理能力;Qwen3则公布了思考与非思考模式等设计。

这些工作让中国团队成为当代模型研究的重要参与者之一。比较成果时,需要看具体任务、测试条件、开放范围与成本口径。推理表现改善,不等于每次更长的回答都更正确。[2][3]

智能体的一次行动循环
  1. 观察情况
  2. 选择下一步
  3. 使用工具
  4. 检查结果

根据结果继续行动;遇到需要授权的步骤,交由人确认。

行动需要边界与反馈

系统如果理解错一个旅行偏好,建议可以修改;如果已经完成付费预订,后果就不同。智能体的设计因此需要明确哪些行动可以自动完成,哪些需要人确认,出错后怎样停止或恢复。

让AI行动并不是近几年才有的想法。早期机器人已经尝试连接感知、规划和动作。今天的进展把新的模型能力带进这一长期问题,而“能够执行”与“能够可靠负责”仍需要分别检验。[1][4]

留给你的一个问题

在一个你愿意交给AI的任务里,哪一步必须先得到你的确认?

开放权重就等于完全开源吗?

模型权重、训练数据、训练代码与使用许可,是不同层面的开放。获得权重,可能允许本地运行和进一步研究,但不能据此推定所有材料都公开,或所有用途都被许可。

选择一个模型时,阅读它具体的模型卡与许可,比只看“开放”这个标签更有帮助。

故事里的人与想法

本篇来源

沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。

  1. 研究论文与原著 · Shunyu Yao等ReAct: Synergizing Reasoning and Acting in Language Models
  2. 研究论文与原著 · DeepSeek-AIDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
  3. 团队发布与回顾 · Qwen团队Qwen3: Think Deeper, Act Faster
  4. 机构史料 · SRI InternationalShakey the Robot

整理于2026年9月16日