第五幕 / 能够行动的AI,仍待回答的问题
当回答变成下一步行动
智能体把规划、工具与反馈联系起来,也把错误带进了真实的任务过程。
本篇目录 +
“帮我整理一份旅行方案。”只提供建议是一种任务;查询资料、比较选项、安排日程,甚至执行预订,则让系统面对一连串行动。
观察、行动,再观察
智能体,常称Agent,可以围绕目标选择步骤、使用工具并根据结果继续行动。2022年的ReAct研究,把推理与行动交替组织,是语言模型智能体研究中的一个重要例子。
工具使系统能够查询新信息或操作软件,但工具返回的内容也可能有误。每一步都影响下一步,因此一串行动的可靠性,不能只靠一次回答是否精彩来判断。[1]
更多思考,能带来什么
研究者也探索在回答时投入更多计算,以改善复杂任务的表现。2025年DeepSeek-R1的研究讨论了强化学习与推理能力;Qwen3则公布了思考与非思考模式等设计。
这些工作让中国团队成为当代模型研究的重要参与者之一。比较成果时,需要看具体任务、测试条件、开放范围与成本口径。推理表现改善,不等于每次更长的回答都更正确。[2][3]
- 观察情况
- 选择下一步
- 使用工具
- 检查结果
根据结果继续行动;遇到需要授权的步骤,交由人确认。
行动需要边界与反馈
系统如果理解错一个旅行偏好,建议可以修改;如果已经完成付费预订,后果就不同。智能体的设计因此需要明确哪些行动可以自动完成,哪些需要人确认,出错后怎样停止或恢复。
让AI行动并不是近几年才有的想法。早期机器人已经尝试连接感知、规划和动作。今天的进展把新的模型能力带进这一长期问题,而“能够执行”与“能够可靠负责”仍需要分别检验。[1][4]
留给你的一个问题
在一个你愿意交给AI的任务里,哪一步必须先得到你的确认?
开放权重就等于完全开源吗?
模型权重、训练数据、训练代码与使用许可,是不同层面的开放。获得权重,可能允许本地运行和进一步研究,但不能据此推定所有材料都公开,或所有用途都被许可。
选择一个模型时,阅读它具体的模型卡与许可,比只看“开放”这个标签更有帮助。
本篇来源
沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。
- 研究论文与原著 · Shunyu Yao等ReAct: Synergizing Reasoning and Acting in Language Models ↗
- 研究论文与原著 · DeepSeek-AIDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning ↗
- 团队发布与回顾 · Qwen团队Qwen3: Think Deeper, Act Faster ↗
- 机构史料 · SRI InternationalShakey the Robot ↗
整理于2026年9月16日