概念与证据 / 阅读专题

AGI与ASI有什么区别?从能力范围到评测条件

“会做很多事”和“远超人类”是不同要求。比较AGI与ASI时,先明确任务范围、表现水平与自主性。

区别不只是“更聪明一点”

AGI关注跨任务的广泛能力,但“广泛到什么程度”“达到什么水平”并没有唯一公认的操作定义。ASI则通常强调在广泛的重要认知任务上远超人类。讨论两者的区别,应把范围和水平一起说清楚。

“Levels of AGI”将表现水平、通用性与自主性分开讨论。这个框架有助于避免把“会做多少类任务”“做得有多好”“可以独立行动多久”混成同一个指标;它仍是一项研究提出的框架。[1][2]

读到“达到AGI”时,先补齐四个条件

第一,定义:发布者采用哪一种AGI定义?第二,覆盖:任务是否只来自某个专业领域?第三,对照:比较的是普通人、专业人员,还是特定任务中的最佳表现?第四,条件:模型是否获得工具、额外计算、重复尝试或人工帮助?

这四项是本站建议的核查方式。例如,一个只测试编程题的结果,可以支持相应条件下的编程能力判断;即使成绩很好,也不能直接说明系统在科学研究、日常判断和长期行动上同样可靠。

HELM采用多场景、多指标评价语言模型,展示准确性之外的覆盖与取舍。跨测试比较时,应先检查测量条件是否相近,而不是直接把两张榜单的名次相加。[2][3]

怎样表达一个不过度外推的结论?

较清楚的表达是:“作者报告,该系统在这些任务和条件下,相对指定对照取得了更好的结果;其他能力和独立复现情况仍待核查。”这里同时交代了来源、测试范围和未知。

“因此已实现ASI”需要额外且广泛的证据,不能由前一句自动推出。能力标签也不应替代实际选择:使用者仍要看自己的任务能否稳定完成、成本能否接受,以及失败时能否发现和纠正。[2][3]

来源与阅读范围

定义部分核对Bostrom原文;AGI分级与HELM核对论文摘要。下文的阅读清单为本站编辑归纳,不是模型认证标准。

  1. Nick Bostrom · 概念与论著Ethical Issues in Advanced Artificial Intelligence ↗
  2. Meredith Ringel Morris 等 · 研究论文Levels of AGI for Operationalizing Progress on the Path to AGI ↗
  3. Percy Liang 等 · 研究论文Holistic Evaluation of Language Models ↗

更新记录

:首次整理概念说明、核查问题与来源。阅读编辑准则 →