Anthropic 的一位研究员近日公布了一项新研究,展示了 AI 系统如何自我改进对齐能力,这可能是迈向递归自我改进 AI 的重要一步。该论文题为《自动化研究者能可靠缓解对齐失败》,由 Anthropic 研究员陈岳翰(Chen Yueh-Han)领导,于周五发布。
研究团队开发了一种自动化系统,在给定 10 个针对特定错误行为的基准测试后,该系统能够在不降低整体性能的前提下,逐一提升模型在这些基准上的表现。这一成果表明,自动化对齐训练可能很快变得实用。
该系统模拟了传统研究流程:每个自动化系统会搜索现有文献,提出改进方法,然后用该方法训练模型 30 分钟,并在多次迭代中逐步提高基准难度。有效的方法被保留,无效的则被丢弃,这使得系统能够快速、大规模地运行。论文指出,这些结果为自动化对齐后训练在近期内变得可行提供了早期证据。
这一研究被视为迈向递归自我改进 AI 的一步,许多人认为这是 AI 发展的下一个重大突破。如果模型能够改进自身的对齐训练,那么它们也可能改进更广泛的训练实践,届时人类 AI 研究者可能很快变得过时。论文毫不避讳地探讨了这一可能性,直接将自动化对齐研究者(AAR)与人类研究员进行比较。
论文称,平均在六小时内,最佳的 AAR 方法就能胜过经验丰富的人类提出的方法,且人类指导的研究方向并未带来更强的性能。此外,成本对比也颇具说服力:AAR 的 API 推理成本约为每小时 4 美元,而人类研究员的时薪高达 150 美元。
不过,论文也指出了该方法的局限性。自动化系统仅在基准测试能真实反映对齐目标时才有效,而建立和维护这些基准,以及维护和扩展自动化研究者所依赖的文献,仍需大量工作。
这一研究引发了关于 AI 自我改进可能性的广泛讨论。支持者认为,这能大幅降低 AI 训练成本并加速技术进步;而批评者则担忧,一旦 AI 能自我改进,人类可能失去对 AI 的控制。无论如何,这项研究为 AI 领域提供了一个重要的新视角。