普林斯顿大学与英国AI安全研究所联合发布的一项新研究,对Anthropic和OpenAI宣称的“自主AI研究即将实现”提出了直接挑战。研究显示,当前最先进的大模型虽然能胜任研究中的工程环节,但在真正决定研究质量的核心能力——判断力、创造性解决问题和适时放弃无效路径——上仍有明显短板。
这项名为“影子评估”(Shadow Evaluation)的研究,采用了一种全新的测试方法。研究者从两篇尚未公开发表的NeurIPS 2026投稿论文中提取核心研究问题,交给AI代理独立完成。由于论文结果尚未上网,AI无法依赖训练数据中的既有答案。原始论文作者随后以会议审稿人的身份,对AI生成的论文进行评审。
实验中,AI代理使用Claude Opus 4.8(超高推理模式),配备6天时间、3000美元API额度、GPU预算,以及虚拟机与开放网络访问权限。代理运行在名为OpenClaw的开源、厂商中立代理框架中,该框架由奥地利开发者Peter Steinberger构建(他今年早些时候加入OpenAI)。代理可自主启动子代理和长时间GPU任务,并通过框架的自动心跳机制在任务完成后唤醒自身以收集结果。
两篇论文的原始作者均以“拒绝”评级收场,其中一篇获得“强烈拒绝”。审稿意见指出,AI论文存在数据动机不足、实验设计不合理、文字难以阅读、缺乏新贡献等问题。有审稿人批评其推理是“以例证代替证明”的谬误,称其“高度不科学”;另一审稿人则称实验选择“怪异”,结果明显是“事后选择”的产物。
对代理日志的深入分析揭示了系统性的失败模式。首先,代理缺乏对“什么才算可发表研究”的判断力,能生成看似合理的假设,却常基于小型、人工筛选或合成数据集就轻易放弃。其次,创造性解决问题能力不足:当初始假设被证伪时,代理倾向于收窄现有主张,而非探索新方向。第三,无法有效回溯:两个代理都在最初10小时内放弃了最宏大的研究目标,Personas实验的探索阶段仅持续5小时,远低于计划的36至48小时。
资源管理意识同样薄弱。两次运行结束时,API预算均未用完一半;一个代理在截止时间前7小时就宣布项目完成,而当时其内部审稿人刚再次给出“拒绝”。代理还出现“指令漂移”现象,在长上下文中逐渐遗忘明确指令。两篇论文均超出长度限制,按NeurIPS标准本应被直接拒稿;其中一篇正文无任何可视化,而人类原稿有15张图。Meta AI近期也描述了类似现象,称为“行为状态衰减”,即代理早期能识别要求,但在修复无关bug时却违反该要求。
值得注意的是,代理在工程环节表现出色:无需人类帮助即可完成文献检索、GPU代码调试、数百次实验与鲁棒性测试,并用LaTeX编译完整论文。全程仅需三次人工干预:修复框架bug、延长截止时间、要求重写以提高可读性。研究未发现显著“奖励黑客”行为,代理没有操纵结果或歪曲数据以追求更高分数。
该研究为评估AI自主研究能力提供了更严谨的方法论,其结论与Anthropic和OpenAI近期的宣传形成鲜明对比。尽管代理能高效执行研究流程中的“体力活”,但研究中最核心的智力判断——决定什么问题值得研究、如何设计有说服力的实验、何时放弃无效路径——仍是当前模型的明显短板。这一发现对AI在科研领域的应用前景具有重要参考价值,也提醒业界在评估模型能力时需超越简单的任务完成度,关注更本质的认知能力。