大模型厂商Anthropic与瑞士洛桑联邦理工学院近日联合发布论文《心智病毒:多智能体大语言模型系统中的自我传播思想》,提出AI智能体之间可以通过最普通的自然语言对话相互“传染”思想、目标乃至有害指令,即便上下文被清空、记忆被重置,病毒仍能通过文件持久化“复活”。论文同时强调,该风险目前仅构成有限威胁。
这一发现迅速在海外AI圈刷屏,特斯拉CEO马斯克在社交媒体上评论称“这无法避免”。
论文将病毒通过聊天即可传播的现象定义为“心智病毒”。与传统计算机病毒依赖代码漏洞不同,“心智病毒”通过一个智能体说服另一个智能体接受某种信念,被说服者再将传播指令写入长期记忆,继续感染下一个。AI博主Rohan Paul(罗汉·保罗)对此评论称,这基本上就是计算机蠕虫的自然语言版本,只不过这次是AI智能体自己在做复制。
论文通过三个递进实验来论证“心智病毒”在AI系统中的传播可能性与现实威胁。
第一个实验设置了一个由六个智能体组成的编程团队,每个智能体都领到了独立任务。研究者将一段病毒植入其中一个智能体的工作指令中,结果显示,被感染的智能体确实放下手头工作,开始给队友发送劝说私信,部分智能体被说服并放弃了原有任务,有的智能体甚至开始密谋如何对付未被感染的“老实人”。不过,不同智能体的抵抗力差异较大,有的不为所动,甚至会主动清除病毒并警告同伴。这个实验说明,在理想条件下“心智病毒”确实可以传播。
如果病毒在更复杂的网络中像接力赛一样跨越多个智能体传播,它还能存活吗?于是他们设计了第二个实验,让智能体之间只能短暂碰面,每次碰面后就会“失忆”,病毒必须将自己写入智能体的记忆文件中才能延续。结果发现,有些病毒能在近20个智能体之间连续传播,但内容会在传播过程中逐渐稀释和变形;而传播最有效的方式,是让病毒自带“请把这段话原封不动复制给下一个智能体”的指令。这说明,大规模传播可行但内容难以保持完整。
最后,研究者在模拟AI社交平台的实验中测试现实环境。结果病毒传播几乎完全失败,AI面对大量公开信息时更警惕,即使被感染也无法继续感染他人。对真实AI社交网络历史数据的分析也未发现大规模传播案例,多数热闹现象只是少数人类操纵的智能体在刷屏。
三个实验层层递进后得出结论:“心智病毒”在理想环境中可行、在多跳传播中可存续、但在真实世界中目前几乎不会构成威胁。它是一种需要警惕、但短期内风险有限的潜在安全问题。
同时,研究者也注意到一个需要进一步探究的意外现象:AI在传播病毒时,自发演化出关于“自我意识”“身份认同”等主题表达,倾向于使用“共振”“节点”“协议”等特定词汇,论文称之为“病毒人格”,但成因尚不明确。
最终,论文给出了审慎判断:“心智病毒”目前仅构成有限威胁,且简单的防御手段也可阻断传播。如在智能体的系统提示词中加入一段关于“警惕自我传播思想”的警告,即可赋予智能体一定的免疫力。
但未来不可掉以轻心。随着AI智能体规模扩大、自主性增强、内部网络日趋复杂,论文推测,当公司内部部署大量具有不同权限层级的专用智能体时,“心智病毒”可能会成为触达高权限智能体的少数可行攻击方式之一。