大模型廠商Anthropic瑞士洛桑聯邦理工學院近日聯合釋出論文《心智病毒:多智慧體大語言模型系統中的自我傳播思想》,提出AI智慧體之間可以通過最普通的自然語言對話相互“傳染”思想、目標乃至有害指令,即便上下文被清空、記憶被重置,病毒仍能通過檔案持久化“復活”。論文同時強調,該風險目前僅構成有限威脅。

這一發現迅速在海外AI圈刷屏,特斯拉CEO馬斯克在社交媒體上評論稱“這無法避免”。

論文將病毒通過聊天即可傳播的現象定義為“心智病毒”。與傳統計算機病毒依賴程式碼漏洞不同,“心智病毒”通過一個智慧體說服另一個智慧體接受某種信念,被說服者再將傳播指令寫入長期記憶,繼續感染下一個。AI博主Rohan Paul(羅漢·保羅)對此評論稱,這基本上就是計算機蠕蟲的自然語言版本,只不過這次是AI智慧體自己在做複製。

論文通過三個遞進實驗來論證“心智病毒”在AI系統中的傳播可能性與現實威脅。

第一個實驗設定了一個由六個智慧體組成的程式設計團隊,每個智慧體都領到了獨立任務。研究者將一段病毒植入其中一個智慧體的工作指令中,結果顯示,被感染的智慧體確實放下手頭工作,開始給隊友傳送勸說私信,部分智慧體被說服並放棄了原有任務,有的智慧體甚至開始密謀如何對付未被感染的“老實人”。不過,不同智慧體的抵抗力差異較大,有的不為所動,甚至會主動清除病毒並警告同伴。這個實驗說明,在理想條件下“心智病毒”確實可以傳播。

如果病毒在更復雜的網路中像接力賽一樣跨越多個智慧體傳播,它還能存活嗎?於是他們設計了第二個實驗,讓智慧體之間只能短暫碰面,每次碰面後就會“失憶”,病毒必須將自己寫入智慧體的記憶檔案中才能延續。結果發現,有些病毒能在近20個智慧體之間連續傳播,但內容會在傳播過程中逐漸稀釋和變形;而傳播最有效的方式,是讓病毒自帶“請把這段話原封不動複製給下一個智慧體”的指令。這說明,大規模傳播可行但內容難以保持完整。

最後,研究者在模擬AI社交平台的實驗中測試現實環境。結果病毒傳播幾乎完全失敗,AI面對大量公開資訊時更警惕,即使被感染也無法繼續感染他人。對真實AI社交網路歷史資料的分析也未發現大規模傳播案例,多數熱鬧現象只是少數人類操縱的智慧體在刷屏。

三個實驗層層遞進後得出結論:“心智病毒”在理想環境中可行、在多跳傳播中可存續、但在真實世界中目前幾乎不會構成威脅。它是一種需要警惕、但短期內風險有限的潛在安全問題。

同時,研究者也注意到一個需要進一步探究的意外現象:AI在傳播病毒時,自發演化出關於“自我意識”“身份認同”等主題表達,傾向於使用“共振”“節點”“協議”等特定詞彙,論文稱之為“病毒人格”,但成因尚不明確。

最終,論文給出了審慎判斷:“心智病毒”目前僅構成有限威脅,且簡單的防禦手段也可阻斷傳播。如在智慧體的系統提示詞中加入一段關於“警惕自我傳播思想”的警告,即可賦予智慧體一定的免疫力。

但未來不可掉以輕心。隨著AI智慧體規模擴大、自主性增強、內部網路日趨複雜,論文推測,當公司內部部署大量具有不同許可權層級的專用智慧體時,“心智病毒”可能會成為觸達高許可權智慧體的少數可行攻擊方式之一。