Anthropic 於本週宣佈,已對其旗艦模型 Claude Fable 5 的生物安全防護系統進行重大更新,顯著降低了誤報率。據該公司測試,此次更新使與生物相關的“回退”事件減少了約 85%——即使用者提出生物相關查詢後,系統不再頻繁地將請求轉交給能力較弱的 Opus 5 模型處理。這一變化意味著,Fable 5 現在能夠更順暢地協助處理日常健康與教育類問題,例如解讀化驗結果、理解症狀以及生物學知識學習,同時也能為醫療專業人員的臨床任務提供更多支援。
Anthropic 在官方公告中強調,其目標是讓 Fable 5 的前沿能力盡可能快地惠及更多使用者,但同時也必須管理模型強大能力帶來的風險。公司承認,在生物領域,Fable 5 已能在某些高度複雜的任務上超越專家,這既可能用於研發新療法,也可能被惡意行為者濫用,例如開發生物武器。為此,Anthropic 最初在釋出 Fable 5 時幾乎遮蔽了所有生物查詢,以優先確保安全,但這種保守做法導致大量合法使用者的請求被誤攔截,體驗受損。此次更新正是對先前策略的修正,通過最佳化安全分類器來減少誤報,同時仍保留對高風險領域的限制。
具體而言,Anthropic 的安全防護機制依賴一系列小型自動化 AI 系統(即“安全分類器”),用於檢測 Fable 5 是否被要求執行受保護的生物任務或產生有害輸出。當分類器觸發時,系統會將請求重定向至 Opus 5——一個不具備同等生物能力的模型,從而限制潛在危害。Anthropic 表示,開發精確且穩健的分類器並非易事,需要不斷迭代以平衡誤報(錯誤攔截)與漏報(漏掉有害內容),同時還要抵禦越獄攻擊。此次更新中,團隊“仔細重寫了分類器的憲法”,以更精確地界定生物相關查詢的“範圍內”與“範圍外”,從而大幅降低誤報率。
值得注意的是,儘管誤報率顯著下降,Fable 5 仍會對涉及病毒學、毒理學和分子設計等雙重用途領域的請求回退至 Opus 5,因此目前尚不能用於專業生物學研究或藥物開發。Anthropic 表示,他們正致力於通過“可信訪問途徑”來縮小這一差距,讓前沿生物能力能夠安全地惠及專業研究人員。公司還引用了美國情報界《2026 年度威脅評估》中的警告,指出生物技術(包括合成生物學和基因組編輯)的進步可能帶來新型生物威脅,且部分國家行為體可能維持活躍的進攻性生物與化學武器計劃,這凸顯了加強安全防護的必要性。
從行業視角看,Anthropic 的這一舉措反映了 AI 公司在部署超強模型時面臨的普遍兩難:如何在釋放能力與防範風險之間取得平衡。此前,Anthropic 曾因 Fable 5 的過度保守而受到部分使用者批評,認為其阻礙了合法的生物研究。此次更新被視為對使用者反饋的回應,但公司仍堅持對高風險領域保持嚴格限制,顯示出其在安全上的審慎立場。對於關注 AI 安全與模型可用性的觀察者而言,這一動態表明,前沿模型的安全機制正在從“一刀切”的封鎖轉向更精細化的分類管理,未來或將為生物醫學領域的 AI 應用開闢更廣闊的空間。