Anthropic 于本周宣布,已对其旗舰模型 Claude Fable 5 的生物安全防护系统进行重大更新,显著降低了误报率。据该公司测试,此次更新使与生物相关的“回退”事件减少了约 85%——即用户提出生物相关查询后,系统不再频繁地将请求转交给能力较弱的 Opus 5 模型处理。这一变化意味着,Fable 5 现在能够更顺畅地协助处理日常健康与教育类问题,例如解读化验结果、理解症状以及生物学知识学习,同时也能为医疗专业人员的临床任务提供更多支持。

Anthropic 在官方公告中强调,其目标是让 Fable 5 的前沿能力尽可能快地惠及更多用户,但同时也必须管理模型强大能力带来的风险。公司承认,在生物领域,Fable 5 已能在某些高度复杂的任务上超越专家,这既可能用于研发新疗法,也可能被恶意行为者滥用,例如开发生物武器。为此,Anthropic 最初在发布 Fable 5 时几乎屏蔽了所有生物查询,以优先确保安全,但这种保守做法导致大量合法用户的请求被误拦截,体验受损。此次更新正是对先前策略的修正,通过优化安全分类器来减少误报,同时仍保留对高风险领域的限制。

具体而言,Anthropic 的安全防护机制依赖一系列小型自动化 AI 系统(即“安全分类器”),用于检测 Fable 5 是否被要求执行受保护的生物任务或产生有害输出。当分类器触发时,系统会将请求重定向至 Opus 5——一个不具备同等生物能力的模型,从而限制潜在危害。Anthropic 表示,开发精确且稳健的分类器并非易事,需要不断迭代以平衡误报(错误拦截)与漏报(漏掉有害内容),同时还要抵御越狱攻击。此次更新中,团队“仔细重写了分类器的宪法”,以更精确地界定生物相关查询的“范围内”与“范围外”,从而大幅降低误报率。

值得注意的是,尽管误报率显著下降,Fable 5 仍会对涉及病毒学、毒理学和分子设计等双重用途领域的请求回退至 Opus 5,因此目前尚不能用于专业生物学研究或药物开发。Anthropic 表示,他们正致力于通过“可信访问途径”来缩小这一差距,让前沿生物能力能够安全地惠及专业研究人员。公司还引用了美国情报界《2026 年度威胁评估》中的警告,指出生物技术(包括合成生物学和基因组编辑)的进步可能带来新型生物威胁,且部分国家行为体可能维持活跃的进攻性生物与化学武器计划,这凸显了加强安全防护的必要性。

从行业视角看,Anthropic 的这一举措反映了 AI 公司在部署超强模型时面临的普遍两难:如何在释放能力与防范风险之间取得平衡。此前,Anthropic 曾因 Fable 5 的过度保守而受到部分用户批评,认为其阻碍了合法的生物研究。此次更新被视为对用户反馈的回应,但公司仍坚持对高风险领域保持严格限制,显示出其在安全上的审慎立场。对于关注 AI 安全与模型可用性的观察者而言,这一动态表明,前沿模型的安全机制正在从“一刀切”的封锁转向更精细化的分类管理,未来或将为生物医学领域的 AI 应用开辟更广阔的空间。