返回博客

Claude Fable 5 越狱事件全解读

红队研究者称 Fable 5 在 72 小时内被越狱,Anthropic 否认。事件始末、分类器架构如何运作、对普通用户和开发者意味着什么。

2026年6月13日Fable5 编辑部Fable5 编辑部
Claude Fable 5 越狱事件全解读

发布仅三天,Claude Fable 5 就经历了每个前沿模型的"成人礼":知名红队研究者宣布它已被"解放",晒出截图,并公开了一份号称是它 system prompt 的文件。Anthropic 强硬反驳。双方各有道理——而两边说法之间的缝隙,恰恰是理解 Fable 5 安全机制最有用的切口。

本文是解读,不是教程。我们不会复述任何绕过手法的细节。

事件时间线

  • 6 月 9 日: Anthropic 发布 Fable 5,并表示发布前的外部漏洞悬赏在 1000+ 小时测试中没有发现任何通用越狱。
  • 6 月 10–11 日: 公开 AI 越狱领域最知名的 Pliny the Liberator 在 X 上宣布,他用一套他称为"pack hunt"(群猎)的多 agent 协同手法——请求拆分、Unicode 混淆、叙事包装——绕过了 Fable 5 的安全层。截图显示了涉及网络安全利用和化学的输出。
  • 同一时间窗: 一份号称是 Fable 5 约 12 万字符 system prompt 的文件出现在 GitHub——正是多年来持续追踪 Claude system prompt 的那些泄露仓库。
  • 6 月 12 日: Anthropic 反驳:最强的防护是独立分类器而非模型自身的拒答;审查发现部分流传输出根本不是 Fable 5 生成的;真正出自 Fable 5 的输出只包含已公开的信息;没有证据表明防护被绕过并产出真正危险的内容。

为什么双方都能说自己是对的

争议的核心在于"越狱"的定义,而 Fable 5 的架构让这个定义变得异常具体。

正如我们在 safeguard fallback 深度解读中所写,Fable 5 的安全栈有两个截然不同的层:

  1. 模型自身的行为——语气、拒答方式,这些由 system prompt 塑造。这一层从来都是可以被"哄"的:让模型在拒绝后继续往下说,是迄今所有 LLM 的已知弱点。
  2. 独立安全分类器——独立于模型之外的系统,盯防 Anthropic 认定的高危领域(网络攻击、生物、化学、模型蒸馏),命中即把会话改由 Claude Opus 4.8 接管。这一层无法被话术绕开,因为执行它的不是模型本身。

Pliny 的演示是针对第 1 层的真实证据;Anthropic 的反驳说的是第 2 层——他们对"真越狱"的标准是对高危害行为提供实质性帮助,也就是必须击穿分类器,而不是攻破模型的"礼貌"。按这个标准,那些与公开教程内容相当的栈溢出讲解截图确实不够格。

诚实的记分牌:'"解放"的说法夸大了,但"Fable 5 牢不可破"的印象同样夸大了。一个对话层 72 小时被攻破、分类器层守住的模型,恰恰就是 Anthropic 描述要发布的那个系统——这令人安心还是令人担忧,取决于你把多少权重押在分类器上。

system prompt 泄露,单独评估

泄露的提示词值得单独说,因为它总和越狱混为一谈:

  • 真实性: Anthropic 未确认,但托管它的仓库有长期且准确的历史记录——我们的 system prompt 分析逐段拆解了 Fable 5 提示词的内容以及相对 Opus 4.8 的变化。
  • 影响: system prompt 是模型的岗位说明书,不是安保系统。它塑造 Claude 应用里的人设、排版和拒答语气。API 用户从来不受它管辖——你写你自己的。读到它能让竞品了解 Anthropic 的设计哲学,但不会递给攻击者一把钥匙,因为分类器运行在它之外。

对你意味着什么

如果你通过应用或 API 使用 Fable 5: 本周什么都没变。fallback 行为——不到 5% 的会话、静默由 Opus 4.8 接答、按 Fable 5 费率计费——和发布当天完全一致。部分正是为了审计这类事件而存在的 30 天数据保留政策也依然有效。

如果你做安全研究: Pliny 最有力的观点不是技术性的,而是程序性的——过宽的分类器会妨碍正当的防御性研究。Anthropic 对此的答案是 Claude Mythos 5:同一个模型,对通过审查的网络防御者解除部分防护。如果你的工作总是触发分类器,受信访问计划才是正路。

如果你在评估模型安全声明: 这次事件是一次有用的校准。"未发现通用越狱"和"72 小时被越狱"描述的是同一个模型——差别只在各自测量的是哪一层。以后看到任何安全声明,先问它说的是哪一层。

诚实的结论

Fable 5 的对话层几天内被掰弯,分类器层(就现有证据而言)守住了,一份自称是它 system prompt 的文件已经公开。这些都不改变这个模型擅长什么、要花多少钱。它确实验证了 Anthropic 下的设计赌注:不信任模型自我监管,把执法机构装在模型外面。到目前为止,这颗螺栓还拧得很紧。

事件信息截至 2026 年 6 月 13 日,来源为 Anthropic 声明与安全媒体报道。用提示词生成器测测 Fable 5 对你自己提示词的反应。

相关文章