Fable5 的安全回退机制:它是怎么悄悄换成 Opus 4.8 的
Fable5 不会拒绝敏感请求——它会静默地交给 Claude Opus 4.8 来回答。什么会触发回退、触发频率有多高、对基准测试和计费意味着什么。
2026年6月9日
Fable5 编辑部

Claude Fable5 最特别的设计决策不是某项能力,而是当你问错问题时会发生什么:它不拒绝,而是把会话静默转给 Claude Opus 4.8,照样给你答案。
机制本身
Fable5 配备了严格的安全分类器,聚焦在 Anthropic 认为 Mythos 级能力不宜大范围开放的领域——主要是网络安全与生物学。当请求触发分类器时:
- 请求不会被拒绝。
- 改由 Claude Opus 4.8 生成回答。
- Anthropic 称平均不到 5% 的对话会发生这种情况。
对于真正的受限场景,Anthropic 提供了单独的版本:Claude Mythos 5——同一底层模型但解除部分安全限制,仅通过 Project Glasswing 向经审核的网络防御者与基础设施提供商开放。
对基准测试意味着什么
公开成绩需要仔细解读。在 ExploitBench 这类网络安全与生物学评测中,Fable5 的成绩接近 Opus 4.8 的水平——因为实际作答的常常就是 Opus。那些上头条的领域最高分属于 Mythos 5,而你几乎肯定用不上它。至于编码、知识工作和视觉基准,公布的 Fable5 数字是货真价实的。
对你的产品意味着什么
- 一致性: 如果你的应用涉及安全研究、恶意软件分析或生物科技,会有一部分回答来自另一个(更弱的)模型——而 API 响应中没有任何标记。
- 计费: 按实际回答的模型计价。在产生任何输出之前到达的拒答完全不收费,随后的 Opus 4.8 那一轮按 Opus 价格计费;中途拒答则是已流出的部分按 Fable5 计价、剩余按 Opus 计价。无论哪种情况,如果你的领域频繁触发回退,不如直接把这些调用路由给 Opus 4.8——答案一样,还省掉分类器这一趟。
- 数据保留: Fable5 与 Mythos 5 都执行 30 天数据保留政策用于安全监控,零数据保留(ZDR)协议不适用。
诚实的结论
回退机制是合理的工程折衷——既让 Fable5 保持大范围可用,又不至于把不受限的前沿能力直接放出去。但它奖励那些知道它存在的团队:测试你的真实工作负载,留意敏感话题上的质量断崖,别对领域基准照单全收。
来源:Anthropic 公告与模型文档,2026 年 6 月 9 日。更多内容见常见问题。更新:这套分类器架构正是 6 月越狱争议实际检验的对象。