参考资料 — 更新于 2026 年 7 月 27 日
Claude Fable 5 术语表
Anthropic 的 Mythos-class 发布带来了一整套八周前还不存在的词汇:covered model、安全回退、effort 档位、拒答类别。下面每一条都独立成篇、标注日期,写给要做决策的人,不是写给应付考试的人。
先看这几条
五个词撑起了大半。Mythos-class 是 Fable 5 所属的能力层级,强制 30 天数据留存就是它带来的。安全回退解释了为什么一个 Fable 5 请求会悄悄由 Opus 4.8 来作答。effort 是 API 留给你的唯一一个调节旋钮。usage credits 是订阅制变成按量计费的方式。零数据留存则是 Fable 5 跨不过去的合规红线。这份表里其余的条目,基本都挂在这五个词下面。
- adaptive thinking(自适应思考)
- Fable 5 每次作答前都会先思考,而且关不掉——传 thinking 且 type 为 disabled 会返回 400,旧的 budget_tokens 写法同样报错。原始思维链永远不会返回;默认情况下 thinking 块是空的,要给用户展示什么,必须显式请求 summarized。两个实际后果:思考 token 与可见回答共用 max_tokens 额度,预算要留足;以及在流式界面里,用默认的 omitted 显示模式会让思考阶段看起来像卡死了。
- Batch API(批处理)
- 一个异步接口,用放弃延迟保证换取输入与输出双双五折,结果在 24 小时内返回。这个折扣可以和提示词缓存叠加,批处理里的缓存读取大约能降到标价的 5% 左右。判断规则很简单:只要没有人坐在那儿等答案——评测跑批、历史数据回填、夜间摘要、批量分类——把它挪到批处理,除了改调用点之外不用做任何事,账单就少一半。
- 上下文窗口
- 模型在单次请求中能纳入考虑的文本量。Fable 5 最多接受 100 万输入 token,单次最多产出 128K 输出 token。值得记住的细节是:max_tokens 同时限制思考和可见输出,所以在 xhigh 或 max effort 下,一次运行可能还没开始写答案就把额度想完了——Anthropic 的建议是这两档从 64K 起步。大窗口也不是免费的:除非命中缓存,否则你重发的每一个 token 都要计费。
- CursorBench
- Cursor 自家的编码 agent 评测,Anthropic 在 Opus 5 发布材料中引用的是 3.2 版本。公布的结果是:Opus 5 在 max effort 下与 Fable 5 的最高分相差不到 0.5%,而单任务成本约为一半。因为它衡量的是真实编辑器循环里的工作,而不是研究用 harness,所以最贴近多数开发者的实际体感——在这里 Fable 5 剩下的领先幅度已经小到通常由价格来决定选型。
- DeepSeek V4
- DeepSeek 的开源权重旗舰模型,权重可自由下载。Pro 档价格为每百万输入 token 0.435 美元、每百万输出 token 0.87 美元;Flash 档为 0.14/0.28 美元。DeepSeek 报告的 SWE-bench Pro 55.4% 为企业自报数据,未经独立确认。它是与 Fable 5 封闭 API 形成对比的主要开源权重模型之一。
- effort 参数
- 请求字段 output_config.effort,取值 low、medium、high、xhigh、max,默认 high。它是 Fable 5 上权衡智能、延迟与成本的主要控制项,并且基本取代了采样参数——传入非默认的 temperature、top_p 或 top_k 会返回 400 错误。Anthropic 自己的建议是从 high 起步,把 xhigh 和 max 留给对能力敏感的编码和 agentic 任务;Fable 5 在低档位上的表现往往超过旧模型的 xhigh,也就是说贵模型跑低 effort 有可能才是便宜方案。
- 出口管制
- 影响中国开源权重模型分发与获取的美国出口管制限制。这与本站的差异化时间线直接相关:Fable 5 曾因托管相关问题于 6 月 12 日至 7 月 1 日下线,并于 7 月 1 日恢复。DeepSeek、Qwen、GLM 等中国模型目前仍广泛可用,但监管形势仍在变化,可用性可能随时变化而无预警。
- Claude Fable 5
- Anthropic 公开可用的 Mythos-class 模型,API ID 为 claude-fable-5,2026 年 6 月 9 日发布。定价为输入每百万 token $10、输出每百万 token $50,上下文窗口 100 万 token,单次最多输出 128K token,SWE-Bench Pro 得分 80.3%。它是 Anthropic 公开价目表上最贵的模型——约为 Opus 5 的两倍、Sonnet 5 引导价的五倍——所以实际要问的很少是它够不够强,而是这个任务值不值这个倍数。
- Frontier-Bench v0.1
- 一个终端 agentic 编码基准,Anthropic 在 Opus 5 发布时把它当作主打指标:Opus 5 得 43.3%,Fable 5 得 33.7%,Opus 4.8 得 18.7%。这些数字来自 Anthropic 的内部运行,使用 mini-SWE-agent harness 与 GKE 后端,取每题五次尝试的平均 reward。有一条脚注会改变你的读法:那次运行中,安全分类器拒答时由 Opus 4.8 兜底,所以这些数字描述的是一套配置好的 agent 策略,而不是裸的模型端点。
- GDPval
- OpenAI 提出的基准,衡量模型在真实且有经济价值的知识工作上的表现:覆盖美国 GDP 前九大行业中的 44 种职业、共 1,320 项任务,每一项都基于平均约 14 年从业经验的专业人士的真实工作成果,其中 220 项作为 gold 子集开源。Anthropic 在发布表格中引用的是 Elo 计分变体 GDPval-AA。它是目前最接近「这个模型能不能干真实岗位的活」的问法,也正因如此,主要靠人工对比评分而不是单元测试。
- Project Glasswing
- Anthropic 的防御性网络安全计划,2026 年 4 月 7 日宣布,首批伙伴包括 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux 基金会、Microsoft、NVIDIA 和 Palo Alto Networks,此后扩展到约 15 个国家的约 150 家机构。参与方用未受限的 Mythos 模型审计自己的代码库和基础设施。没有公开申请入口——项目为邀请制并需签署保密协议——所以如果你在纠结要不要等 Mythos 权限,对绝大多数团队来说,老实的答案是这条路不会打开。
- GLM 5.2
- 智谱的开源权重模型,以 MIT 许可证发布,价格约为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元。智谱报告的 SWE-bench Pro 62.1% 为企业自报数据,未经独立确认。
- Kimi K3
- 月之暗面(Moonshot AI)的 2.8T 参数旗舰模型,于 2026 年 7 月 27 日发布,权重开源。价格为每百万输入 token 3 美元、每百万输出 token 15 美元。它是与 Fable 5 竞争的最突出的开源权重模型之一。
- Claude Mythos 5
- 与 Fable 5 是同一个底层模型,但解除了网络安全与生物学方面的安全限制。它不是花钱能买到的产品,只通过 Project Glasswing 向经审核的网络防御方和关键基础设施运营方开放。读跑分表时这一点很关键:标注为 Mythos 5 的那些行描述的是你调不到的模型,而在受安全防护的话题上,Fable 5 的表现更接近 Opus 4.8 而不是 Mythos 的数字。
- Mythos-class(Mythos 级)
- Anthropic 给自家前沿能力层级起的名字——在网络安全和生物学任务上强到需要区别对待的模型。2026 年 6 月 9 日发布的 Claude Fable 5 是第一个公开可用的 Mythos-class 模型。这个标签不是营销话术:常开的安全分类器、强制 30 天数据留存、不适用零数据留存协议,都是它带来的。看到 Mythos-class,就默认它的合规要求比 Opus 和 Sonnet 严格。
- 开源权重
- 指训练权重可自由下载、任何人都能自行部署或微调的模型。这一代模型中的例子包括 GLM 5.2(MIT)、DeepSeek 和 Kimi K3。这与只能通过 Anthropic 封闭 API 使用的 Fable 5 形成对比。
- OSWorld
- 一个让 agent 在真实 Ubuntu 桌面(而非模拟器)上操作的电脑使用基准:369 个任务,覆盖浏览器、办公套件、文件管理、终端和图像编辑,每个任务都有脚本化的初始状态,并通过程序检查文件系统状态来判定成败。OSWorld 2.0 增补了一批更长的多步骤工作流任务。如果你的方案是让 agent 去操作图形界面而不是调 API,这一系列基准就是预测它能不能跑通的依据——而这里的分数至今远低于人类在相同任务上的水平。
- prompt caching(提示词缓存)
- 用 cache_control 标记提示词中稳定的前缀,让重复请求不必按全价重新处理这一段。缓存读取按基础输入价的 0.1 倍计费——也就是九折之外再打一折——写入则是默认五分钟 TTL 的 1.25 倍或一小时 TTL 的 2 倍,所以五分钟档在第二次命中时就已回本。在 Fable 5 每百万输入 token $10 的价位上,长系统提示词或每轮都重发的大规格文档,恰恰是缓存决定项目能不能负担得起的那类负载。
- Qwen 3.8 Max
- 阿里的旗舰模型,价格约为每百万输入 token 2 美元、每百万输出 token 6 美元,上下文窗口为 1M。截至 2026 年 8 月,它已宣布但尚未发布。
- reasoning_extraction
- 拒答类别之一,与 cyber、bio 并列。当提示词试图让模型把内部推理原样写进回答正文时它就会触发,这是逐请求生效的反蒸馏防护。它会误伤一个非常常见的写法:agent 框架要求模型逐字复述思考过程,好让下游步骤读取。如果你需要过程可见性,请改为请求 summarized 的 thinking 块,而不是让模型把推理讲进答案里。
- stop_reason refusal
- 分类器拦截在 API 上的信号。Messages API 返回的是 HTTP 200——成功,而不是错误——其中 stop_reason 为 refusal,并带一个标明类别的 stop_details 对象。任何只看 HTTP 状态码的错误处理都会把它当成正常完成放过去,在流水线里就意味着链条中出现一个空的或错的环节,却没有任何告警。每一次 Fable 5 调用都要显式判断 stop_reason,并把 stop_details 为 null 的情况按通用拒答处理,别假定它一定有类别。
- 安全回退(safeguard fallback)
- 当 Fable 5 的某个安全分类器触发时,Anthropic 不会直接甩给你一句拒答,而是改由 Claude Opus 4.8 来处理这个请求。Anthropic 称平均不到 5% 的对话会遇到这种情况,这也解释了为什么一个 Fable 5 工作流在安全或生命科学话题上会明显变弱,却看不出哪里坏了。在 Claude 应用里会有切换提示;在 API 上得你自己检测。把它当成一个独立事件记录下来,否则你会把质量下降误判成模型漂移。
- SWE-Bench Pro
- Scale AI 推出的抗污染版 SWE-Bench Verified 继任者:来自 41 个活跃维护仓库的 1,865 道题,分为公开集、留出集和商业集。公开仓库刻意选用强 copyleft 许可,商业仓库则完全私有,两者都是为了让代码不进训练语料。任务是长周期的,通常要跨多个文件改动。Fable 5 得分 80.3%,是已公布的公开模型最高分。比较分数时务必限定在同一 harness 内——换个脚手架,数字会有明显变化。
- tokenizer 变更
- 从 Fable 5 开始,Anthropic 换了 tokenizer,同样一段文本现在比旧模型多算约 30% 的 token。这会打乱大家从旧账单里带过来的算术:只比单价会低估真实差距,因为你同时还在为同样的输入买更多 token。在批准迁移预算之前,拿一份有代表性的样本在新模型上实跑一遍,读真实的用量数字,别拿上个季度的账单往外推。
- usage credits(用量额度)
- 一份与 Claude 订阅并存的按量付费余额,在套餐内额度用完后按 API 价计费。自 2026 年 7 月 20 日起,Pro 和 Team Standard 只能通过它使用 Fable 5,并有一次性 $100 额度缓冲;Max 和 Team Premium 则在 Fable 5 吃掉周额度的 50% 之后转为额度计费。实际含义是:额度就是让固定月费变成浮动账单的机制,所以任何重度使用 Fable 5 的计划都需要一份以美元计的预算,而不只是一个套餐等级。
- 零数据留存(ZDR)
- 一种合同安排,约定 Anthropic 在 API 响应返回后不再静态存储你的输入和输出。它不是一个开关:要与销售协商、按组织逐一审批,而且不会自动延伸到同一账户下的其他组织。Fable 5 属于需要 30 天安全留存的 covered model,因此在启用了 ZDR 的组织里根本无法使用。对于有硬性 ZDR 要求的团队,这是一个靠调配置解决不了的拦路石。