Источник: launch table Anthropic от 9 июня 2026
Бенчмарки Claude Fable 5
Полная опубликованная таблица — 80.3% SWE-Bench Pro, лучший score среди public models — плюс честный разбор из launch posts: какие starred rows относятся к Mythos 5 и почему safeguard-flagged домены score на уровне Opus 4.8.
Бенчмарки — с честной сноской
Опубликованные результаты Anthropic ставят Claude Fable5 впереди в агентном программировании и работе со знаниями. Вот полная таблица, а также оговорка, которую посты о запуске обходят молчанием.
| Бенчмарк | Claude Fable5 / Mythos 5 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro (код) | 80.3% | 69.2% | 58.6% | 54.2% |
| FrontierCode — Diamond | 29.3% | 13.4% | 5.7% | — |
| GDPval-AA (работа со знаниями) | 1932 | 1890 | 1769 | 1314 |
| GDP.pdf (зрение, без инструментов) | 29.8% | 22.5% | 24.9% | 16.7% |
| OSWorld-Verified (управление компьютером) | 85.0% | 83.4% | 78.7% | 76.2% |
На оценках кибербезопасности и биологии (например, ExploitBench) механизмы безопасности Claude Fable5 ограничивают её результаты уровнем около Opus 4.8 — опубликованные там лучшие результаты принадлежат неограниченной модели Claude Mythos 5. Источник: анонс Anthropic, 9 июня 2026.
Как читать эти цифры честно
- Starred rows в таблице Anthropic — cybersecurity и biology evaluations вроде ExploitBench — это scores Claude Mythos 5, не Fable 5. Они реальны, но воспроизвести их вы почти наверняка не сможете.
- В safeguard-flagged доменах результаты Fable 5 близки к Opus 4.8 — когда срабатывает classifier, отвечает буквально Opus 4.8. С 1 июля 2026 после restoration часть routine coding requests временно fallback на Opus, пока настраивают новые classifiers.
- Coding, knowledge work и computer-use scores — настоящие результаты Fable 5; для них опубликованное совпадает с тем, что вы получите.
Правило: если домен достаточно restricted, чтобы сработали safeguards Fable 5, top score в таблице — у Mythos 5; score, который вы реально видите — у Opus 4.8.
Против остального поля
Fable 5 опережает GPT-5.5 на 22 пункта в SWE-Bench Pro и в ~5 раз на FrontierCode; Gemini 3.1 Pro — на 26 пунктов в SWE-Bench Pro — при цене примерно в 4–8 раз выше. Sonnet 5 ($2/$10 intro) закрывает большую часть day-to-day coding почти на уровне Opus. Полные разборы:
FAQ по бенчмаркам
Копнуть глубже
Используйте Claude Fable5 с открытыми глазами
Разберитесь в расчёте стоимости Claude Fable5, поведении механизмов безопасности и правильном тарифе, прежде чем решаться. Создайте бесплатный аккаунт, чтобы получать уведомления об изменениях характеристик, цен и каналов доступа.