Вернуться в блог

Claude Fable5 против GPT-5.5 — бенчмарки, цены и что выбрать

Fable5 опережает GPT-5.5 на 22 пункта в SWE-Bench Pro и в 5 раз в FrontierCode — при цене выше примерно в 8 раз. Полное сравнение, включая единственный бенчмарк, где выигрывает GPT-5.5.

10 июня 2026 г.Редакция Fable5Редакция Fable5
Claude Fable5 против GPT-5.5 — бенчмарки, цены и что выбрать

Это анализ с датировкой. Актуальное сравнение с источниками и текущими ценами ведётся на странице Claude Fable 5 против GPT-5.5.

Это сравнение, о котором спрашивают первым, и то, где опубликованные цифры самые однобокие — сразу в обе стороны. Claude Fable5 показывает самые большие отрывы по бенчмаркам среди фронтовых моделей, которые мы видели; цена GPT-5.5 делает эти отрывы несущественными для большей части продакшн-трафика. Верны оба утверждения.

Таблица бенчмарков

БенчмаркFable5GPT-5.5
SWE-Bench Pro (агентное программирование)80.3%58.6%
FrontierCode (Diamond)29.3%5.7%
GDPval-AA (интеллектуальная работа)19321769
GDP.pdf (зрение, без инструментов)29.8%24.9%
OSWorld-Verified (управление компьютером)85.0%78.7%

Три честных замечания. Во-первых, это цифры, опубликованные самими лабораториями, и настройки тоже выбирали они, — относитесь к ним как к ориентиру. Во-вторых, результат GPT-5.5 по зрению (24.9%) выше, чем у Claude Opus 4.8 (22.5%) — если ваша нагрузка сильно зависит от зрения и вы выбираете между моделями среднего класса, эта строка для вас важнее заголовка. В-третьих, на оценках по кибербезопасности и биологии механизмы безопасности Fable5 ограничивают его результаты уровнем около Opus 4.8 — неограниченные цифры принадлежат Mythos 5, который купить нельзя.

FrontierCode — вот настоящая история

Отрыв в 22 пункта в SWE-Bench Pro — это много. Отрыв в 5 раз по FrontierCode (29.3% против 5.7%) — это уже другой класс разрыва. FrontierCode Diamond — самый близкий публичный аналог «инженерных задач, с которыми пока не справляются»: рефакторинг по множеству репозиториев, непривычная отладка, долгосрочная автономная работа. С 5.7% GPT-5.5 фактически не играет в этом классе; с 29.3% Fable5 иногда может. Если в вашем плане есть задачи, на которых вы уже видели провал фронтовых моделей, эта одна строка и есть всё сравнение.

Цены: ответный удар GPT-5.5

  • GPT-5.5: $1.25 за вход / $10 за выход за миллион токенов, скидка 90% на кэшированные входные токены.
  • Fable5: $10 за вход / $50 за выход, скидка 90% на кэшированные входные, 50% через Batch API.

Это в 8 раз на входе и в 5 раз на выходе. Для чат-продуктов, пайплайнов извлечения данных, суммаризации — для всего, с чем обе модели справляются хорошо, — цена GPT-5.5 закрывает вопрос. Премия за отрыв в бенчмарках оправдана только там, где GPT-5.5 действительно не справляется и повторы (или люди) стоят реальных денег. Калькулятор стоимости позволяет смоделировать обе модели, включая кэширование.

Где выигрывает каждая модель

Fable5:

  1. Инженерия на пределе возможностей. Уровень FrontierCode — одна дорогая попытка лучше N дешёвых провалов. Математика повторов становится выгоднее по мере роста разрыва в цене, но только там, где дешёвая модель действительно не справляется.
  2. Многочасовые автономные агенты. Fable5 сохраняет связность на миллионах токенов и исправляет себя с помощью заметок о прогрессе; именно здесь разрыв в SWE-Bench Pro накапливается.
  3. Ответственная интеллектуальная работа. Отрыв в 163 пункта в GDPval-AA плюс буквальное следование инструкциям, которое делает контракты на результат реально обязательными.

GPT-5.5:

  1. Всё, где большие объёмы. При цене входа в 8 раз ниже дефолтный поток принадлежит ему (или Opus 5 за $5/$25, если вы хотите остаться в экосистеме Claude).
  2. Зрение в рамках бюджета. Единственная строка, где он выигрывает у моделей выше своего ценового класса.
  3. Продукты на стеке OpenAI. Structured outputs, инструменты Assistants и существующие интеграции с GPT несут издержки перехода, которые не компенсирует ни один бенчмарк.

Промпты: не вставлять, а переносить

GPT-5.5 сохранил temperature/top_p и прощает вольные промпты. У Fable5 оба регулятора убраны, и он выполняет инструкции буквально — расплывчатый промпт даёт буквалистский результат, точный даёт ровно то, что вы просили. Перенося промпт с GPT-5.5 на Fable5: уберите приёмы, завязанные на сэмплинг, явно укажите роль/задачу/формат/ограничения и поместите полную спецификацию в первое сообщение. Генератор промптов собирает такую структуру; гайд по промптингу объясняет миграцию.

Вывод

  • Дефолтный поток: GPT-5.5 (или Opus 5) — там, где качество проходит планку, решает цена.
  • Эскалация: Fable5 — самая сложная разработка, длинные автономные прогоны, работы, где ошибка обходится дорого.
  • Средний класс с упором на зрение: прежде чем платить цены Claude, дайте GPT-5.5 честную оценку.

Команды, которые делают это правильно, не выбирают победителя — они пишут правила маршрутизации. Рассчитайте разделение потоков.

FAQ

Fable5 лучше, чем GPT-5.5? По опубликованным бенчмаркам — да, по каждой строке, и самый значимый разрыв — 5x по FrontierCode. По цене убедительно выигрывает GPT-5.5.

Достаточно ли GPT-5.5 для программирования? Для рутинных задач — да, и за малую долю цены. Для самого сложного класса опубликованные 5.7% в FrontierCode говорят «нет».

Можно ли прогнать A/B обоих через один API? Да — обе модели есть на OpenRouter (anthropic/claude-fable-5), это путь с наименьшим трением, чтобы прогнать один и тот же набор тестов на обеих.

Цифры бенчмарков — из анонса Anthropic от 9 июня 2026 года и опубликованных результатов GPT-5.5 от OpenAI, по состоянию на 10 июня 2026 года. Независимый анализ — см. полный гид по Fable5 и сравнение с Gemini.

Похожие статьи