Лимиты запросов

Лимиты запросов Claude Fable 5

Три независимые оси с поминутным отсчётом, отдельный пул на каждую модель и набор цифр, заметно меньший, чем у остальных моделей линейки Claude.

Кратко за 30 секунд

Fable 5 ограничена по числу запросов в минуту, входных токенов в минуту и выходных токенов в минуту; лимиты применяются на уровне организации и отдельно для каждой модели. На уровне Start это 1,000 RPM, 500,000 ITPM и 100,000 OTPM; на Build — 2,000, 1,500,000 и 300,000; на Scale — 4,000, 4,000,000 и 800,000. Чтение из кэша не учитывается в ITPM — это самый большой рычаг, которым вы управляете сами.

Как устроены лимиты

Фактический потолок определяют четыре вещи, и только две из них указаны на странице с ценами.

  • У Fable 5 собственный пул, и он меньше

    Лимиты применяются отдельно для каждой модели, поэтому можно одновременно довести до предела сразу несколько моделей. Fable 5 сильно уступает остальным: на Start это 500,000 ITPM против 2,000,000 у Opus 5, Sonnet 5 и Haiku 4.5. Модели Opus 4.x делят один общий пул, а у Opus 5 и Fable 5 собственные.

  • Три независимые поминутные оси

    RPM, ITPM и OTPM соблюдаются независимо, поэтому превышение любой из них возвращает ошибку 429. Ограничитель работает по схеме пополняющегося ведра (token bucket): лимит восстанавливается непрерывно, а не сбрасывается через фиксированные интервалы, поэтому короткий всплеск нагрузки может вернуть 429, даже когда среднее значение в минуту заметно ниже лимита.

  • Тарифные уровни, а не регулировка по факту расхода

    Организации автоматически относят к уровням Start, Build, Scale или Custom на основе истории использования и состояния аккаунта; со временем уровень повышается. Уровни Start, Build и Scale несут месячный лимит расходов в $500, $1,000 и $200,000 соответственно. Новые организации могут начинать с цифр ниже опубликованных, пока не накопится история использования.

  • Лимиты рабочих пространств действуют ниже организационных

    Для каждого рабочего пространства можно задать более низкие лимиты расходов и частотные лимиты, чтобы одна команда не вырабатывала весь ресурс. Организационные лимиты действуют всегда, даже если сумма лимитов рабочих пространств больше, а заголовки anthropic-ratelimit сообщают о наиболее строгом лимите на текущий момент.

Как поднять эффективную пропускную способность: по порядку

Сначала кэширование, затем форма трафика, и только потом заявка на повышение. В форме заявки спрашивают про долю кэширования, так что сначала сделайте кэш.

  1. 1

    2. Кэшируйте всё, что повторяется

    У большинства моделей cache_read_input_tokens не учитываются в ITPM. Кэшируйте системные инструкции, описания инструментов, большие контекстные документы и историю переписки. При 80% попаданий в кэш и лимите 2,000,000 ITPM вы сможете обрабатывать 10,000,000 входных токенов в минуту.

  2. 2

    1. Узнайте свои реальные цифры

    Откройте страницу Limits в Claude Console, чтобы увидеть свой уровень и текущие лимиты, либо получите их программно через Rate Limits API. На странице Usage смотрите пиковые значения некешированных входных токенов в минуту и долю попаданий в кэш относительно настроенного лимита.

  3. 3

    4. Подайте заявку на повышение с доказательствами

    Используйте пункт Request rate limit increase на странице Limits. Подготовьте пиковые значения входных и выходных токенов в минуту для каждой модели и долю входных данных, приходящихся на кэш или повторяющийся контекст. При срочной необходимости обращайтесь напрямую в поддержку Anthropic.

  4. 4

    3. Сгладьте форму трафика

    Ставьте запросы в очередь и регулируйте темп вместо одновременного запуска, а новые нагрузки наращивайте постепенно, а не включайте сразу на полную мощность — это может активировать ускоренный лимит. Пакетные задачи, терпимые к задержке, переносите на Message Batches API, у которого собственные отдельные лимиты.

Уже получаете 429?

Страница про 429 подскажет, какая из трёх осей исчерпана и что делать в каждом случае.

Частые вопросы