Лимиты запросов
Лимиты запросов Claude Fable 5
Три независимые оси с поминутным отсчётом, отдельный пул на каждую модель и набор цифр, заметно меньший, чем у остальных моделей линейки Claude.
Кратко за 30 секунд
Fable 5 ограничена по числу запросов в минуту, входных токенов в минуту и выходных токенов в минуту; лимиты применяются на уровне организации и отдельно для каждой модели. На уровне Start это 1,000 RPM, 500,000 ITPM и 100,000 OTPM; на Build — 2,000, 1,500,000 и 300,000; на Scale — 4,000, 4,000,000 и 800,000. Чтение из кэша не учитывается в ITPM — это самый большой рычаг, которым вы управляете сами.
Как устроены лимиты
Фактический потолок определяют четыре вещи, и только две из них указаны на странице с ценами.
У Fable 5 собственный пул, и он меньше
Лимиты применяются отдельно для каждой модели, поэтому можно одновременно довести до предела сразу несколько моделей. Fable 5 сильно уступает остальным: на Start это 500,000 ITPM против 2,000,000 у Opus 5, Sonnet 5 и Haiku 4.5. Модели Opus 4.x делят один общий пул, а у Opus 5 и Fable 5 собственные.
Три независимые поминутные оси
RPM, ITPM и OTPM соблюдаются независимо, поэтому превышение любой из них возвращает ошибку 429. Ограничитель работает по схеме пополняющегося ведра (token bucket): лимит восстанавливается непрерывно, а не сбрасывается через фиксированные интервалы, поэтому короткий всплеск нагрузки может вернуть 429, даже когда среднее значение в минуту заметно ниже лимита.
Тарифные уровни, а не регулировка по факту расхода
Организации автоматически относят к уровням Start, Build, Scale или Custom на основе истории использования и состояния аккаунта; со временем уровень повышается. Уровни Start, Build и Scale несут месячный лимит расходов в $500, $1,000 и $200,000 соответственно. Новые организации могут начинать с цифр ниже опубликованных, пока не накопится история использования.
Лимиты рабочих пространств действуют ниже организационных
Для каждого рабочего пространства можно задать более низкие лимиты расходов и частотные лимиты, чтобы одна команда не вырабатывала весь ресурс. Организационные лимиты действуют всегда, даже если сумма лимитов рабочих пространств больше, а заголовки anthropic-ratelimit сообщают о наиболее строгом лимите на текущий момент.
Как поднять эффективную пропускную способность: по порядку
Сначала кэширование, затем форма трафика, и только потом заявка на повышение. В форме заявки спрашивают про долю кэширования, так что сначала сделайте кэш.
- 1
2. Кэшируйте всё, что повторяется
У большинства моделей cache_read_input_tokens не учитываются в ITPM. Кэшируйте системные инструкции, описания инструментов, большие контекстные документы и историю переписки. При 80% попаданий в кэш и лимите 2,000,000 ITPM вы сможете обрабатывать 10,000,000 входных токенов в минуту.
- 2
1. Узнайте свои реальные цифры
Откройте страницу Limits в Claude Console, чтобы увидеть свой уровень и текущие лимиты, либо получите их программно через Rate Limits API. На странице Usage смотрите пиковые значения некешированных входных токенов в минуту и долю попаданий в кэш относительно настроенного лимита.
- 3
4. Подайте заявку на повышение с доказательствами
Используйте пункт Request rate limit increase на странице Limits. Подготовьте пиковые значения входных и выходных токенов в минуту для каждой модели и долю входных данных, приходящихся на кэш или повторяющийся контекст. При срочной необходимости обращайтесь напрямую в поддержку Anthropic.
- 4
3. Сгладьте форму трафика
Ставьте запросы в очередь и регулируйте темп вместо одновременного запуска, а новые нагрузки наращивайте постепенно, а не включайте сразу на полную мощность — это может активировать ускоренный лимит. Пакетные задачи, терпимые к задержке, переносите на Message Batches API, у которого собственные отдельные лимиты.
Уже получаете 429?
Страница про 429 подскажет, какая из трёх осей исчерпана и что делать в каждом случае.