Существует два типа ограничений:
API применяет настроенные сервисом ограничения на уровне организации, но вы также можете задавать пользовательские ограничения для рабочих пространств вашей организации.
Каждый из уровней Start, Build и Scale имеет ежемесячный лимит расходов — максимальную сумму, которую ваша организация может потратить на API за календарный месяц. Как только вы достигнете лимита расходов вашего уровня, использование API приостанавливается до следующего месяца, если вы не запросите более высокий лимит. Вы можете просмотреть ежемесячный лимит расходов вашей организации и установить собственный лимит на странице Billing.
| Уровень использования | Ежемесячный лимит расходов |
|---|---|
| Start | $500 USD |
| Build | $1,000 USD |
| Scale | $200,000 USD |
Организации на уровне Custom не имеют ежемесячного лимита расходов; лимиты согласовываются с их командой по работе с клиентами.
Вы также можете установить собственный лимит расходов ниже лимита вашего уровня, чтобы контролировать затраты:
Перейдите на страницу Billing
Откройте Settings > Billing в Claude Console.
Откройте редактор лимита расходов
В разделе Spend limits нажмите Adjust limit (или Set limit, если лимит ещё не установлен).
Настройте лимит расходов
Введите новое значение. Ваш лимит расходов не может превышать лимит вашего текущего уровня.
Ограничения скорости для Messages API измеряются в запросах в минуту (RPM), входных токенах в минуту (ITPM) и выходных токенах в минуту (OTPM) для каждого класса моделей.
Если вы превысите любое из ограничений скорости, вы получите ошибку 429 с описанием того, какое ограничение скорости было превышено, а также заголовок retry-after, указывающий, сколько нужно подождать.
Многие поставщики API используют объединённый лимит «токенов в минуту» (TPM), который может включать все токены — как кэшированные, так и некэшированные, входные и выходные. Для большинства моделей Claude в лимит ITPM засчитываются только некэшированные входные токены. Это ключевое преимущество, благодаря которому ограничения скорости фактически выше, чем может показаться на первый взгляд.
Ограничения скорости ITPM оцениваются в начале каждого запроса, и оценка корректируется в ходе запроса, чтобы отразить фактическое количество использованных входных токенов.
Вот что засчитывается в ITPM:
input_tokens (токены после последней точки разрыва кэша) ✓ Засчитываются в ITPMcache_creation_input_tokens (токены, записываемые в кэш) ✓ Засчитываются в ITPMcache_read_input_tokens (токены, считываемые из кэша) ✗ НЕ засчитываются в ITPM для большинства моделейПример: При лимите ITPM в 2 000 000 и доле попаданий в кэш 80% вы фактически можете обрабатывать 10 000 000 входных токенов в минуту (2 млн некэшированных + 8 млн кэшированных), поскольку кэшированные токены не засчитываются в ваше ограничение скорости.
Ограничения скорости OTPM оцениваются в реальном времени по мере генерации выходных токенов, при этом учитываются только фактически сгенерированные токены. Параметр max_tokens не учитывается при расчёте ограничений скорости OTPM, поэтому установка более высокого значения max_tokens не имеет негативных последствий с точки зрения ограничений скорости.
Ограничения скорости применяются отдельно для каждой модели; следовательно, вы можете использовать разные модели одновременно в пределах их соответствующих лимитов. Вы можете проверить текущие ограничения скорости и их поведение на странице Rate limits в Claude Console или программно считать настроенные лимиты с помощью Rate Limits API.
| Модель | Максимум запросов в минуту (RPM) | Максимум входных токенов в минуту (ITPM) | Максимум выходных токенов в минуту (OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1,000 | 500,000 | 100,000 |
| Claude Opus 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 4.x* | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 4.x** | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 4.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 3.5 (выведена из эксплуатации, кроме Bedrock и Google Cloud) | 1,000 | 100,000† | 20,000 |
* Ограничение скорости для Opus — это общий лимит, применяемый к суммарному трафику по Claude Opus 4.8, Opus 4.7, Opus 4.6 и Opus 4.5. Claude Opus 5 имеет отдельное ограничение скорости и не входит в этот объединённый пул.
** Ограничение скорости для Sonnet 4.x — это общий лимит, применяемый к суммарному трафику по Sonnet 4.6 и Sonnet 4.5. Claude Sonnet 5 имеет отдельное ограничение скорости и не входит в этот объединённый пул.
† Лимит засчитывает cache_read_input_tokens в использование ITPM.
Message Batches API имеет собственный набор ограничений скорости, общих для всех моделей. Они включают лимит запросов в минуту (RPM) для всех конечных точек API и лимит на количество пакетных запросов, которые могут находиться в очереди обработки одновременно. Под «пакетным запросом» здесь понимается часть Message Batch. Вы можете создать Message Batch, содержащий тысячи пакетных запросов, каждый из которых засчитывается в этот лимит. Пакетный запрос считается находящимся в очереди обработки, пока он ещё не был успешно обработан моделью.
| Максимум запросов в минуту (RPM) | Максимум пакетных запросов в очереди обработки | Максимум пакетных запросов на пакет |
|---|---|---|
| 1,000 | 200,000 | 100,000 |
Конечные точки Claude Managed Agents имеют ограничения скорости на уровне организации. Эти лимиты отделены от ограничений скорости Messages API, описанных выше.
| Операция | Лимит |
|---|---|
| Конечные точки создания (например, агенты, сессии и окружения) | 300 запросов в минуту |
| Конечные точки чтения (например, получение, список и потоковая передача) | 1 200 запросов в минуту |
При использовании быстрого режима (исследовательская предварительная версия) с параметром speed: "fast" для Claude Opus 5 или Opus 4.8 применяются выделенные ограничения скорости, отдельные от стандартных ограничений скорости Opus. При превышении ограничений скорости быстрого режима API возвращает ошибку 429 с заголовком retry-after. Быстрый режим недоступен для Claude Opus 4.7 (запросы возвращают ошибку) и Claude Opus 4.6 (запросы к claude-opus-4-6 с speed: "fast" выполняются со стандартной скоростью). См. Быстрый режим.
Ответ включает заголовки anthropic-fast-*, которые указывают статус ваших ограничений скорости быстрого режима. Подробнее об этих заголовках см. Ограничения скорости быстрого режима.
Вы можете отслеживать использование ограничений скорости на странице Usage в Claude Console.
Помимо графиков токенов и запросов, страница Usage предоставляет два отдельных графика ограничений скорости. Используйте эти графики, чтобы увидеть, какой запас для роста у вас есть, определить, когда вы можете достигать пикового использования, понять, какие ограничения скорости запрашивать, и узнать, как улучшить показатели кэширования. Графики визуализируют ряд метрик для заданного ограничения скорости (например, по модели):
Чтобы запросить более высокие ограничения скорости или более высокий ежемесячный лимит расходов, используйте Request rate limit increase на странице Rate limits.
Подробнее о рабочих пространствах см. Рабочие пространства.
Чтобы защитить рабочие пространства в вашей организации от возможного чрезмерного использования, вы можете установить индивидуальные лимиты расходов и ограничения скорости для каждого рабочего пространства.
Пример: если лимит вашей организации составляет 40 000 входных токенов в минуту и 8 000 выходных токенов в минуту, вы можете ограничить одно рабочее пространство до 30 000 входных токенов в минуту. Это защищает другие рабочие пространства от возможного чрезмерного использования и обеспечивает более справедливое распределение ресурсов в вашей организации. Оставшиеся неиспользованные токены в минуту (или больше, если это рабочее пространство не использует лимит полностью) становятся доступны для других рабочих пространств.
Примечание:
Чтобы программно считать текущие ограничения скорости организации и рабочих пространств, используйте Rate Limits API.
Ответ API включает заголовки, которые показывают применяемое ограничение скорости, текущее использование и время, когда лимит будет сброшен.
Возвращаются следующие заголовки:
| Заголовок | Описание |
|---|---|
retry-after | Количество секунд, которое нужно подождать, прежде чем повторить запрос. Более ранние повторные попытки завершатся неудачей. |
anthropic-ratelimit-requests-limit | Максимальное количество запросов, разрешённое в течение любого периода ограничения скорости. |
anthropic-ratelimit-requests-remaining | Количество запросов, оставшихся до срабатывания ограничения скорости. |
anthropic-ratelimit-requests-reset | Время, когда ограничение скорости запросов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-tokens-limit | Максимальное количество токенов, разрешённое в течение любого периода ограничения скорости. |
anthropic-ratelimit-tokens-remaining | Количество токенов, оставшихся (округлённое до ближайшей тысячи) до срабатывания ограничения скорости. |
anthropic-ratelimit-tokens-reset | Время, когда ограничение скорости токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-input-tokens-limit | Максимальное количество входных токенов, разрешённое в течение любого периода ограничения скорости. |
anthropic-ratelimit-input-tokens-remaining | Количество входных токенов, оставшихся (округлённое до ближайшей тысячи) до срабатывания ограничения скорости. |
anthropic-ratelimit-input-tokens-reset | Время, когда ограничение скорости входных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-ratelimit-output-tokens-limit | Максимальное количество выходных токенов, разрешённое в течение любого периода ограничения скорости. |
anthropic-ratelimit-output-tokens-remaining | Количество выходных токенов, оставшихся (округлённое до ближайшей тысячи) до срабатывания ограничения скорости. |
anthropic-ratelimit-output-tokens-reset | Время, когда ограничение скорости выходных токенов будет полностью восстановлено, в формате RFC 3339. |
anthropic-priority-input-tokens-limit | Максимальное количество входных токенов Priority Tier, разрешённое в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-remaining | Количество входных токенов Priority Tier, оставшихся (округлённое до ближайшей тысячи) до срабатывания ограничения скорости. (Только Priority Tier) |
anthropic-priority-input-tokens-reset | Время, когда ограничение скорости входных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
anthropic-priority-output-tokens-limit | Максимальное количество выходных токенов Priority Tier, разрешённое в течение любого периода ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-remaining | Количество выходных токенов Priority Tier, оставшихся (округлённое до ближайшей тысячи) до срабатывания ограничения скорости. (Только Priority Tier) |
anthropic-priority-output-tokens-reset | Время, когда ограничение скорости выходных токенов Priority Tier будет полностью восстановлено, в формате RFC 3339. (Только Priority Tier) |
Заголовки anthropic-ratelimit-tokens-* отображают значения для наиболее строгого лимита, действующего в данный момент. Например, если вы превысили поминутный лимит токенов рабочего пространства, заголовки будут содержать значения поминутного ограничения скорости токенов рабочего пространства. Если лимиты рабочего пространства не применяются, заголовки вернут общее количество оставшихся токенов, где общее — это сумма входных и выходных токенов. Такой подход гарантирует, что вы видите наиболее релевантное ограничение для вашего текущего использования API.
Was this page helpful?