Запросов в минуту · RPM
—Токенов в минуту · TPM
—RPM — входящие запросы генерации в минуту. TPM — входные + выходные токены в доступных счётчиках; кэшированные повторно не прибавляются. Подробнее ↗
Скорость ответов и ошибки на реальных запросах к API.
Весь трафик API
| OpenRouter | |||||||||
|---|---|---|---|---|---|---|---|---|---|
| Reasoning | Запросов | p50 | p75 | p90 | p95 | p99 | Вендорp50 / p95 | Azurep50 / p95 | Bedrockp50 / p95 |
CheapGPT — серверный замер за выбранный период · OpenRouter — последние 30 минут на момент снимка
Условия измерения ↗Трафик API
—
Запросов в минуту · RPM
—Токенов в минуту · TPM
—RPM — входящие запросы генерации в минуту. TPM — входные + выходные токены в доступных счётчиках; кэшированные повторно не прибавляются. Подробнее ↗
Запросов за 24 часа
Всего входящих запросов генерации,
включая некорректные.
успешных HTTP-ответов
Ошибки ввода/доступа и отмены клиента исключены из процента. 429 и 5xx учитываются как неуспех. HTTP 2xx не гарантирует завершение стрима. Формула ↗
Каждая модель отдельно
| Модель | Ответы | Успешные HTTP | TTFT p50 | TTFT p95 |
|---|
Для Gemini в этом снимке нет подходящих данных.
Данные из системы мониторинга Prometheus. Интервалы по 30 минут; обновление раз в час. Промпты, ответы и ключи в снимок не входят.
От получения запроса сервером до первого токена, который видит клиент: reasoning или текста ответа — как в OpenRouter. Уровень reasoning берётся из параметра запроса; если модель его не размечает, показана одна строка по всем запросам. Сравнение с OpenRouter — их публичная статистика задержки до первого токена за последние 30 минут на момент снимка у прямого провайдера модели (OpenAI, Anthropic или Google AI Studio), Azure и Amazon Bedrock на обычном тарифе.
p50 — медиана: половина измерений укладывается в это время. p95 — порог для 95% измерений. Перцентили приближённо восстановлены из гистограмм. Сеть от клиента до шлюза не включена. Текстовые и tool-события текущий счётчик не разделяет.
Успешность за 24 часа = HTTP 2xx / (все завершённые запросы − ошибки ввода/доступа − отмены клиента). Исключаем 400, 401, 402, 403, 404, 405, 413, 415, 422 и отдельно 499. HTTP 429 и остальные статусы остаются в знаменателе.
Общее число запросов берётся по входящим запросам, успешность — по завершённым. Запросы, ещё выполнявшиеся на границе периода, могут давать разницу. Ошибки внутри уже открытого HTTP 200 стрима этот показатель не обнаруживает.
RPM — rate входящих POST-запросов генерации × 60. TPM — сумма rate входных и выходных токенов × 60. Обе скорости рассчитаны за минуту. Кэшированные входные токены уже входят во входные и повторно не прибавляются.
Токены попадают в счётчики после обработки запроса, поэтому TPM отражает учёт токенов, а не мгновенную скорость их генерации. Показана последняя измеренная минута снимка. Числа округлены только при отображении.
10 последовательных запросов покажут время до начала ответа с учётом вашей сети.
Откройте терминал на компьютере и выполните команду:
npx cheapgpt-benchmarks ttftИнструкция по запуску ↗Исходный код CLIУкажите API-ключ, ник и модель. Запросы платные: перед запуском потребуется ваше подтверждение.
Посмотрите время до начала ответа. Публикация результата — только с вашего подтверждения.
Без публикации: добавьте к команде --no-publish
Лидерборд тестов API: замеры других участников, модели, задержки и ошибки.