CheapGPT
На главную

Метрики

Скорость ответов и ошибки на реальных запросах к API.

Снимок продовых метрикЗагружаем данные—

—

Весь трафик API

Время до начала ответа

Время до первого токена по уровням reasoning: CheapGPT и OpenRouter
OpenRouter
ReasoningЗапросовp50p75p90p95p99Вендорp50 / p95Azurep50 / p95Bedrockp50 / p95

CheapGPT — серверный замер за выбранный период · OpenRouter — последние 30 минут на момент снимка

Условия измерения ↗

Трафик API

Запросы в минуту.
Токены в минуту.

—

Запросов в минуту · RPM

—

Токенов в минуту · TPM

—

RPM — входящие запросы генерации в минуту. TPM — входные + выходные токены в доступных счётчиках; кэшированные повторно не прибавляются. Подробнее ↗

Запросов за 24 часа

Всего входящих запросов генерации,
включая некорректные.

—

успешных HTTP-ответов

Ошибки ввода и доступа
—
Отменены клиентом · 499
—
Ошибки API, включая 429
—

Ошибки ввода/доступа и отмены клиента исключены из процента. 429 и 5xx учитываются как неуспех. HTTP 2xx не гарантирует завершение стрима. Формула ↗

Каждая модель отдельно

Показатели по моделям

Метрики моделей за выбранный период. TTFT рассчитан по всем стриминговым запросам.
МодельОтветыУспешные HTTPTTFT p50TTFT p95

Как считаем метрики

Откуда цифры

Данные из системы мониторинга Prometheus. Интервалы по 30 минут; обновление раз в час. Промпты, ответы и ключи в снимок не входят.

Как рассчитан TTFT

От получения запроса сервером до первого токена, который видит клиент: reasoning или текста ответа — как в OpenRouter. Уровень reasoning берётся из параметра запроса; если модель его не размечает, показана одна строка по всем запросам. Сравнение с OpenRouter — их публичная статистика задержки до первого токена за последние 30 минут на момент снимка у прямого провайдера модели (OpenAI, Anthropic или Google AI Studio), Azure и Amazon Bedrock на обычном тарифе.

p50 — медиана: половина измерений укладывается в это время. p95 — порог для 95% измерений. Перцентили приближённо восстановлены из гистограмм. Сеть от клиента до шлюза не включена. Текстовые и tool-события текущий счётчик не разделяет.

Как считаем успешные запросы

Успешность за 24 часа = HTTP 2xx / (все завершённые запросы − ошибки ввода/доступа − отмены клиента). Исключаем 400, 401, 402, 403, 404, 405, 413, 415, 422 и отдельно 499. HTTP 429 и остальные статусы остаются в знаменателе.

Общее число запросов берётся по входящим запросам, успешность — по завершённым. Запросы, ещё выполнявшиеся на границе периода, могут давать разницу. Ошибки внутри уже открытого HTTP 200 стрима этот показатель не обнаруживает.

Что означают RPM и TPM

RPM — rate входящих POST-запросов генерации × 60. TPM — сумма rate входных и выходных токенов × 60. Обе скорости рассчитаны за минуту. Кэшированные входные токены уже входят во входные и повторно не прибавляются.

Токены попадают в счётчики после обработки запроса, поэтому TPM отражает учёт токенов, а не мгновенную скорость их генерации. Показана последняя измеренная минута снимка. Числа округлены только при отображении.

Проверить на своём компьютере

10 последовательных запросов покажут время до начала ответа с учётом вашей сети.

  1. 01

    Запустите проверку

    Откройте терминал на компьютере и выполните команду:

    npx cheapgpt-benchmarks ttftИнструкция по запуску ↗Исходный код CLI
  2. 02

    Выберите условия

    Укажите API-ключ, ник и модель. Запросы платные: перед запуском потребуется ваше подтверждение.

  3. 03

    Получите результат

    Посмотрите время до начала ответа. Публикация результата — только с вашего подтверждения.

    Без публикации: добавьте к команде --no-publish

Результаты проверок

Лидерборд тестов API: замеры других участников, модели, задержки и ошибки.

Результаты проверок ↗
На главную