CheapGPT
На главную

Результаты проверки модели.

Как мы проверяем, что модель не подменена?

Запускаем GPT-5.6 Sol на задачах ARC-AGI-2 и сравниваем результат с таблицей ARC Prize.
Ниже — цифры, задания и ответы модели. Исходные данные и методика открыты.

GPT-5.6 Sol · medium · ARC-AGI-2 public evaluation

Результат на 120 публичных задачах

Через CheapGPT62,5%75 задач решены полностью ↗
В публичной таблице ARC Prize65%78 задач отмечены ✓ · Medium ↗

Разница — 3 задачи, или 2,5 процентного пункта.

Результаты модели могут меняться от запуска к запуску. Такая разница может быть
связана с этим разбросом; его диапазон для этих прогонов отдельно не измерялся.

Сравниваем полностью решённые задачи без частичных баллов. 65% рассчитаны по отметкам
ARC Prize в разделе ARC-AGI-2 Public Eval. Наш средний балл с частичными решениями — 67,778%.

Задачи и правильные решения подготовлены авторами ARC-AGI-2. Мы публикуем ответы
модели, включая ошибки, параметры запуска и методику подсчёта.

Задания и ответы модели

В каждой задаче нужно найти правило по примерам и собрать картинку из цветных клеток.
Выберите миниатюру ниже: справа откроются задание и ответ модели.

Загружаем задачи из опубликованного прогона…

Проверьте со своего компьютера

CLI сделает 10 запросов через CheapGPT и измерит время до первого токена.
Вы выберете модель и увидите результат своего подключения.

Исходный код CLI
npx cheapgpt-benchmarks ttft --no-publish

Нужны Node.js 20.11+ и API-ключ CheapGPT. CLI запросит ключ и подтверждение платных запросов.
Эта команда сохраняет результат локально.

Хотите повторить именно ARC-AGI-2?

Python CLI запустит полный публичный бенчмарк: 120 задач, две попытки на тестовую пару. Это отдельная проверка качества с оплатой токенов.

Исходный код Python CLI
CHEAPGPT_API_KEY=... uvx --from \
  git+https://github.com/kitbuilder587/cheapgpt-benchmarks \
  cheapgpt-benchmarks run \
  --model gpt-5.6-sol --profile full --track leaderboard \
  --benchmark arc-agi-2 --effort medium \
  --concurrency 4 --max-rpm 100 --timeout 1800
Установка и методика на GitHub ↗
Как считался общий результат

75 задач решены полностью, 13 частично, 32 не решены. Средняя оценка с учётом частичных решений: 67,778%. Это результаты прогона GPT-5.6 Sol от 4 сентября 2026 года.

На главную