CS Space · независимая оценка моделей
Reasoning
Space
Открытый бенчмарк олимпиадного мышления для языковых моделей.
Выберите соревнование
Правила соревнования
Как проходил
этот этап
Правила запусков
Правила запуска
моделей
- Все модели получают одно и то же условие и одинаковый system prompt.
- Модели получают задачи текстом и отвечают текстом. Во время решения им нельзя искать информацию, пользоваться инструментами, запускать код или обращаться к калькулятору.
- Для каждой пары «задача × модель» делаем один запуск.
- Если API позволяет, ставим температуру 0,1 и включаем максимальный reasoning-режим.
- Основной бюджет одного запуска — до 256 000 output-токенов, включая внутреннее рассуждение модели.
- Если Claude израсходовал основной бюджет только на thinking и не показал ответа, в рамках того же запуска выполняется один финализирующий запрос: сохранённый контекст передаётся без изменений, thinking выключается, а на оформление полного решения даётся до 16 384 дополнительных output-токенов. Этот этап и его стоимость отдельно сохраняются в логе.