CS Space · независимая оценка моделей

Reasoning
Space

Открытый бенчмарк олимпиадного мышления для языковых моделей.

Выберите соревнование

Правила соревнования

Как проходил
этот этап

    Правила запусков

    Правила запуска
    моделей

    • Все модели получают одно и то же условие и одинаковый system prompt.
    • Модели получают задачи текстом и отвечают текстом. Во время решения им нельзя искать информацию, пользоваться инструментами, запускать код или обращаться к калькулятору.
    • Для каждой пары «задача × модель» делаем один запуск.
    • Если API позволяет, ставим температуру 0,1 и включаем максимальный reasoning-режим.
    • Основной бюджет одного запуска — до 256 000 output-токенов, включая внутреннее рассуждение модели.
    • Если Claude израсходовал основной бюджет только на thinking и не показал ответа, в рамках того же запуска выполняется один финализирующий запрос: сохранённый контекст передаётся без изменений, thinking выключается, а на оформление полного решения даётся до 16 384 дополнительных output-токенов. Этот этап и его стоимость отдельно сохраняются в логе.