Назад
24 Jul 2026

Альянс в сфере ИИ запустил открытый лидерборд для оценки способности моделей к рассуждению на русском языке

Альянс в сфере искусственного интеллекта представил публичный лидерборд MERA Reason для оценки способности современных языковых моделей к рассуждению на русском языке. Новый лидерборд объединяет четыре набора математических и логических задач разного типа и позволяет сравнивать модели в едином воспроизводимом окружении.

За последний год фокус в развитии больших языковых моделей заметно изменился. Если раньше модели соревновались преимущественно в объёме знаний, способности отвечать на вопросы и писать код, то сегодня одним из главных направлений стала способность выстраивать длинные цепочки рассуждений, находить нестандартные решения и работать со сложными условиями.

Вместе с этим возникает новая задача — объективно измерять такие способности.

Почему для оценки используются математические задачи

Способность к рассуждению не ограничивается математикой. Однако математические задачи позволяют объективно проверить, может ли модель последовательно прийти к правильному ответу, а не просто воспроизвести информацию из обучающих данных.

Качественный тест на рассуждение должен:

  • требовать нескольких последовательных шагов;
  • иметь однозначно проверяемый ответ;
  • позволять воспроизводимо сравнивать модели;
  • включать задачи разного уровня и типа сложности.

Для английского языка уже существует множество специализированных математических наборов данных и лидербордов. Для русского языка открытых площадок, позволяющих сравнивать современные модели в одинаковых условиях, пока значительно меньше.

Новый лидерборд MERA призван закрыть этот пробел.

Четыре набора задач для разных типов рассуждения

Оценить способность модели к рассуждению с помощью одного набора данных невозможно. В одних задачах необходимо найти нестандартную математическую идею, в других — провести длинные вычисления, удержать десятки промежуточных состояний или правильно обработать большой объём взаимосвязанной информации.

Поэтому в лидерборд вошли сразу четыре набора задач: Luzitania, TMath, MMReD и ruAIME.

Luzitania

Luzitania — набор из 251 математической задачи повышенной сложности, сформированный на основе регламента соревнования AIMO3. В него вошли задачи уровня ведущих национальных и международных олимпиад, материалы Турнира городов, а также задачи по продвинутой абстрактной математике из наборов MathArena и MathArxiv.

При формировании набора предпочтение отдавалось задачам, первоначально опубликованным не на английском языке и с меньшей вероятностью представленным в обучающих данных современных моделей. Все задания были переведены на русский язык и частично переформулированы.

В набор вошли только задачи, которые современные открытые модели решают нестабильно и для которых требуется длинная цепочка рассуждений. Luzitania проверяет умение выбирать стратегию решения, удерживать большое количество промежуточных шагов и использовать внешние инструменты только там, где они действительно необходимы.

Создатель набора — Lomonosov Research Institute.

TMath

TMath объединяет 310 задач из Всероссийской олимпиады школьников и Московской математической олимпиады за период с 1998 по 2025 год.

Набор охватывает алгебру, геометрию, комбинаторику, теорию чисел и другие области математики. Особое внимание уделяется задачам, в которых прямой перебор или применение готовой формулы не позволяют получить ответ: модели необходимо самостоятельно найти идею решения и последовательно довести её до результата.

Из набора исключены задания, требующие изображений, допускающие несколько корректных решений или предполагающие свободную форму ответа. Дополнительная фильтрация позволила убрать слишком простые задачи и сохранить разрешающую способность бенчмарка для сильных моделей.

Создатель набора — Т-Банк.

MMReD

MMReD — синтетический набор задач на рассуждение в условиях плотного контекста. В отличие от классических тестов на поиск отдельного факта в длинном тексте, в MMReD значима вся последовательность входных данных.

Модель получает описание синтетической среды из десятков последовательных состояний. Например, персонажи перемещаются между комнатами, а на каждом шаге фиксируется их текущее положение. Чтобы ответить на вопрос, модель должна обработать всю траекторию и корректно объединить информацию по всем шагам.

Задания содержат последовательности из 32, 64 или 128 состояний. Пропуск или неправильная обработка даже одного промежуточного шага может привести к неверному итоговому ответу.

MMReD проверяет:

  • способность агрегировать информацию по всему контексту;
  • устойчивость при работе с длинными последовательностями;
  • базовые вычисления без использования внешних инструментов;
  • логическую согласованность многошагового рассуждения.

Данные набора полностью синтетические и создаются процедурно. Это обеспечивает точную эталонную разметку, исключает попадание заданий в обучающие корпуса и позволяет управлять уровнем сложности.

Набор разработан командой AIRI и представлен в научной работе MMReD на конференции ICLR 2026.

ruAIME

ruAIME — русскоязычный набор олимпиадных математических задач, основанный на формате American Invitational Mathematics Examination. Он включает 724 задачи соревнования AIME за период с 1983 по 2025 год.

Условия задач обычно достаточно короткие, но для получения ответа модели необходимо увидеть скрытую структуру, найти подходящее преобразование или нестандартную стратегию решения.

Набор охватывает алгебру, геометрию, комбинаторику, теорию чисел, вероятность, статистику и другие области. Результат оценивается по точному совпадению финального ответа: частичный зачёт за ход рассуждения не предусмотрен.

Большой размер набора позволяет устойчивее сравнивать сильные модели: отдельная удачная или неудачная задача оказывает меньшее влияние на итоговый результат.

Создатели набора — Владислав Савенков, Антон Габов и компания Doubletapp.

Что доступно пользователям лидерборда

На лидерборде публикуется не только общий рейтинг. Пользователи могут сравнивать результаты моделей по каждому набору данных отдельно, анализировать их сильные и слабые стороны и отслеживать результаты новых релизов.

Открытая инфраструктура MERA позволяет:

  • воспроизводить опубликованные результаты;
  • тестировать собственные модели;
  • сравнивать их с моделями, уже представленными на лидерборде;
  • использовать готовую систему оценки без самостоятельной разработки всей инфраструктуры.

Цель проекта — сделать сравнение моделей, способных к сложным рассуждениям на русском языке, прозрачным, воспроизводимым и доступным для исследователей, разработчиков и компаний.

Открытая площадка для новых наборов задач

Проект реализован при участии партнёров и членов Альянса в сфере искусственного интеллекта. Команды организаций — участников проекта внесли вклад в создание и развитие наборов данных, а MERA объединила их в общей открытой инфраструктуре оценки.

Запуск лидерборда стал первой частью большого обновления MERA TEXT. В дальнейшем площадка будет расширяться вместе с исследовательским сообществом.

Авторы математических и логических наборов данных для русского языка смогут интегрировать собственные задачи в публичный лидерборд и сравнивать модели в единой системе оценки. Это позволит сформировать открытую экосистему русскоязычных бенчмарков, в которой новые наборы данных становятся частью общей воспроизводимой инфраструктуры, а не существуют изолированно.

В следующем обновлении MERA планируется расширить публичную и закрытую части платформы, добавить новые направления оценки, наборы данных и инструменты для анализа современных моделей.

Репозиторий проекта: https://github.com/MERA-Evaluation/MERA/tree/v2_dev

Инструкция по проведению оценки и отправке результатов: https://github.com/MERA-Evaluation/MERA/tree/v2_dev#mera-open-reasoning-leaderboard

Публичный лидерборд: https://huggingface.co/spaces/MERA-evaluation/MERA_Reason