Назад
01 Sep 2026

Альянс в сфере искусственного интеллекта представил MERA Text 2.0 — новую версию текстового бенчмарка для оценки фундаментальных языковых моделей.

Первая версия MERA появилась в 2023 году, когда существующие бенчмарки хорошо разделяли модели по базовым способностям: знаниям о мире, логике, пониманию текста и предметным знаниям. За последние три года возможности языковых моделей заметно выросли. В ряде прежних тестов современные SOTA-модели уже достигают или превышают Human Baseline, а разница между сильнейшими моделями становится всё менее заметной.

Поэтому в MERA Text 2.0 команда не стала просто расширять прежний набор задач, а пересобрала текстовую оценку вокруг способностей, которые всё ещё позволяют содержательно исследовать границы современных моделей.

Новая версия включает в себя 12 тестов, разделённых на четыре группы по три задачи в каждой.

Тесты группы Human-Centric оценивают способности, связанные с пониманием человека и коммуникацией: метафоры, юмор, характер собеседника и контекст. В группу вошли Riddles, Humor и Characters.

Группа Culture-Specific посвящена русскому языку и культурному контексту. Тест RussianRegions проверяет понимание региональной лексики, SAGE — способность корректировать реальные русскоязычные тексты без потери их смысла и стиля, а RUBIN — знание российского культурного кода: мемов, сленга, кино, песен, фольклора и устойчивых выражений.

Группа Agentic сосредоточена на базовых способностях модели, необходимых для построения агентных систем. Тест IFHardBench проверяет сложное следование нескольким инструкциям одновременно, SOBHard — работу со структурированными ответами и преобразование документов, GorillaHard — выбор инструментов и правильное формирование их вызовов.

Группа Reasoning объединяет задачи, требующие работы с неоднозначностью и структурой условия. Тест Enantiosemy проверяет понимание слов и выражений с противоположными значениями, NewReasoning — разные типы логического рассуждения и устойчивость к привычным шаблонам решения, а LIMUR — разрешение референции, синтаксической и лингвистической неоднозначности.

Все тестовые наборы MERA Text 2.0 являются приватными: модели не получают доступ к заданиям заранее. Такой подход снижает риск контаминации и дольше сохраняет разделяющую способность бенчмарка.

Результаты рассчитываются отдельно для каждой из четырёх групп навыков. Внутри групп используется геометрическое среднее результатов задач: такой способ агрегации сильнее учитывает провалы модели по отдельным способностям и не позволяет высокому результату в одном тесте полностью компенсировать низкий результат в другом.

Для всех моделей используется единый фиксированный протокол. MERA не подбирает индивидуальные промпты или постобработку под конкретную модель, а параметры запуска и журналы сохраняются для воспроизводимости результатов.

При этом Text 2.0 оценивает прежде всего возможности самой модели: дополнительные агентные, reasoning- или tool-конвейеры, способные решить часть задачи вместо модели, в оценку не добавляются. Для полноценных агентных и средовых сценариев в экосистеме MERA предусмотрены отдельные направления.

С запуском обновления MERA Text версия 2.0 становится основной версией публичного текстового бенчмарка MERA. Предыдущая версия заморажена: результаты прошлых прогонов сохраняются в личных кабинетах пользователей, однако публичный рейтинг по ней больше не будет развиваться.

В начале команда уже оценила ряд актуальных открытых и закрытых моделей. Результаты доступны в бенчмарке с отдельными разрезами по четырём группам способностей.

MERA Text 2.0 продолжит расширяться: архитектура бенчмарка позволяет добавлять новые тесты внутрь существующих групп и создавать новые направления оценки по мере развития возможностей языковых моделей.