Альянс в сфере искусственного интеллекта представил MERA Text 2.0 — новую версию текстового бенчмарка для оценки фундаментальных языковых моделей.
Первая версия MERA появилась в 2023 году, когда существующие бенчмарки хорошо разделяли модели по базовым способностям: знаниям о мире, логике, пониманию текста и предметным знаниям. За последние три года возможности языковых моделей заметно выросли. В ряде прежних тестов современные SOTA-модели уже достигают или превышают Human Baseline, а разница между сильнейшими моделями становится всё менее заметной.
Поэтому в MERA Text 2.0 команда не стала просто расширять прежний набор задач, а пересобрала текстовую оценку вокруг способностей, которые всё ещё позволяют содержательно исследовать границы современных моделей.
Новая версия включает в себя 12 тестов, разделённых на четыре группы по три задачи в каждой.
Тесты группы Human-Centric оценивают способности, связанные с пониманием человека и коммуникацией: метафоры, юмор, характер собеседника и контекст. В группу вошли Riddles, Humor и Characters.
Группа Culture-Specific посвящена русскому языку и культурному контексту. Тест RussianRegions проверяет понимание региональной лексики, SAGE — способность корректировать реальные русскоязычные тексты без потери их смысла и стиля, а RUBIN — знание российского культурного кода: мемов, сленга, кино, песен, фольклора и устойчивых выражений.
Группа Agentic сосредоточена на базовых способностях модели, необходимых для построения агентных систем. Тест IFHardBench проверяет сложное следование нескольким инструкциям одновременно, SOBHard — работу со структурированными ответами и преобразование документов, GorillaHard — выбор инструментов и правильное формирование их вызовов.
Группа Reasoning объединяет задачи, требующие работы с неоднозначностью и структурой условия. Тест Enantiosemy проверяет понимание слов и выражений с противоположными значениями, NewReasoning — разные типы логического рассуждения и устойчивость к привычным шаблонам решения, а LIMUR — разрешение референции, синтаксической и лингвистической неоднозначности.
Все тестовые наборы MERA Text 2.0 являются приватными: модели не получают доступ к заданиям заранее. Такой подход снижает риск контаминации и дольше сохраняет разделяющую способность бенчмарка.
Результаты рассчитываются отдельно для каждой из четырёх групп навыков. Внутри групп используется геометрическое среднее результатов задач: такой способ агрегации сильнее учитывает провалы модели по отдельным способностям и не позволяет высокому результату в одном тесте полностью компенсировать низкий результат в другом.
Для всех моделей используется единый фиксированный протокол. MERA не подбирает индивидуальные промпты или постобработку под конкретную модель, а параметры запуска и журналы сохраняются для воспроизводимости результатов.
При этом Text 2.0 оценивает прежде всего возможности самой модели: дополнительные агентные, reasoning- или tool-конвейеры, способные решить часть задачи вместо модели, в оценку не добавляются. Для полноценных агентных и средовых сценариев в экосистеме MERA предусмотрены отдельные направления.
С запуском обновления MERA Text версия 2.0 становится основной версией публичного текстового бенчмарка MERA. Предыдущая версия заморажена: результаты прошлых прогонов сохраняются в личных кабинетах пользователей, однако публичный рейтинг по ней больше не будет развиваться.
В начале команда уже оценила ряд актуальных открытых и закрытых моделей. Результаты доступны в бенчмарке с отдельными разрезами по четырём группам способностей.
MERA Text 2.0 продолжит расширяться: архитектура бенчмарка позволяет добавлять новые тесты внутрь существующих групп и создавать новые направления оценки по мере развития возможностей языковых моделей.