Назад
04 Jun 2025

Альянс в сфере ИИ запустил MERA Industrial: новый стандарт оценки отраслевых LLM для решения бизнес-задач

Альянс в сфере ИИ объявил о запуске нового раздела MERA «MERA Industrial» — уникального бенчмарка для оценки больших языковых моделей (LLM) в различных отраслях. На платформе уже доступны бенчмарки по медицине и сельскому хозяйству, которые помогут компаниям и экспертам выбрать и внедрить LLM, максимально соответствующие их бизнес-задачам.

В настоящий момент на сайте размещены три задачи, две из которых по сельскому хозяйству и одна по медицине:

ruTXTAgroBench: датасет, предназначенный для измерения профессиональных знаний модели, приобретенных в процессе предобучения в области агрономии. Состоит из 2935 оригинальных вопросов по агрономии, охватывающих ботанику, кормопроизводство и луговодство, мелиоративное земледелие, общую генетику, общее земледелие, основы селекции, растениеводство, семеноводство и семеноведение, системы земледелия на различных агроландшафтах, технологии возделывания сельскохозяйственных культур.

ruTXTAgroBench: датасет, предназначенный для измерения профессиональных знаний модели, приобретенных в процессе предобучения в области агрономии. Состоит из 2935 оригинальных вопросов по агрономии, охватывающих ботанику, кормопроизводство и луговодство, мелиоративное земледелие, общую генетику, общее земледелие, основы селекции, растениеводство, семеноводство и семеноведение, системы земледелия на различных агроландшафтах, технологии возделывания сельскохозяйственных культур.

ruTXTMedQFundamental: датасет, в котором охвачены 17 фундаментальных медицинских дисциплин от клеточной биологии до клинических практик (хирургия, терапия, лабораторная диагностика, фармакология). Тест включает 270 вопросов и 30 тренировочных задач по каждой дисциплине, что позволяет сопоставлять уровень знаний моделей с уровнем выпускника медицинского вуза. 

Датасеты являются полностью оригинальными и составлены на русском языке.

Бенчмарк MERA Industrial создан при поддержке академического сообщества, в частности в проекте приняли участие Сколковский институт науки и технологий, Кубанский государственный аграрный университет, Национальный медицинский исследовательский центр имени В.А. Алмазова, РАНХиГС, Нижегородский государственный архитектурно-строительный университет и другие. Ведущими экспертами тщательно формулируются задания, чтобы обеспечить:

•Достоверность информации на основе подтверждённых источников

•Полное покрытие отраслевой таксономии

•Разнообразие сложности и типов задач (от академических до практических кейсов)

•Оригинальность формулировок и отсутствие интернет-заимствований.

MERA Industrial — это не только инструмент для оценки больших языковых моделей, но и площадка для формулирования новых задач и кейсов, валидации заданий, использования готовых бенчмарков для выбора и внедрения LLM в бизнес-процессы.

 

Бенчмарк MERA, созданный при участии команд Сбербанка, MTS AI, Skoltech AI и НИУ ВШЭ, был представлен на международной конференции AI Journey в 2023 году. Впоследствии методологию теста также презентовали на ACL, ведущей научной конференции по компьютерной лингвистике, которая проводится с 1963 года и пользуется поддержкой крупнейших IT-компаний со всего мира, в числе которых Apple, Google Deep Mind, Baidu, IBM и другие. В прошлом году бенчмарк для русскоязычных LLM стал еще лучше: в него добавились новые датасеты, поддержка API и особенностей SFT-моделей, а также обновленный лидерборд с удобной системой фильтрации результатов.