Вернуться к списку задач

RussianRegions

Способность модели
Russian language proficiency
Regional culture awareness
Метрика
Exact match
LLM judge score
Group Exact match
Group Judge Score
Top score
RussianRegions является набором данных для оценки возможностей языковых моделей решать задачи на русском языке, характерные для определенных регионов России

Описание задачи

RussianRegions является набором данных для оценки возможностей языковых моделей решать задачи на русском языке, характерные для определенных регионов России. Бенчмарк проверяет знание российских регионализмов, а также умение использовать их в контексте.

Проверяемые навыки: Russian language proficiency, Regional culture awareness

Авторы: Александр Харитонов

Мотивация

Языковые модели при обучении часто используют тексты, написанные кодифицированным (общепринятым) языком. Однако существуют менее частотные языковые явления, такие как сленг, диалектизмы, неологизмы, архаизмы или регионализмы, которые также являются частью языка и должны учитываться при оценке владения языком у модели. Этот датасет посвящен оценке уровня владения российскими регионализмами ввиду обширной географии Российской Федерации.

Для кого результаты

Результаты оценки полезны исследователям и разработчикам языковых моделей, ориентированных на русский язык, особенно если важно проверить работу модели с регионализмами, редкими диалектными выражениями и некодифицированной лексикой. Датасет также может быть полезен специалистам по русской диалектологии, региональной лингвистике и оценке качества моделей в задачах, где требуется учитывать региональную вариативность русского языка.

Ограничения

Датасет не подходит для оценки языковых моделей общего назначения, а также языковых моделей, не ориентированных на русскоязычную культуру, так как для решения задачи требуется глубокое знание редкоиспользуемых региональных диалектов России.

Описание датасета

Поля данных

Каждый вопрос в датасете содержит следующие поля:

  • instruction [str] — шаблон запроса к языковой модели. Шаблон собирается из блочных полей внутри inputs.
  • inputs — вводные данные, формирующие задание для модели:
    • introduction [str] — короткое вступление к запросу;
    • task_formulation [str] — формулировка задачи;
    • lang_unit [str] — языковая единица для замены; используется в типах 2 и 3;
    • example_text [str] — эталонный текст, задающий нужное значение языковой единицы; используется в типе 2;
    • region [str] — регион, для которого характерна языковая единица; используется в типе 3;
    • option_a [str] — первый вариант ответа;
    • option_b [str] — второй вариант ответа;
    • option_c [str] — третий вариант ответа;
    • option_d [str] — четвертый вариант ответа;
    • format_description [str] — описание формата ответа; для типа 1 указывает, что модель должна вывести одну заглавную букву русского алфавита из множества (А, Б, В, Г), соответствующую выбранному тексту; для типов 2 и 3 также требует указать языковую единицу из выбранного текста после точки с запятой.
  • outputs [str] — строка, содержащая правильный ответ.
  • meta — метаданные, относящиеся к тестовому примеру, но не используемые в вопросе (скрытые от тестируемой модели):
    • id [int] — номер примера;
    • group_id [int] — номер группы примеров. Одинаковое значение имеют примеры, у которых совпадает регионализм, необходимый для правильного ответа на задание;
    • task_type [int] — номер типа задания: 1 — общее понимание текста с региональными выражениями; 2 — синонимия регионализмов и кодифицированного языка; 3 — регионы происхождения региональных слов.

Пример данных

{
    "instruction": "{introduction}\n\nЗадача:\n{task_formulation}\n\nФормат ответа:\n{format_description}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}",
    "inputs": {
        "introduction": "Пожалуйста, прочитайте тексты внимательно.",
        "task_formulation": "Выберите текст, в котором нет смысловых ошибок.",
        "option_a": "Не везет мне с мужчинами почему-то. Все подруги давно замужем, многие не по одному разу. Даже такая толчёнка, как ты, нашла себе любящего мужа.",
        "option_b": "Скубались они всегда громко, наслаждаясь процессом и полностью ему отдаваясь. Сначала меня это удивляло, но скоро я уже не обращал внимания.",
        "option_c": "Виктор сильно окреп, в свои 12 лет он был ростом со старшего брата, весил так же. Он буквально вырос на жидриках да на свежем воздухе.",
        "option_d": "Для тебя одна радость — мжить в свой дебилизатор и только, пока дым из ушей не пойдёт. Лучше бы с ребятами мяч погонял.",
        "format_description": "В ответе напишите только одну строку, начинающуюся с «Ответ:». После двоеточия укажите заглавную букву из множества (А, Б, В, Г), обозначающую выбранный вариант ответа."
    },
    "outputs": "Б",
    "meta": {
        "id": 1,
        "group_id": 0,
        "task_type": 1
    }
}

Промпты

Для задачи подготовлены 15 промптов: по 5 вариантов для каждого из 3 типов задания. Каждый промпт содержит поля task_typeinstructionintroductiontask_formulation и format_description. Эти блоки используются в поле instruction; значения в фигурных скобках подставляются из inputs.

Пример промпта:

{
    "task_type": 1,
    "instruction": "{introduction}\n\nЗадача:\n{task_formulation}\n\nФормат ответа:\n{format_description}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}",
    "introduction": "Интересно, сможете ли вы найти корректный текст?",
    "task_formulation": "Определите, какой текст не содержит смысловых искажений.",
    "format_description": "В ответе напишите только одну строку, начинающуюся с «Ответ:». После двоеточия укажите только одну заглавную букву русского алфавита — А, Б, В или Г — которая соответствует выбранному тексту."
}

Создание датасета

В качестве источников выражений-регионализмов были использованы открытые материалы: 12, а также выражения, собранные экспертами-лингвистами. Задания для датасета также составлены экспертами-лингвистами. Задания в датасете разделены на 3 типа: Тип 1. Общее понимание текста, содержащего региональные выражения; Тип 2. Понимание синонимии регионализмов и кодифицированного языка; Тип 3. Понимание регионов происхождения региональных слов. Каждый тип задания содержит 201 пример, итого в датасете 603 примера.

Оценка

Метрики

Для агрегированной оценки ответов моделей используются следующие метрики:

  • Exact match (EM): доля ответов модели, которые точно совпадают с эталонной буквой после извлечения строки после маркера Ответ:. Значение находится в диапазоне от 0 до 1: 0 означает отсутствие точных совпадений, 1 — совпадение во всех примерах.
  • Group Exact match: Метрика Group Exact match вычисляет среднее по группам примеров с одинаковым group_id. Значение group_id объединяет задания, посвящённые знанию одного и того же регионализма. Для такой группы метрика принимает значение 1, если модель дала правильный ответ на все задания, связанные с этим регионализмом, и 0 в остальных случаях.
  • LLM judge score: LLM-судья сравнивает ответ модели с эталонным ответом и оценивает его правильность и полноту. Полностью правильный и полный ответ получает 1; частично правильный или неполный ответ, содержащий существенную часть правильного ответа, получает 0.5; неправильный, противоречивый или не содержащий правильного ответа получает 0. Итоговое значение метрики равно среднему баллу по всем примерам.
  • Group Judge Score: Метрика Group Judge Score агрегирует LLM judge score по группам примеров с одинаковым group_id. Группа получает 1 только если judge считает правильными ответы на все задания, связанные с одним и тем же регионализмом, и 0 в остальных случаях.