Вернуться к списку задач

Enantiosemy

Способность модели
Russian language proficiency
Contextual disambiguation
Linguistic-aware reasoning
Метрика
Exact match
LLM judge score
Top score
Датасет Энантиосемия является набором данных для оценки способности языковых моделей понимать значение слов, которые в одной и той же форме могут иметь противоположные значения в зависимости от контекста.

Описание задачи

Датасет Энантиосемия является набором данных для оценки способности языковых моделей понимать значение слов, которые в одной и той же форме могут иметь противоположные значения в зависимости от контекста. Бенчмарк проверяет умение модели корректно интерпретировать энантиосемические единицы в одной из четырёх постановок множественного выбора: выбрать подходящее продолжение, выбрать неподходящее продолжение, определить значение, использованное в контексте, или определить значение, не использованное в контексте. Ожидаемый ответ — одна или несколько букв вариантов.

Проверяемые навыки: Russian language proficiency, Contextual disambiguation, Linguistic-aware reasoning

Авторы: Денис Шевелев, Александр Астафуров, Александр Харитонов

Мотивация

В русском языке существует такое явление, как энантиосемия (также известная как контранимия или внутрисловная антонимия), когда одно и то же слово или фраза в одной и той же форме могут иметь противоположные значения в зависимости от контекста, в котором они встречаются. Например, глагол "прослушать" может означать как "внимательно выслушать", так и "не расслышать, пропустить мимо ушей". Для человека понимание таких слов обычно не составляет труда, однако для языковых моделей эта задача остаётся нетривиальной: требуется не только распознать энантиосемическую единицу, но и определить, какое именно из её противоположных значений использовано в данном контексте, а затем выбрать семантически согласованное продолжение.

Ограничения

Датасет предназначен для тестирования русскоязычных текстовых моделей на умение извлекать смысл из контекста при лексической неопределённости отдельных элементов и не оценивает общую грамотность текста, качество генеративной функции, параметры безопасности диалога или фактические знания за пределами данного контекста. Задача сфокусирована на контролируемом множественном выборе, поэтому результаты не следует интерпретировать как полную оценку способности модели работать со всеми случаями энантиосемии в открытой генерации.

Валидность

Примеры устроены так, чтобы нужное значение энантиосемической единицы восстанавливалось из локального контекста, а альтернативное значение исключалось окружающими репликами. Четыре типа заданий проверяют как позитивное, так и негативное распознавание контекстного значения, что снижает вероятность решения только за счёт поверхностного сопоставления продолжения.

Описание датасета

Датасет содержит 506 примеров и 157 уникальных нормализованных энантиосемических слов и выражений.

Распределение по типам заданий

Каждому примеру в поле type соответствует один из четырёх типов:

type Тип задания Кол-во Доля
1 Выбор верного продолжения заключительной реплики 290 57,3%
2 Выбор неверного (не подходящего) продолжения 188 37,2%
3 Определение значения, в котором слово употреблено 18 3,6%
4 Определение значения, в котором слово не употреблено 10 2,0%

Формат ответа — множественный выбор. Варианты обозначаются буквами А, Б, В, Г, Д, Е; правильными могут быть как один, так и несколько вариантов ответа. В случае нескольких правильных вариантов буквы в ответе записываются в алфавитном порядке и разделяются точкой с запятой с пробелом.

В каждом примере варианты ответа хранятся в шести полях option_aoption_f. В поле instruction для них используются плейсхолдеры в блоке «Варианты ответа», а в блоке «Формат ответа» перечислены допустимые заглавные буквы русского алфавита (А, Б, В, Г, Д, Е).

Поля данных

Каждый пример в датасете содержит следующие поля:

  • instruction [str] — строка с формулировкой задания для языковой модели
  • inputs — входные данные, формирующие задание:
    • text [str] — диалог или реплика, содержащая энантиосемический элемент
    • enantiosemic_word [str] — энантиосемическое слово в начальной форме
    • option_a [str] — первый вариант ответа
    • option_b [str] — второй вариант ответа
    • option_c [str] — третий вариант ответа
    • option_d [str] — четвёртый вариант ответа
    • option_e [str] — пятый вариант ответа
    • option_f [str] — шестой вариант ответа
  • outputs [str] — строка, содержащая букву или буквы верного ответа, записанные в алфавитном порядке через точку с запятой и пробел, например: А; Б; В; Г; Д; Е
  • meta — метаданные:
    • id [int] — номер примера
    • type [int] — числовой код типа задания, см. таблицу типов заданий выше

Пример данных

{
    "instruction": "Помогите, пожалуйста, решить следующую задачу.\n\nЗадача:\nОпределите вариант(ы), который(ые) не мог(ли) бы стать завершающей фразой последней реплики в тексте из-за противоречия заложенному в тексте смыслу энантиосемического слова.\n\nКонтекст:\nВ тексте есть энантиосемическое слово — лексическая единица, способная в одной форме выражать противоположные смыслы.\n\nФормат ответа:\nЗапишите ответ в формате:\n\nОтвет: <выбранная буква или буквы>\n\nУкажите одну букву или несколько букв через точку с запятой и пробел в алфавитном порядке, если неверных вариантов больше одного.\n\nБуквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е).\n\nТекст:\n{text}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}\nД. {option_e}\nЕ. {option_f}\n\nЭнантиосемическое слово:\n{enantiosemic_word}",
    "inputs": {
        "enantiosemic_word": "стишки",
        "option_a": "Простенькие, но такие душевные, такие искренние!",
        "option_b": "Простенькие, неказистые. Одним словом – ужас. Не выйдет из него поэта.",
        "option_c": "Вот чувствуется в них любовь, что ни скажи.",
        "option_d": "Вот чувствуется, что старался.",
        "option_e": "Пусть простые, зато от сердца — такие и запоминаются.",
        "option_f": "Слабенькие, конечно, но мальчишка старался.",
        "text": "— Девочки, ну как малыши вас с днём матери поздравили? Мне вот Саша цветы из бумаги подарила.\n— Ой, мне Ванюша портрет нарисовал. Красота!\n— А мой Лёшка написал замечательные стишки. Такие, знаете…"
    },
    "outputs": "Б",
    "meta": {
        "id": 507,
        "type": 2
    }
}

Создание промптов

Для задачи подготовлено 20 промптов, по 5 промптов на каждый из 4 типов заданий. Они распределены равномерно по примерам по принципу «один пример — один промпт» внутри каждого типа. Плейсхолдеры в фигурных скобках заполняются из полей внутри inputs для каждого вопроса. В каждом шаблоне промпта обращение к модели согласовано по стилю (на «ты» или на «вы»).

Создание датасета

Датасет создан в два этапа приглашёнными в качестве экспертов-разметчиков лингвистами совместно с командой AGI NLP. Сначала команда разработала методологию задания и сформировала список русских энантиосемических единиц. В список вошли как отдельные слова, так и устойчивые фразовые единицы, которые в одной и той же форме могут выражать противоположные значения в зависимости от контекста. Четыре типа заданий были выбраны как сочетание двух дополняющих друг друга операций — выбора продолжения и определения контекстного значения — в позитивной и негативной формулировках.

Затем приглашённые лингвисты составили по этому списку контексты диалогов или реплик и варианты ответов. Команда AGI NLP координировала методологию и процесс подготовки данных, проверила структуру результата и подготовила датасет к включению в MERA.

Контроль качества также проводился разметчиками с лингвистической подготовкой. Каждое задание прошло проверку на отсутствие двусмысленности: контекст должен был поддерживать целевое значение и исключать противоположную интерпретацию энантиосемического элемента. Примеры с неясным контекстом, пересекающимися интерпретациями или вариантами ответа, которые можно обосновать при разных значениях, редактировались или исключались.

Метрики

Для агрегированной оценки ответов моделей используются следующие метрики:

  • Exact match (EM): Метрика вычисляет долю ответов модели, которые точно совпадают с правильным ответом. Эталонный ответ — одна или несколько букв из множества А, Б, В, Г, Д, Е; если верных букв несколько, они записываются в алфавитном порядке через точку с запятой и пробел. Значение — от 0 до 1.
  • LLM judge score: LLM-судья сравнивает ответ модели с эталонным ответом и оценивает его правильность и полноту: