Датасет Энантиосемия является набором данных для оценки способности языковых моделей понимать значение слов, которые в одной и той же форме могут иметь противоположные значения в зависимости от контекста. Бенчмарк проверяет умение модели корректно интерпретировать энантиосемические единицы в одной из четырёх постановок множественного выбора: выбрать подходящее продолжение, выбрать неподходящее продолжение, определить значение, использованное в контексте, или определить значение, не использованное в контексте. Ожидаемый ответ — одна или несколько букв вариантов.
Проверяемые навыки: Russian language proficiency, Contextual disambiguation, Linguistic-aware reasoning
Авторы: Денис Шевелев, Александр Астафуров, Александр Харитонов
В русском языке существует такое явление, как энантиосемия (также известная как контранимия или внутрисловная антонимия), когда одно и то же слово или фраза в одной и той же форме могут иметь противоположные значения в зависимости от контекста, в котором они встречаются. Например, глагол "прослушать" может означать как "внимательно выслушать", так и "не расслышать, пропустить мимо ушей". Для человека понимание таких слов обычно не составляет труда, однако для языковых моделей эта задача остаётся нетривиальной: требуется не только распознать энантиосемическую единицу, но и определить, какое именно из её противоположных значений использовано в данном контексте, а затем выбрать семантически согласованное продолжение.
Датасет предназначен для тестирования русскоязычных текстовых моделей на умение извлекать смысл из контекста при лексической неопределённости отдельных элементов и не оценивает общую грамотность текста, качество генеративной функции, параметры безопасности диалога или фактические знания за пределами данного контекста. Задача сфокусирована на контролируемом множественном выборе, поэтому результаты не следует интерпретировать как полную оценку способности модели работать со всеми случаями энантиосемии в открытой генерации.
Примеры устроены так, чтобы нужное значение энантиосемической единицы восстанавливалось из локального контекста, а альтернативное значение исключалось окружающими репликами. Четыре типа заданий проверяют как позитивное, так и негативное распознавание контекстного значения, что снижает вероятность решения только за счёт поверхностного сопоставления продолжения.
Датасет содержит 506 примеров и 157 уникальных нормализованных энантиосемических слов и выражений.
Каждому примеру в поле соответствует один из четырёх типов:
type
| type | Тип задания | Кол-во | Доля |
|---|---|---|---|
| 1 | Выбор верного продолжения заключительной реплики | 290 | 57,3% |
| 2 | Выбор неверного (не подходящего) продолжения | 188 | 37,2% |
| 3 | Определение значения, в котором слово употреблено | 18 | 3,6% |
| 4 | Определение значения, в котором слово не употреблено | 10 | 2,0% |
Формат ответа — множественный выбор. Варианты обозначаются буквами А, Б, В, Г, Д, Е; правильными могут быть как один, так и несколько вариантов ответа. В случае нескольких правильных вариантов буквы в ответе записываются в алфавитном порядке и разделяются точкой с запятой с пробелом.
В каждом примере варианты ответа хранятся в шести полях –option_a. В поле option_f для них используются плейсхолдеры в блоке «Варианты ответа», а в блоке «Формат ответа» перечислены допустимые заглавные буквы русского алфавита (А, Б, В, Г, Д, Е).
instruction
Каждый пример в датасете содержит следующие поля:
instruction [str] — строка с формулировкой задания для языковой моделиinputs — входные данные, формирующие задание:text [str] — диалог или реплика, содержащая энантиосемический элементenantiosemic_word [str] — энантиосемическое слово в начальной формеoption_a [str] — первый вариант ответаoption_b [str] — второй вариант ответаoption_c [str] — третий вариант ответаoption_d [str] — четвёртый вариант ответаoption_e [str] — пятый вариант ответаoption_f [str] — шестой вариант ответаoutputs [str] — строка, содержащая букву или буквы верного ответа, записанные в алфавитном порядке через точку с запятой и пробел, например: А; Б; В; Г; Д; Еmeta — метаданные:id [int] — номер примераtype [int] — числовой код типа задания, см. таблицу типов заданий выше{
"instruction": "Помогите, пожалуйста, решить следующую задачу.\n\nЗадача:\nОпределите вариант(ы), который(ые) не мог(ли) бы стать завершающей фразой последней реплики в тексте из-за противоречия заложенному в тексте смыслу энантиосемического слова.\n\nКонтекст:\nВ тексте есть энантиосемическое слово — лексическая единица, способная в одной форме выражать противоположные смыслы.\n\nФормат ответа:\nЗапишите ответ в формате:\n\nОтвет: <выбранная буква или буквы>\n\nУкажите одну букву или несколько букв через точку с запятой и пробел в алфавитном порядке, если неверных вариантов больше одного.\n\nБуквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е).\n\nТекст:\n{text}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}\nД. {option_e}\nЕ. {option_f}\n\nЭнантиосемическое слово:\n{enantiosemic_word}",
"inputs": {
"enantiosemic_word": "стишки",
"option_a": "Простенькие, но такие душевные, такие искренние!",
"option_b": "Простенькие, неказистые. Одним словом – ужас. Не выйдет из него поэта.",
"option_c": "Вот чувствуется в них любовь, что ни скажи.",
"option_d": "Вот чувствуется, что старался.",
"option_e": "Пусть простые, зато от сердца — такие и запоминаются.",
"option_f": "Слабенькие, конечно, но мальчишка старался.",
"text": "— Девочки, ну как малыши вас с днём матери поздравили? Мне вот Саша цветы из бумаги подарила.\n— Ой, мне Ванюша портрет нарисовал. Красота!\n— А мой Лёшка написал замечательные стишки. Такие, знаете…"
},
"outputs": "Б",
"meta": {
"id": 507,
"type": 2
}
}
Для задачи подготовлено 20 промптов, по 5 промптов на каждый из 4 типов заданий. Они распределены равномерно по примерам по принципу «один пример — один промпт» внутри каждого типа. Плейсхолдеры в фигурных скобках заполняются из полей внутри для каждого вопроса. В каждом шаблоне промпта обращение к модели согласовано по стилю (на «ты» или на «вы»).
inputs
Датасет создан в два этапа приглашёнными в качестве экспертов-разметчиков лингвистами совместно с командой AGI NLP. Сначала команда разработала методологию задания и сформировала список русских энантиосемических единиц. В список вошли как отдельные слова, так и устойчивые фразовые единицы, которые в одной и той же форме могут выражать противоположные значения в зависимости от контекста. Четыре типа заданий были выбраны как сочетание двух дополняющих друг друга операций — выбора продолжения и определения контекстного значения — в позитивной и негативной формулировках.
Затем приглашённые лингвисты составили по этому списку контексты диалогов или реплик и варианты ответов. Команда AGI NLP координировала методологию и процесс подготовки данных, проверила структуру результата и подготовила датасет к включению в MERA.
Контроль качества также проводился разметчиками с лингвистической подготовкой. Каждое задание прошло проверку на отсутствие двусмысленности: контекст должен был поддерживать целевое значение и исключать противоположную интерпретацию энантиосемического элемента. Примеры с неясным контекстом, пересекающимися интерпретациями или вариантами ответа, которые можно обосновать при разных значениях, редактировались или исключались.
Для агрегированной оценки ответов моделей используются следующие метрики: