Датасет Юмор предлагает моделям классификацию юмористических текстов (анекдоты и короткие истории) и два связанных подзадания: определить тип основного текста по способу создания комического эффекта и выбрать среди четырёх дополнительных текстов тот, который относится к тому же классу.
В датасете 600 примеров, сбалансированных по 12 классам (11 типов юмористического эффекта и класс «не анекдот»). К каждому основному тексту даны четыре дополнительных варианта (А, Б, В, Г).
Проверяемые навыки: Text Analysis, Semantic Textual Similarity, Humor Detection, Humor Classification, Humor Recognition, Irony Recognition
Авторы: Денис Шевелев, Александра Елисеева, Александр Харитонов, Александр Астафуров
Набор данных оценивает способность модели не только определять структурный тип юмора в тексте, но и находить текст с тем же типом среди альтернатив. Класс «не анекдот» служит контролем: модель должна детерминированно отличать юмористические тексты от неюмористических.
Датасет состоит из двух файлов:
test.json — 600 тестовых примеров с id 1–600shots.json — 5 few-shot примеров с id 601–605
имеет вид test.json, {"access": "private", "data": [...]} имеет вид shots.json. Каждый элемент содержит шаблон {"data": [...]}, instruction, inputs и outputs.
meta
В каждом примере используются четыре поля дополнительных текстов (–option_a). В поле option_d содержатся плейсхолдеры для всех четырёх вариантов. В блоке «Формат ответа» явно указано, что буквами ответа в строке РЕШЕНИЕ могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г).
instruction
Каждый пример в датасете содержит следующие поля:
instruction [str] — строка с формулировкой задания для языковой моделиinputs — входные данные:main_text [str] — основной текст для классификацииoption_a [str] — дополнительный текст Аoption_b [str] — дополнительный текст Бoption_c [str] — дополнительный текст Вoption_d [str] — дополнительный текст Гcontext [str] — описание 12 классов юмористического эффектаoutputs [str] — строка вида класс,буква (например, ирония,Г)
meta — метаданные:id [int] — номер примера
Для задачи подготовлено 5 вариантов промптов. Они распределены по примерам: каждому примеру соответствует один из пяти шаблонов (индекс 0–4). В поле instruction каждого примера записан полный текст выбранного промпта с плейсхолдерами , {context}, {main_text}–{option_a}. В каждом шаблоне обращение к модели согласовано по стилю (на «ты» или на «вы»). Модель должна вернуть две строки: {option_d}ОТВЕТ и <класс>РЕШЕНИЕ <буква>
Датасет создан экспертной группой лингвистов в несколько этапов.
context и предъявляются модели вместе с заданием.
option_a – option_b), один из которых принадлежит тому же классу, что и основной, а остальные являются дистракторами других классов. Дистракторы подбирались из общего пула, поэтому один и тот же текст может выступать основным в одном задании и дополнительным в другом; это осознанное решение дизайна.класс,буква) с эталоном: одновременно для классификации типа юмористического эффекта и для выбора буквы дополнительного текста.