Вернуться к списку задач

Humor

Способность модели
Text Analysis
Semantic Textual Similarity
Humor Detection
Humor Classification
Humor Recognition
Irony Recognition
Метрика
Exact match
LLM judge score
Top score
Датасет Юмор предлагает моделям классификацию юмористических текстов (анекдоты и короткие истории) и два связанных подзадания: определить тип основного текста по способу создания комического эффекта и выбрать среди четырёх дополнительных текстов тот, который относится к тому же классу.

Описание задачи

Датасет Юмор предлагает моделям классификацию юмористических текстов (анекдоты и короткие истории) и два связанных подзадания: определить тип основного текста по способу создания комического эффекта и выбрать среди четырёх дополнительных текстов тот, который относится к тому же классу.

В датасете 600 примеров, сбалансированных по 12 классам (11 типов юмористического эффекта и класс «не анекдот»). К каждому основному тексту даны четыре дополнительных варианта (А, Б, В, Г).

Проверяемые навыки: Text Analysis, Semantic Textual Similarity, Humor Detection, Humor Classification, Humor Recognition, Irony Recognition

Авторы: Денис Шевелев, Александра Елисеева, Александр Харитонов, Александр Астафуров

Мотивация

Набор данных оценивает способность модели не только определять структурный тип юмора в тексте, но и находить текст с тем же типом среди альтернатив. Класс «не анекдот» служит контролем: модель должна детерминированно отличать юмористические тексты от неюмористических.

Описание датасета

Датасет состоит из двух файлов:

  • test.json — 600 тестовых примеров с id 1–600
  • shots.json — 5 few-shot примеров с id 601–605

test.json имеет вид {"access": "private", "data": [...]}shots.json имеет вид {"data": [...]}. Каждый элемент содержит шаблон instructioninputsoutputs и meta.

В каждом примере используются четыре поля дополнительных текстов (option_aoption_d). В поле instruction содержатся плейсхолдеры для всех четырёх вариантов. В блоке «Формат ответа» явно указано, что буквами ответа в строке РЕШЕНИЕ могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г).

Поля данных

Каждый пример в датасете содержит следующие поля:

  • instruction [str] — строка с формулировкой задания для языковой модели
  • inputs — входные данные:
    • main_text [str] — основной текст для классификации
    • option_a [str] — дополнительный текст А
    • option_b [str] — дополнительный текст Б
    • option_c [str] — дополнительный текст В
    • option_d [str] — дополнительный текст Г
    • context [str] — описание 12 классов юмористического эффекта
  • outputs [str] — строка вида класс,буква (например, ирония,Г)
  • meta — метаданные:
    • id [int] — номер примера

Промпты

Для задачи подготовлено 5 вариантов промптов. Они распределены по примерам: каждому примеру соответствует один из пяти шаблонов (индекс 0–4). В поле instruction каждого примера записан полный текст выбранного промпта с плейсхолдерами {context}{main_text}{option_a}{option_d}. В каждом шаблоне обращение к модели согласовано по стилю (на «ты» или на «вы»). Модель должна вернуть две строки: ОТВЕТ <класс> и РЕШЕНИЕ <буква>

Создание датасета

Датасет создан экспертной группой лингвистов в несколько этапов.

  1. Формирование таксономии. На основе лингвистических работ о механизмах комического выделены 11 типов юмористического эффекта (игра слов, игра паттернов, секрет Полишинеля, каламбур, оксюморон, логика абсурда, обман ожиданий, капитан Очевидность, эллипсис, ирония, остроумный ответ) и контрольный класс «не анекдот». Для каждого класса составлено рабочее определение с диагностическими признаками; эти определения вошли в поле context и предъявляются модели вместе с заданием.
  2. Сбор пула текстов. Для каждого из 12 классов эксперты отобрали короткие тексты (анекдоты, шутки, бытовые истории и неюмористические фрагменты для класса «не анекдот»). Тексты нормализованы по типографике и анонимизированы; фрагменты, требующие внешнего культурного контекста или содержащие неприемлемую лексику, отсеяны на этапе отбора.
  3. Разметка. Каждый текст независимо классифицирован экспертами по единой инструкции с определениями классов. Спорные случаи выносились на обсуждение группы; текст включался в пул только после согласования итоговой метки.
  4.  Из пула сформированы 600 заданий: к каждому основному тексту (по 50 на класс) подобраны четыре дополнительных текста (option_a – option_b), один из которых принадлежит тому же классу, что и основной, а остальные являются дистракторами других классов. Дистракторы подбирались из общего пула, поэтому один и тот же текст может выступать основным в одном задании и дополнительным в другом; это осознанное решение дизайна.
  5. Перекрёстная проверка. Готовые задания прошли перекрёстную проверку: эксперт, не участвовавший в сборке конкретного задания, проверял корректность эталонного класса и единственность правильной буквы. По результатам проверки часть заданий была переразмечена или заменена.
  6. Контроль баланса. Финальный сет сбалансирован: по 50 основных текстов на каждый из 12 классов; распределение правильных букв (А, Б, В, Г) близко к равномерному

Метрики

  • Exact match (EM): проверяется точное совпадение распарсенного ответа модели (строка вида класс,буква) с эталоном: одновременно для классификации типа юмористического эффекта и для выбора буквы дополнительного текста.
  • LLM judge: модель-судья оценивает ответ тестируемой модели относительно эталона с учётом текста задания. Метрика устойчива к незначительным вариациям формулировки класса и дополняет строгий EM.