Вернуться к списку задач

Riddles

Способность модели
General reasoning
Problem solving
Metaphorical Thinking
Folklore
Language Games
Attention to detail
Pattern recognition
Метрика
Exact match
LLM judge score
Top score
Датасет Загадки представлен двумя отдельными наборами загадок на русском языке

Описание задачи

Датасет Загадки представлен двумя отдельными наборами загадок на русском языке: открытым (включающим классические загадки, собранные из открытых источников в сборниках и Сети) и закрытым (с заданиями, написанными по тем же текстообразовательным моделям, что и открытый, но заданий к которому и ответов не найти в Сети). Каждый набор содержит 500 примеров. В лидерборд MERA Text 2.0 входит только закрытый набор, а открытый набор хранится отдельно и может использоваться для дополнительной диагностики.

Загадки представляют из себя древнейший вид свёрнутой передачи информации об объекте реальности через жёстко выделенный набор индивидуальных свойств, метафору, олицетворение и другие приёмы, позволяющие поместить описание в короткую и часто ритмизированную и рифмованную форму. Примеры в датасетах охватывают ключевые разделы быта и мировоззрения человека: от космогонических древних категорий (небо, дорога, ночь, день, месяц, звёзды) до инструментов (пила, топор), современных занятий и профессий и элементов современного дома. Разгадывание загадок требует от модели комплексных размышлений, владения навыками языковой игры (хотя бы на уровне восприятия) и умения не только интерпретировать метафоры, олицетворения и метонимические переносы (которые зачастую являются ключевым способом загадывания), но и не упускать из внимания ни одной детали условия — без них или с упущением одной из них в ответе задание считается не выполненным.

Проверяемые навыки: General reasoning, Problem solving, Metaphorical Thinking, Folklore, Language Games, Attention to Detail, Pattern recognition

Авторы: Денис Шевелев, Артем Червяков, Александр Астафуров, Александр Харитонов

Мотивация

Датасет заточен под проверку способности продвинутых LLM воспринимать и расшифровывать информацию в одном из старейших форматов передачи знаний в истории человечества — в загадках, где при помощи метафор информация суммаризируется в максимально краткой и образной форме.

Для кого результаты

Результаты оценки полезны исследователям в области ИИ, оценивающим возможности моделей в области языкового и творческого мышления, и разработчикам образовательных систем и курсов школьного и дошкольного образования, изучающим развитие навыка сообразительности в интеллектуальных системах. По итогам оценки станет видно, способна ли модель выступать в роли «отгадчика» традиционных и современных загадок, что критически важно для оценки глубины освоения языкового мышления и может помочь при создании интеллектуальных ассистентов и помощников репетитора.

Ограничения

Датасет предназначен для русскоязычных генеративных текстовых моделей, способных следовать инструкции и выдавать короткий ответ. Результат отражает способность разгадывать загадки, но не является общей оценкой рассуждения, фактических знаний или понимания фольклора.

Число допустимых эталонных ответов различается между примерами и составляет от 1 до 11. Поэтому у примеров с большим числом вариантов выше вероятность точного совпадения; это следует учитывать при интерпретации Exact Match.

Оцениваемые способности

  1. Широкий лексический запас и владение паттернами потенциального словообразования русского языка.
  2. «Понимание» локально сформированных в тексте переносных значений и устойчивых, традиционных метафор.
  3. Решение «головоломок», текстовых «паззлов», умение складывать внешне абсурдную информацию в системный «портрет» вещи, явления или человека.
  4. Логическое и композиционное мышление, умение опознавать целое по частям.
  5. Антропоцентрическое восприятие и навыки языковой игры.

Дизайн задач (набор «золотых ответов» в виде системы синонимов и допустимые дополнительные ответы из современного мира к архаическим загадкам) даёт возможности к получению ответов генеративным способом и широкому сопоставлению их с образцами, что снижает, но не исключает субъективность и неоднозначность оценки.

Описание датасета

Поля данных

Каждый пример в датасете содержит следующие поля:

  • instruction [str] — строка с формулировкой задания для языковой модели.
  • inputs — входные данные:
    • question [str] — текст загадки.
  • outputs [str] — строка с одним или несколькими допустимыми ответами, разделёнными последовательностью ; . Ответ модели считается правильным, если совпадает хотя бы с одним из вариантов.
  • meta — метаданные:
    • id [int] — номер примера.

Пример данных

{
    "instruction": "По тексту загадки нужно найти ответ в виде слова или фразы.\n\nВ качестве ответа укажите строку\n\nОтвет: СЛОВО ИЛИ ФРАЗА\n\n{question}",
    "inputs": {
        "question": "Серёжки для простаков."
    },
    "outputs": "Лапша",
    "meta": {
        "id": 504
    }
}

Промпты

Для задачи подготовлено 5 вариантов промптов. Они распределены равномерно по 500 примерам закрытого датасета по принципу «один пример — один промпт». В каждом шаблоне обращение к модели согласовано по стилю (на «ты» или на «вы»). Плейсхолдер {question} заполняется значением поля inputs.question для каждого примера.

Во всех промптах модель должна дать ответ в виде слова или фразы в строке, начинающейся с маркера Ответ:.

Создание датасета

Создание датасета включало работу над двумя равноправными частями по 500 строк. Для первой, открытой версии, были собраны классические загадки из общедоступных открытых публикаций в Сети: из известных классических сборников Ю. Г. Илларионовой, М. А. Рыбниковой и др., перепечатанные из старых детских журналов, с развлекательных порталов для детей. Для второй, закрытой версии, по текстовым моделям классических загадок были написаны новые, не встречающиеся в Сети тексты, снабжённые по аналогии наборами «золотых ответов».

Процесс сбора и валидации включал внутрикомандные экспертные ревью и анализ качества материала. Для контроля качества проводилась дополнительная LLM-оценка в виде прогонов на наиболее передовых из доступных моделей, способных к восприятию и генерации текста на русском языке.

Оценка

Метрики

Для агрегированной оценки ответов моделей используются следующие метрики:

  • Exact match (EM): доля ответов модели, которые точно совпадают с одним из эталонных ответов после извлечения текста, следующего за маркером Ответ:. Значение находится в диапазоне от 0 до 1: 0 означает отсутствие точных совпадений, 1 — совпадение во всех примерах.
  • LLM judge score: LLM-судья сравнивает ответ модели с эталонными вариантами и оценивает его правильность и полноту. Полностью правильный и полный ответ получает 1; частично правильный или неполный ответ, содержащий существенную часть разгадки, получает 0.5; неправильный, противоречивый или не содержащий правильной разгадки ответ получает 0. Итоговое значение метрики равно среднему баллу по всем примерам.