Датасет Загадки представлен двумя отдельными наборами загадок на русском языке: открытым (включающим классические загадки, собранные из открытых источников в сборниках и Сети) и закрытым (с заданиями, написанными по тем же текстообразовательным моделям, что и открытый, но заданий к которому и ответов не найти в Сети). Каждый набор содержит 500 примеров. В лидерборд MERA Text 2.0 входит только закрытый набор, а открытый набор хранится отдельно и может использоваться для дополнительной диагностики.
Загадки представляют из себя древнейший вид свёрнутой передачи информации об объекте реальности через жёстко выделенный набор индивидуальных свойств, метафору, олицетворение и другие приёмы, позволяющие поместить описание в короткую и часто ритмизированную и рифмованную форму. Примеры в датасетах охватывают ключевые разделы быта и мировоззрения человека: от космогонических древних категорий (небо, дорога, ночь, день, месяц, звёзды) до инструментов (пила, топор), современных занятий и профессий и элементов современного дома. Разгадывание загадок требует от модели комплексных размышлений, владения навыками языковой игры (хотя бы на уровне восприятия) и умения не только интерпретировать метафоры, олицетворения и метонимические переносы (которые зачастую являются ключевым способом загадывания), но и не упускать из внимания ни одной детали условия — без них или с упущением одной из них в ответе задание считается не выполненным.
Проверяемые навыки: General reasoning, Problem solving, Metaphorical Thinking, Folklore, Language Games, Attention to Detail, Pattern recognition
Авторы: Денис Шевелев, Артем Червяков, Александр Астафуров, Александр Харитонов
Датасет заточен под проверку способности продвинутых LLM воспринимать и расшифровывать информацию в одном из старейших форматов передачи знаний в истории человечества — в загадках, где при помощи метафор информация суммаризируется в максимально краткой и образной форме.
Результаты оценки полезны исследователям в области ИИ, оценивающим возможности моделей в области языкового и творческого мышления, и разработчикам образовательных систем и курсов школьного и дошкольного образования, изучающим развитие навыка сообразительности в интеллектуальных системах. По итогам оценки станет видно, способна ли модель выступать в роли «отгадчика» традиционных и современных загадок, что критически важно для оценки глубины освоения языкового мышления и может помочь при создании интеллектуальных ассистентов и помощников репетитора.
Датасет предназначен для русскоязычных генеративных текстовых моделей, способных следовать инструкции и выдавать короткий ответ. Результат отражает способность разгадывать загадки, но не является общей оценкой рассуждения, фактических знаний или понимания фольклора.
Число допустимых эталонных ответов различается между примерами и составляет от 1 до 11. Поэтому у примеров с большим числом вариантов выше вероятность точного совпадения; это следует учитывать при интерпретации Exact Match.
Дизайн задач (набор «золотых ответов» в виде системы синонимов и допустимые дополнительные ответы из современного мира к архаическим загадкам) даёт возможности к получению ответов генеративным способом и широкому сопоставлению их с образцами, что снижает, но не исключает субъективность и неоднозначность оценки.
Каждый пример в датасете содержит следующие поля:
instruction [str] — строка с формулировкой задания для языковой модели.inputs — входные данные:question [str] — текст загадки.outputs [str] — строка с одним или несколькими допустимыми ответами, разделёнными последовательностью ; . Ответ модели считается правильным, если совпадает хотя бы с одним из вариантов.
meta — метаданные:id [int] — номер примера.{
"instruction": "По тексту загадки нужно найти ответ в виде слова или фразы.\n\nВ качестве ответа укажите строку\n\nОтвет: СЛОВО ИЛИ ФРАЗА\n\n{question}",
"inputs": {
"question": "Серёжки для простаков."
},
"outputs": "Лапша",
"meta": {
"id": 504
}
}
Для задачи подготовлено 5 вариантов промптов. Они распределены равномерно по 500 примерам закрытого датасета по принципу «один пример — один промпт». В каждом шаблоне обращение к модели согласовано по стилю (на «ты» или на «вы»). Плейсхолдер заполняется значением поля {question} для каждого примера.
inputs.question
Во всех промптах модель должна дать ответ в виде слова или фразы в строке, начинающейся с маркера .
Ответ:
Создание датасета включало работу над двумя равноправными частями по 500 строк. Для первой, открытой версии, были собраны классические загадки из общедоступных открытых публикаций в Сети: из известных классических сборников Ю. Г. Илларионовой, М. А. Рыбниковой и др., перепечатанные из старых детских журналов, с развлекательных порталов для детей. Для второй, закрытой версии, по текстовым моделям классических загадок были написаны новые, не встречающиеся в Сети тексты, снабжённые по аналогии наборами «золотых ответов».
Процесс сбора и валидации включал внутрикомандные экспертные ревью и анализ качества материала. Для контроля качества проводилась дополнительная LLM-оценка в виде прогонов на наиболее передовых из доступных моделей, способных к восприятию и генерации текста на русском языке.
Для агрегированной оценки ответов моделей используются следующие метрики:
Ответ:. Значение находится в диапазоне от 0 до 1: 0 означает отсутствие точных совпадений, 1 — совпадение во всех примерах.
1; частично правильный или неполный ответ, содержащий существенную часть разгадки, получает 0.5; неправильный, противоречивый или не содержащий правильной разгадки ответ получает 0. Итоговое значение метрики равно среднему баллу по всем примерам.