NewReasoning — русскоязычный датасет для оценки способности моделей решать короткие задачи на рассуждение с вариантами ответа. Каждый пример содержит текстовую задачу с пропуском, обозначенным как , и набор вариантов, помеченных русскими буквами. Модель должна выбрать один или несколько подходящих вариантов и вернуть буквы ответов в заданном формате.
_ _ _
Датасет проверяет устойчивость модели к логическим ловушкам, подменам условий, изменению количественных и качественных параметров и нарушению порядка рассуждения.
Проверяемые навыки: Reasoning, Critical Thinking, Deductive Reasoning, Inductive Reasoning, Abductive Reasoning, Analogical Reasoning, Cause-and-Effect Reasoning, Decompositional Reasoning, Case-based Reasoning, Value Reasoning.
Авторы: Денис Шевелев, Александр Харитонов, Александр Астафуров
Задача ориентирована на оценку русскоязычных генеративных моделей в сценариях, где требуется не просто распознать знакомый тип задачи, а проверить условия и выбрать корректный вариант ответа.
NewReasoning полезен для анализа устойчивости моделей к поверхностным шаблонам: близкие по форме задачи могут требовать разных способов рассуждения, поэтому результат показывает, насколько модель удерживает структуру условия и формат ответа.
Датасет не предназначен для оценки моделей, которые не работают с русским языком или не поддерживают генерацию ответа в заданном текстовом формате. Задача также не измеряет полноту математических, энциклопедических или предметных знаний: примеры сфокусированы на локальном рассуждении по условию и вариантам ответа.
Валидность задачи обеспечивается контролируемым форматом: каждый пример содержит явно заданное условие, набор вариантов ответа и тип задачи в метаданных. Разные типы примеров проверяют, сохраняет ли модель исходные условия, замечает ли подмены и выбирает ли ответ после анализа конкретной формулировки, а не по знакомому шаблону.
Датасет состоит из двух файлов одинаковой структуры:
Каждый элемент содержит шаблон , instruction, inputs и outputs.
meta
В каждом примере используются девять полей вариантов ответа (–option_a). Неиспользуемые варианты хранятся как пустые строки. В поле option_i содержатся плейсхолдеры только для непустых вариантов: блок «Варианты ответа» включает ровно столько строк, сколько непустых полей instruction есть в конкретном примере. В блоке «Формат ответа» явно указано, что буквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е, Ё, Ж, З); в каждом примере в этом списке перечислены ровно те буквы, которые соответствуют непустым вариантам. Верным может быть один или несколько вариантов; несколько букв записываются в алфавитном порядке через точку с запятой и пробел.
option_*
Каждому примеру в поле соответствует один из четырёх типов:
task_type
| task_type | Тип задания | Кол-во | Доля |
|---|---|---|---|
| А | Тип А «Задачка или уловка» | 184 | 49,7% |
| Б | Тип Б «Последовательность шагов» | 108 | 29,2% |
| В | Тип В «Умный ответ» | 63 | 17,0% |
| Г | Тип Г «Поиск соответствий» | 15 | 4,1% |
В few-shot выборке по 4 примера на каждый тип задания.
Каждый пример в датасете содержит следующие поля:
instruction [str] — строка с формулировкой задания для языковой модели.inputs — входные данные, формирующие задание:question [str] — текст задачи с пропуском _ _ _;
option_a [str] — вариант ответа А;option_b [str] — вариант ответа Б;option_c [str] — вариант ответа В;option_d [str] — вариант ответа Г;option_e [str] — вариант ответа Д;option_f [str] — вариант ответа Е;option_g [str] — вариант ответа Ё;option_h [str] — вариант ответа Ж;option_i [str] — вариант ответа З;outputs [str] — строка, содержащая букву или буквы верного ответа, записанные в алфавитном порядке через точку с запятой и пробел.meta — метаданные:id [int] — номер примера;task_type [str] — тип задания: А, Б, В или Г.{
"instruction": "Помогите мне, пожалуйста.\n\nЗадача:\nПрочитайте текст с пропуском, обозначенным как ’_ _ _’. Ознакомьтесь с вариантами заполнения пропуска, и выберите все подходящие — те, что логично отвечают на вопрос в тексте (в том числе в скобках, если он есть).\n\nДля решения нужно оценить ситуацию, применить логическое рассуждение и, при необходимости, элементарную арифметику или сообразительность.\n\nФормат ответа:\nПоследняя строка ответа должна иметь вид:\n\nОтвет: <буква или буквы>\n\nЕсли подходящих вариантов несколько, перечислите буквы в алфавитном порядке через точку с запятой и пробел.\n\nБуквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е, Ё, Ж, З).\n\nТекст:\n{question}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}\nД. {option_e}\nЕ. {option_f}\nЁ. {option_g}\nЖ. {option_h}\nЗ. {option_i}\n\nОтвет:",
"inputs": {
"question": "Матери 55 лет. У неё три дочери. Первой 15 лет, второй — 7, а третьей — 21 год. Через сколько лет возраст матери будет равен сумме лет её дочерей? Верный ответ: ’_ _ _’.",
"option_a": "Никогда",
"option_b": "3,5 года",
"option_c": "3 года",
"option_d": "8 лет",
"option_e": "4 года",
"option_f": "5 лет",
"option_g": "6 лет",
"option_h": "12 лет",
"option_i": "15 лет"
},
"outputs": "Ё",
"meta": {
"id": 373,
"task_type": "А"
}
}
Для задачи подготовлено 5 вариантов промптов. Они распределены равномерно по примерам по принципу «один промпт на один пример». Для каждого примера промпт адаптируется под число непустых вариантов ответа: в блоке «Варианты ответа» остаются только соответствующие строки, а в блоке «Формат ответа» перечисляется сокращённый список допустимых букв (например, для шести вариантов — «А, Б, В, Г, Д, Е»). Плейсхолдеры в фигурных скобках заполняются из полей внутри для каждого вопроса.
inputs
Датасет построен как набор коротких русскоязычных задач на рассуждение с контролируемыми трансформациями. В основе лежат исходные задачи и их варианты, в которых меняются поверхностные признаки или логическая структура: инвертируются условия, меняются числа, единицы измерения, качество объектов, тип решения или порядок шагов рассуждения.
Примеры размечены по четырём типам задач: А — «Задачка или уловка», Б — «Последовательность шагов», В — «Умный ответ», Г — «Поиск соответствий». Эти поля позволяют фильтровать примеры по типу задачи и анализировать результаты по группам.
Для агрегированной оценки ответов моделей используются следующие метрики:
Ответ:.