Вернуться к списку задач

NewReasoning

Способность модели
Reasoning
Critical Thinking
Deductive Reasoning
Inductive Reasoning
Abductive Reasoning
Analogical Reasoning
Cause-and-Effect Reasoning
Decompositional Reasoning
Case-based Reasoning
Value Reasoning
Метрика
Exact match
LLM judge score
Top score
NewReasoning — русскоязычный датасет для оценки способности моделей решать короткие задачи на рассуждение с вариантами ответа

Описание задачи

NewReasoning — русскоязычный датасет для оценки способности моделей решать короткие задачи на рассуждение с вариантами ответа. Каждый пример содержит текстовую задачу с пропуском, обозначенным как _ _ _, и набор вариантов, помеченных русскими буквами. Модель должна выбрать один или несколько подходящих вариантов и вернуть буквы ответов в заданном формате.

Датасет проверяет устойчивость модели к логическим ловушкам, подменам условий, изменению количественных и качественных параметров и нарушению порядка рассуждения.

Проверяемые навыки: Reasoning, Critical Thinking, Deductive Reasoning, Inductive Reasoning, Abductive Reasoning, Analogical Reasoning, Cause-and-Effect Reasoning, Decompositional Reasoning, Case-based Reasoning, Value Reasoning.

Авторы: Денис Шевелев, Александр Харитонов, Александр Астафуров

Мотивация

Задача ориентирована на оценку русскоязычных генеративных моделей в сценариях, где требуется не просто распознать знакомый тип задачи, а проверить условия и выбрать корректный вариант ответа.

NewReasoning полезен для анализа устойчивости моделей к поверхностным шаблонам: близкие по форме задачи могут требовать разных способов рассуждения, поэтому результат показывает, насколько модель удерживает структуру условия и формат ответа.

Ограничения

Датасет не предназначен для оценки моделей, которые не работают с русским языком или не поддерживают генерацию ответа в заданном текстовом формате. Задача также не измеряет полноту математических, энциклопедических или предметных знаний: примеры сфокусированы на локальном рассуждении по условию и вариантам ответа.

Валидность

Валидность задачи обеспечивается контролируемым форматом: каждый пример содержит явно заданное условие, набор вариантов ответа и тип задачи в метаданных. Разные типы примеров проверяют, сохраняет ли модель исходные условия, замечает ли подмены и выбирает ли ответ после анализа конкретной формулировки, а не по знакомому шаблону.

Описание датасета

Датасет состоит из двух файлов одинаковой структуры:

  • test.json
  • shots.json

Каждый элемент содержит шаблон instructioninputsoutputs и meta.

В каждом примере используются девять полей вариантов ответа (option_aoption_i). Неиспользуемые варианты хранятся как пустые строки. В поле instruction содержатся плейсхолдеры только для непустых вариантов: блок «Варианты ответа» включает ровно столько строк, сколько непустых полей option_* есть в конкретном примере. В блоке «Формат ответа» явно указано, что буквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е, Ё, Ж, З); в каждом примере в этом списке перечислены ровно те буквы, которые соответствуют непустым вариантам. Верным может быть один или несколько вариантов; несколько букв записываются в алфавитном порядке через точку с запятой и пробел.

Распределение по типам заданий

Каждому примеру в поле task_type соответствует один из четырёх типов:

task_type Тип задания Кол-во Доля
А Тип А «Задачка или уловка» 184 49,7%
Б Тип Б «Последовательность шагов» 108 29,2%
В Тип В «Умный ответ» 63 17,0%
Г Тип Г «Поиск соответствий» 15 4,1%

В few-shot выборке по 4 примера на каждый тип задания.

Поля данных

Каждый пример в датасете содержит следующие поля:

  • instruction [str] — строка с формулировкой задания для языковой модели.
  • inputs — входные данные, формирующие задание:
    • question [str] — текст задачи с пропуском _ _ _;
    • option_a [str] — вариант ответа А;
    • option_b [str] — вариант ответа Б;
    • option_c [str] — вариант ответа В;
    • option_d [str] — вариант ответа Г;
    • option_e [str] — вариант ответа Д;
    • option_f [str] — вариант ответа Е;
    • option_g [str] — вариант ответа Ё;
    • option_h [str] — вариант ответа Ж;
    • option_i [str] — вариант ответа З;
  • outputs [str] — строка, содержащая букву или буквы верного ответа, записанные в алфавитном порядке через точку с запятой и пробел.
  • meta — метаданные:
    • id [int] — номер примера;
    • task_type [str] — тип задания: А, Б, В или Г.

Пример данных

{
    "instruction": "Помогите мне, пожалуйста.\n\nЗадача:\nПрочитайте текст с пропуском, обозначенным как ’_ _ _’. Ознакомьтесь с вариантами заполнения пропуска, и выберите все подходящие — те, что логично отвечают на вопрос в тексте (в том числе в скобках, если он есть).\n\nДля решения нужно оценить ситуацию, применить логическое рассуждение и, при необходимости, элементарную арифметику или сообразительность.\n\nФормат ответа:\nПоследняя строка ответа должна иметь вид:\n\nОтвет: <буква или буквы>\n\nЕсли подходящих вариантов несколько, перечислите буквы в алфавитном порядке через точку с запятой и пробел.\n\nБуквами ответа могут являться только заглавные буквы русского алфавита из списка (А, Б, В, Г, Д, Е, Ё, Ж, З).\n\nТекст:\n{question}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}\nД. {option_e}\nЕ. {option_f}\nЁ. {option_g}\nЖ. {option_h}\nЗ. {option_i}\n\nОтвет:",
    "inputs": {
        "question": "Матери 55 лет. У неё три дочери. Первой 15 лет, второй — 7, а третьей — 21 год. Через сколько лет возраст матери будет равен сумме лет её дочерей? Верный ответ: ’_ _ _’.",
        "option_a": "Никогда",
        "option_b": "3,5 года",
        "option_c": "3 года",
        "option_d": "8 лет",
        "option_e": "4 года",
        "option_f": "5 лет",
        "option_g": "6 лет",
        "option_h": "12 лет",
        "option_i": "15 лет"
    },
    "outputs": "Ё",
    "meta": {
        "id": 373,
        "task_type": "А"
    }
}

Промпты

Для задачи подготовлено 5 вариантов промптов. Они распределены равномерно по примерам по принципу «один промпт на один пример». Для каждого примера промпт адаптируется под число непустых вариантов ответа: в блоке «Варианты ответа» остаются только соответствующие строки, а в блоке «Формат ответа» перечисляется сокращённый список допустимых букв (например, для шести вариантов — «А, Б, В, Г, Д, Е»). Плейсхолдеры в фигурных скобках заполняются из полей внутри inputs для каждого вопроса.

Создание датасета

Датасет построен как набор коротких русскоязычных задач на рассуждение с контролируемыми трансформациями. В основе лежат исходные задачи и их варианты, в которых меняются поверхностные признаки или логическая структура: инвертируются условия, меняются числа, единицы измерения, качество объектов, тип решения или порядок шагов рассуждения.

Примеры размечены по четырём типам задач: А — «Задачка или уловка», Б — «Последовательность шагов», В — «Умный ответ», Г — «Поиск соответствий». Эти поля позволяют фильтровать примеры по типу задачи и анализировать результаты по группам.

Оценка

Метрики

Для агрегированной оценки ответов моделей используются следующие метрики:

  • Exact match (EM): доля ответов модели, которые точно совпадают с эталонным ответом после извлечения строки после маркера Ответ:.
  • LLM judge score: метрика, в которой LLM-судья сравнивает ответ модели с эталонным ответом для каждого примера. Если ответ признан правильным, пример получает 1; если неправильным — 0. Итоговое значение метрики равно доле примеров, получивших оценку 1.