RUBIN — текстовый датасет элементов культурного кода русского языка (ВШЭ / Huawei), проверяющий способность моделей понимать фразы и лингвистические явления, специфичные не столько для языка, сколько для его культурной среды: мемы, сленг, песни, фильмы, фольклор, скороговорки, поговорки и смежные явления.
Проверяемые навыки: Culture code, Question Answering
Авторы: Полина Лазукова, Ирина Пионтковская
Долгое время в общем доступе не было датасета элементов культурного кода для русского языка. Даже узкоспециализированная LLM может ошибаться там, где в специализированный формат проникают элементы культурного кода. Это актуально для чат-ботов, систем делопроизводства, машинного перевода и адаптации локальных отсылок. Датасет позволяет проверить, насколько модель улавливает и верно интерпретирует эту специфику.
Датасет не подходит для оценки грамотности и других общеязыковых компетенций. Текущий релиз содержит вопросы и промпты только на русском языке.
Результаты оценки полезны локализующемуся в русскоязычную среду бизнесу, создателям систем машинного перевода, исследователям LLM, переводчикам и адаптаторам, маркетологам, лингвистам и культурологам.
Формат задачи — multiple-choice с одним правильным вариантом ответа (буквы А, Б, В, Г). Многие вопросы построены по шаблону «Как заканчивается фраза?..». Дистракторы сгенерированы LLM и дополнительно проверены вручную.
Текущий релиз MERA содержит 783 тестовых примера и 5 few-shot примеров (788 всего).
Исходный пул RUBIN включает 5000 стандартизированных вопросов. После HumanEval на носителях языка (Yandex Tasks) вопросы с долей верных ответов людей не ниже 50% образовали подмножество RUBIN-Easy (4216 примеров). В данный релиз вошли преимущественно «сложные» вопросы (, доля верных ответов носителей ниже 50%), а также 5 easy-примеров в is_easy=false.
shots
Каждый пример содержит следующие поля:
instruction [str] — шаблон промпта; плейсхолдеры в фигурных скобках заполняются из inputs.
inputs — входные данные задания:question [str] — текст вопроса;option_a [str] — вариант ответа А;option_b [str] — вариант ответа Б;option_c [str] — вариант ответа В;option_d [str] — вариант ответа Г;outputs [str] — буква единственного правильного ответа: А, Б, В или Г.
meta — метаданные (скрыты от тестируемой модели):id [int] — идентификатор примера;type [str] — культурная категория (см. ниже);year [str] — год появления / пика культурной релевантности явления; если дата неизвестна — "Unknown";
is_phrase_ending [bool] — вопрос в формате продолжения фразы;is_easy [bool] — входил ли пример в RUBIN-Easy по результатам HumanEval.В релизе используются 10 значений:
, Song, Others, Proverb, Slang, Film, Riddle, Twister, Meme, Poems.
Cartoon
{
"instruction": "Помогите мне, пожалуйста.\n\nОтветьте на вопрос, выбрав один правильный вариант из предложенных.\n\nПоследняя строка ответа должна иметь вид:\n\nОтвет: <буква>\n\nДопустимые значения: А, Б, В, Г.\n\nВопрос:\n{question}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}",
"inputs": {
"question": "Какая реакция из видео-ролика, где собака породы сиба-ину падает в реку, стала мемом о неудачах?",
"option_a": "Это была классическая улыбка после падения, символизирующая оптимизм перед новыми возможностями",
"option_b": "Дефлекторная манера собаки вылизывания себя после падения, как будто бы не обращая внимания на происходящее",
"option_c": "Внезапное бегство собаки от воды, демонстрирующее ее умение быстро уходить от проблем",
"option_d": "Это фиаско, братан"
},
"outputs": "Г",
"meta": {
"id": 137,
"type": "Meme",
"year": "2017",
"is_phrase_ending": false,
"is_easy": true
}
}
Подготовлено пять промптов. В они распределены равномерно: 157 / 157 / 157 / 156 / 156. В test каждый промпт представлен один раз.
shots
Пример одного из промптов:
Помогите мне, пожалуйста.
Ответьте на вопрос, выбрав один правильный вариант из предложенных.
Последняя строка ответа должна иметь вид:
Ответ: <буква>
Допустимые значения: А, Б, В, Г.
Вопрос:
{question}
Варианты ответа:
А. {option_a}
Б. {option_b}
В. {option_c}
Г. {option_d}
Few-shot-примеры имеют тот же формат данных, что и тестовый набор.
Исходный пул собран по текстам из сборников фольклора и песенников, онлайн-энциклопедий мемов, агрегаторов сленга и статей о популярных фильмах и мультфильмах. Правдоподобные ложные ответы созданы моделью Qwen2.5-14B; затем выполнена ручная валидация дистракторов (тематика, стилистика, правдоподобность, отсутствие совпадения с верным ответом, грамматическая согласованность).
Контроль качества включал HumanEval с поколенческой разметкой на носителях языка (платформа Yandex Tasks): участники от 20 лет, родной язык — русский, гражданство и проживание в РФ.
exact_match (Exact Match): доля предсказаний, у которых извлечённый ответ (после маркера Ответ:) точно совпадает с эталонной буквой.
judge_score (LLM judge score): LLM-судья сравнивает ответ модели с эталонными вариантами и оценивает его правильность и полноту. Полностью правильный и полный ответ получает 1; частично правильный или неполный ответ, содержащий существенную часть разгадки, получает 0.5; неправильный, противоречивый или не содержащий правильной разгадки ответ получает 0. Итоговое значение метрики равно среднему баллу по всем примерам.