Вернуться к списку задач

RUBIN

Способность модели
Culture code
Question Answering
Метрика
Exact match
LLM judge score
Top score
RUBIN — текстовый датасет элементов культурного кода русского языка (ВШЭ / Huawei), проверяющий способность моделей понимать фразы и лингвистические явления, специфичные не столько для языка, сколько для его культурной среды: мемы, сленг, песни, фильмы, фольклор, скороговорки, поговорки и смежные явления.

Описание задачи

RUBIN — текстовый датасет элементов культурного кода русского языка (ВШЭ / Huawei), проверяющий способность моделей понимать фразы и лингвистические явления, специфичные не столько для языка, сколько для его культурной среды: мемы, сленг, песни, фильмы, фольклор, скороговорки, поговорки и смежные явления.

Проверяемые навыки: Culture code, Question Answering

Авторы: Полина Лазукова, Ирина Пионтковская

Мотивация

Долгое время в общем доступе не было датасета элементов культурного кода для русского языка. Даже узкоспециализированная LLM может ошибаться там, где в специализированный формат проникают элементы культурного кода. Это актуально для чат-ботов, систем делопроизводства, машинного перевода и адаптации локальных отсылок. Датасет позволяет проверить, насколько модель улавливает и верно интерпретирует эту специфику.

Ограничения

Датасет не подходит для оценки грамотности и других общеязыковых компетенций. Текущий релиз содержит вопросы и промпты только на русском языке.

Для кого результаты

Результаты оценки полезны локализующемуся в русскоязычную среду бизнесу, создателям систем машинного перевода, исследователям LLM, переводчикам и адаптаторам, маркетологам, лингвистам и культурологам.

Оцениваемые способности

  1. Актуальные знания в области культурной специфики — понимание мемов, фольклорных и сленговых конструкций, знание цитат из песен и фильмов, популярных литературных произведений, рекламных слоганов.
  2. Способность преодолевать инерцию буквального восприятия слов и смыслов.
  3. Подбор синонимов не на уровне слов, а на уровне культурных понятий.
  4. Способность интерпретировать употребление культурных паттернов.

Формат задачи — multiple-choice с одним правильным вариантом ответа (буквы А, Б, В, Г). Многие вопросы построены по шаблону «Как заканчивается фраза?..». Дистракторы сгенерированы LLM и дополнительно проверены вручную.

Описание датасета

Текущий релиз MERA содержит 783 тестовых примера и 5 few-shot примеров (788 всего).

Исходный пул RUBIN включает 5000 стандартизированных вопросов. После HumanEval на носителях языка (Yandex Tasks) вопросы с долей верных ответов людей не ниже 50% образовали подмножество RUBIN-Easy (4216 примеров). В данный релиз вошли преимущественно «сложные» вопросы (is_easy=false, доля верных ответов носителей ниже 50%), а также 5 easy-примеров в shots.

Поля данных

Каждый пример содержит следующие поля:

  • instruction [str] — шаблон промпта; плейсхолдеры в фигурных скобках заполняются из inputs.
  • inputs — входные данные задания:
    • question [str] — текст вопроса;
    • option_a [str] — вариант ответа А;
    • option_b [str] — вариант ответа Б;
    • option_c [str] — вариант ответа В;
    • option_d [str] — вариант ответа Г;
  • outputs [str] — буква единственного правильного ответа: АБВ или Г.
  • meta — метаданные (скрыты от тестируемой модели):
    • id [int] — идентификатор примера;
    • type [str] — культурная категория (см. ниже);
    • year  [str] — год появления / пика культурной релевантности явления; если дата неизвестна — "Unknown";
    • is_phrase_ending [bool] — вопрос в формате продолжения фразы;
    • is_easy [bool] — входил ли пример в RUBIN-Easy по результатам HumanEval.

Категории (meta.type)

В релизе используются 10 значений:

SongOthersProverbSlangFilmRiddleTwisterMemePoemsCartoon.

  • Others

Пример данных

{
    "instruction": "Помогите мне, пожалуйста.\n\nОтветьте на вопрос, выбрав один правильный вариант из предложенных.\n\nПоследняя строка ответа должна иметь вид:\n\nОтвет: <буква>\n\nДопустимые значения: А, Б, В, Г.\n\nВопрос:\n{question}\n\nВарианты ответа:\nА. {option_a}\nБ. {option_b}\nВ. {option_c}\nГ. {option_d}",
    "inputs": {
        "question": "Какая реакция из видео-ролика, где собака породы сиба-ину падает в реку, стала мемом о неудачах?",
        "option_a": "Это была классическая улыбка после падения, символизирующая оптимизм перед новыми возможностями",
        "option_b": "Дефлекторная манера собаки вылизывания себя после падения, как будто бы не обращая внимания на происходящее",
        "option_c": "Внезапное бегство собаки от воды, демонстрирующее ее умение быстро уходить от проблем",
        "option_d": "Это фиаско, братан"
    },
    "outputs": "Г",
    "meta": {
        "id": 137,
        "type": "Meme",
        "year": "2017",
        "is_phrase_ending": false,
        "is_easy": true
    }
}

Промпты

Подготовлено пять промптов. В test они распределены равномерно: 157 / 157 / 157 / 156 / 156. В shots каждый промпт представлен один раз.

Пример одного из промптов:

Помогите мне, пожалуйста.

Ответьте на вопрос, выбрав один правильный вариант из предложенных.

Последняя строка ответа должна иметь вид:

Ответ: <буква>

Допустимые значения: А, Б, В, Г.

Вопрос:
{question}

Варианты ответа:
А. {option_a}
Б. {option_b}
В. {option_c}
Г. {option_d}

Few-shot-примеры имеют тот же формат данных, что и тестовый набор.

Создание датасета

Исходный пул собран по текстам из сборников фольклора и песенников, онлайн-энциклопедий мемов, агрегаторов сленга и статей о популярных фильмах и мультфильмах. Правдоподобные ложные ответы созданы моделью Qwen2.5-14B; затем выполнена ручная валидация дистракторов (тематика, стилистика, правдоподобность, отсутствие совпадения с верным ответом, грамматическая согласованность).

Контроль качества включал HumanEval с поколенческой разметкой на носителях языка (платформа Yandex Tasks): участники от 20 лет, родной язык — русский, гражданство и проживание в РФ.

Оценка

Метрики

  • exact_match  (Exact Match): доля предсказаний, у которых извлечённый ответ (после маркера Ответ:) точно совпадает с эталонной буквой.
  • judge_score (LLM judge score): LLM-судья сравнивает ответ модели с эталонными вариантами и оценивает его правильность и полноту. Полностью правильный и полный ответ получает 1; частично правильный или неполный ответ, содержащий существенную часть разгадки, получает 0.5; неправильный, противоречивый или не содержащий правильной разгадки ответ получает 0. Итоговое значение метрики равно среднему баллу по всем примерам.