BerryLM-L-v2-early-ckpt

Wildberrie&Russ Создан 14.04.2026 08:40
0.822
Общий результат
5
Место в рейтинге
В топе по задачам:
6
RWSD
Результат по задаче выше человеческого
Задача входит в число основных
8
RCB
Результат по задаче выше человеческого
Задача входит в число основных
2
ruWorldTree
Результат по задаче выше человеческого
Задача входит в число основных
4
ruOpenBookQA
Результат по задаче выше человеческого
Задача входит в число основных
1
ruHHH
Результат по задаче выше человеческого
3
ruHumanEval
5
USE
Результат по задаче выше человеческого
Задача входит в число основных
2
MathLogicQA
Результат по задаче выше человеческого
Задача входит в число основных
3
SimpleAr
3
BPS
5
ruModAr
Задача входит в число основных
6
MaMuRAMu
Результат по задаче выше человеческого
Задача входит в число основных
2
ruCodeEval
Задача входит в число основных
+9
Скрыть
Слабые задачи:
152
PARus
84
ruEthics
43
MultiQ
22
CheGeKa
21
ruDetox
+1
Скрыть

Оценки по задачам лидерборда

Таблица скроллится влево

Задача Результат Метрика
LCS 0.618 Accuracy
RCB 0.605 / 0.606 Accuracy F1 macro
USE 0.722 Grade norm
RWSD 0.888 Accuracy
PARus 0.876 Accuracy
ruTiE 0.897 Accuracy
MultiQ 0.591 / 0.423 F1 Exact match
CheGeKa 0.505 / 0.435 F1 Exact match
ruModAr 0.999 Exact match
MaMuRAMu 0.904 Accuracy
ruMultiAr 0.998 Exact match
ruCodeEval 0.848 / 0.896 / 0.909 Pass@k
MathLogicQA 0.998 Accuracy
ruWorldTree 0.996 / 0.996 Accuracy F1 macro
ruOpenBookQA 0.968 / 0.967 Accuracy F1 macro

Оценка на открытых задачах:

Перейти к оценкам по подкатегориям

Таблица скроллится влево

Задача Результат Метрика
BPS 1.0 Accuracy
ruMMLU 0.886 Accuracy
SimpleAr 1.0 Exact match
ruHumanEval 0.829 / 0.868 / 0.872 Pass@k
ruHHH 0.938
ruHateSpeech 0.906
ruDetox 0.366
ruEthics
Правильно Хорошо Этично
Добродетель 0.405 0.397 0.69
Закон 0.431 0.395 0.72
Мораль 0.438 0.425 0.757
Справедливость 0.366 0.358 0.647
Утилитаризм 0.343 0.337 0.606

Информация о сабмите

Версия MERA
v1.2.0
Версия Torch
2.9.0
Версия кодовой базы
0cabf9d
Версия CUDA
12.8
Precision весов модели
bf16
Сид
1234
Батч
1
Версия transformers
4.57.6
Количество GPU и их тип
1 x NVIDIA A800 80GB PCIe
Архитектура
local-chat-completions

Команда:

Wildberrie&Russ

Название ML-модели:

BerryLM-L-v2-early-ckpt

Ссылка на ML-модель:

https://huggingface.co/Vtmpas/BerryLM-L-v2-early-ckpt

Размер модели

120

Тип модели:

Закрытая

SFT

MoE

Описание архитектуры:

reasoning-ориентированная модель, дообученная для сценариев с длинным контекстом, раздельной генерацией внутреннего рассуждения и финального ответа, а также повышенными требованиями к качеству финального текстового вывода.

Описание обучения:

В post-training используется DAPO - один из вариантов семейства GRPO, адаптированный под сценарии, где нужно одновременно контролировать качество ответа и форму reasoning-процесса. В рабочем контуре используется компактная система из двух reward-функций с весами 0.8 / 0.2, собранная вокруг задачи предотвращения reward hacking.

Данные претрейна:

Обучение проводится на миксе закрытых и открытых датасетов. Полный состав датасетного микса не раскрывается, однако по структуре данные представляют собой: диалоговые примеры в формате messages; пары prompt -> Ground Truth; примеры, в которых важны как качество reasoning, так и корректность финального ответа; данные, пригодные для post-training в режиме instruction following и коррекции ответа. Такой формат позволяет одновременно оптимизировать: содержательную близость финального ответа к эталону; профиль reasoning по длине и плотности; устойчивость к избыточной генерации и зацикливанию; качество ответа в диалоговом формате.

Лицензия:

Proprietary

Параметры инференса

Системный промпт:
## System Instructions\nFollow all these rules strictly\n\n### Thinking Rules\nReasoning effort: Medium\nТы можешь рассуждать, анализировать и думать в любом формате, но КРАТКО. Надо получить лучший ответ за минимальное количество шагов.\nНЕ выполняй пошаговые вычисления, перебор, заполнение таблиц или ручное моделирование алгоритмов.\nЕсли задача требует вычислений (DP, арифметика, логика) — рассуждай на уровне идеи и оценки, а не пошагового перебора.\nРассуждения должны занимать НЕ БОЛЕЕ нескольких абзацев. Затем СРАЗУ дай финальный ответ.\nОднако ФИНАЛЬНЫЙ ОТВЕТ должен строго соответствовать требованиям задачи.\n\n### Critical Rules\n- Выполняй инструкции пользователя ДОСЛОВНО и БУКВАЛЬНО\n- Если в задании указан конкретный формат ответа — следуй ему СТРОГО\n- Не изменяй и не "улучшай" требуемый формат задачи\n\n### Output Format\nФинальный ответ выводи только в запрошенном формате без дополнительных объяснений.\nЕсли нужна буква - пиши только букву. Если нужна цифра - пиши только цифру. Если нужно число - пиши только число.\nНе используй markdown форматирование, звездочки или другие символы в ответе.\n\n### Few-shot Format\nТебе могут быть даны примеры решения задачи (few-shot). Примеры показывают формат ответа.\nВАЖНО: Иногда сама задача, которую нужно решить, уже содержится среди примеров — в этом случае ты должен дать ответ на неё, а не продолжать генерировать новые примеры.\nОтвечай только на последний вопрос/задачу.\n\n### Language Rules\nЕсли в ответе требуется название фильма, книги или другого произведения - пиши его ТОЛЬКО НА РУССКОМ ЯЗЫКЕ.\nНапример, не "Taxi Driver", а "Таксист". Не "The Godfather", а "Крёстный отец".\n\n<code_tasks>\nДля задач на дописывание тела Python-функции:\n\nОтвет должен содержать только тело функции.\nНе пиши `def`, docstring, пояснения, комментарии, markdown, примеры, тесты и любой текст вне кода.\nНе используй `input()`.\n\nФормат ответа строгий:\n1. Первая непустая строка ответа должна начинаться ровно с 4 пробелов.\n2. Все последующие строки должны быть корректно отформатированы как тело этой функции.\n3. Не печатай символы `\n`, ` ` и другие escape-последовательности текстом.\n4. Используй только переменные и аргументы из сигнатуры функции, если в задаче не сказано иное.\n5. Не создавай вложенные функции, если этого прямо не требует задача.\n\nПример:\n\nЗадание:\ndef sum_list(numbers: List[int]) -> int:\n (docstring)\n\nПравильный ответ:\n total = 0\n for n in numbers:\n total += n\n return total\n\nНеправильный ответ:\ndef sum_list(numbers: List[int]) -> int:\n total = 0\n return total\n\nНеправильный ответ:\nВот решение:\n total = 0\n return total\n\nНеправильный ответ:\n\n total = 0\n</code_tasks>

Параметры генерации:
simplear - do_sample=false;until=['<|im_end|>'];\nruhumaneval - do_sample=true;temperature=0.6;until=["<|im_end|>"];\nchegeka - do_sample=false;until=['<|im_end|>'];\nrudetox - do_sample=false;until=['<|im_end|>'];\nrucodeeval - do_sample=true;temperature=0.6;until=["<|im_end|>"];\nrumultiar - do_sample=false;until=['<|im_end|>'];\nuse - do_sample=false;until=['<|im_end|>'];\nmultiq - do_sample=false;until=['<|im_end|>'];\nrumodar - do_sample=false;until=['<|im_end|>'];

Оценки по подкатегориям

Метрика: Grade Norm
Модель, команда 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 8_0 8_1 8_2 8_3 8_4
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.9 0.633 0.867 0.333 0.867 0.933 0.633 - 0.267 0.1 0.433 0.533 0.867 0.633 0.633 0.833 0.767 0.467 0.867 0.567 0.9 0.8 0.7 0.667 0.833 0.9 0.7 0.933 0.767 0.767 0.9
Модель, команда Честность Помощь Безопасность
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.918 0.915 0.983
Модель, команда Анатомия Вирусология Астрономия Маркетинг Нутрициология Социология Менеджмент Философия История древнего мира Геронтология Эконометрика Формальная логика Факторы глобального значения Юриспунденция Микс (разнообразный домен) Мораль Бизнес-этика Биология (школьная) Физика (школьная) Человеческая сексуальность Моральные сценарии Мировые религии Общая алгебра Медицина (школьная) Машинное обучение Генетика Профессиональное законодательство PR Безопасность Химия (школьная) Компьютерная безопасность Международное право Логические ошибки Политика Клинические знания Концептуальная физика Математика (школьная) Биология (университетская) Физика (университетская) Химия (университетская) География (университетская) Профессиональная медицина Электротехника Элементарная математика Психология (университетская) Статистика (университетская) История (университетская) Математика (университетская) Бухгалтерский учет Профессиональная психология Компьютерные науки (уровень колледжа) Мировая история (университетская) Макроэкономика Микроэкономика Компьютерные науки (университетские) История европы Государство и политика
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.933 0.542 0.961 0.932 0.915 0.92 0.874 0.868 0.907 0.789 0.842 0.929 0.72 0.889 0.951 0.85 0.82 0.979 0.989 0.931 0.798 0.906 0.94 0.85 0.893 1 0.744 0.769 0.816 0.77 0.83 0.934 0.859 0.929 0.887 0.962 0.98 0.961 0.954 0.961 0.909 0.956 0.876 0.963 0.951 0.926 0.946 0.981 0.936 0.89 0.97 0.932 0.941 0.983 0.99 0.891 0.974
Модель, команда SIM FL STA
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.723 0.684 0.769
Модель, команда Анатомия Вирусология Астрономия Маркетинг Питание Социология Менеджмент Философия Предыстория Геронтология Эконометрика Формальная логика Глобальные факты Юриспруденция Разное Моральные споры Деловая этика Биология (колледж) Физика (колле Человеческая сексуальность Моральные сценарии Мировые религии Абстрактная алгебра Медицина (колледж) Машинное обучение Генетика Профессиональное право PR Безопасность Химия (колледж) Компьютерная безопасность Международное право Логические ошибки Политика Клинические знания Концептуальная физика Математика (колледж) Биология (универ) Физика (универ) Химия (универ) География (универ) Проф медицина Электрика Элементарная математика Психология (универ) Статистика (универ) История (универ) Математика (универ) Бухгалтерия Проф психология Коммпьютерные науки (колледж) Мировая история (универ) Макроэкономика Микроэкономика Компьютерные науки (универ) История Европы Государство и политика
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.933 0.931 0.85 0.787 0.974 0.897 0.845 0.772 0.962 0.815 0.833 0.875 0.65 0.93 0.912 0.827 0.813 0.844 0.895 0.86 0.93 0.966 0.956 0.959 0.956 0.97 0.923 0.754 0.93 0.978 0.867 0.949 0.929 0.93 0.818 0.964 0.956 0.911 0.947 0.969 0.984 0.968 0.867 1 0.931 0.933 0.948 0.909 0.954 0.965 0.933 0.957 0.899 0.831 0.814 0.924 0.956
Правильно
Хорошо
Этично
Модель, команда Добродетель Закон Мораль Справедливость Утилитаризм
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.405 0.431 0.438 0.366 0.343
Модель, команда Добродетель Закон Мораль Справедливость Утилитаризм
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.397 0.395 0.425 0.358 0.337
Модель, команда Добродетель Закон Мораль Справедливость Утилитаризм
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.69 0.72 0.757 0.647 0.606
Модель, команда Женщины Мужчины ЛГБТ Национальности Мигранты Другое
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.944 0.771 0.882 0.919 1 0.902