BerryLM-L-v2-early-ckpt

Wildberrie&Russ Created at 14.04.2026 08:40
0.822
The overall result
5
Place in the rating
In the top by tasks:
6
RWSD
The result on the task is higher than human
The task is one of the main ones
8
RCB
The result on the task is higher than human
The task is one of the main ones
2
ruWorldTree
The result on the task is higher than human
The task is one of the main ones
4
ruOpenBookQA
The result on the task is higher than human
The task is one of the main ones
1
ruHHH
The result on the task is higher than human
3
ruHumanEval
5
USE
The result on the task is higher than human
The task is one of the main ones
2
MathLogicQA
The result on the task is higher than human
The task is one of the main ones
3
SimpleAr
3
BPS
5
ruModAr
The task is one of the main ones
6
MaMuRAMu
The result on the task is higher than human
The task is one of the main ones
2
ruCodeEval
The task is one of the main ones
+9
Hide
Weak tasks:
152
PARus
84
ruEthics
43
MultiQ
22
CheGeKa
21
ruDetox
+1
Hide

Ratings for leaderboard tasks

The table will scroll to the left

Task name Result Metric
LCS 0.618 Accuracy
RCB 0.605 / 0.606 Accuracy F1 macro
USE 0.722 Grade norm
RWSD 0.888 Accuracy
PARus 0.876 Accuracy
ruTiE 0.897 Accuracy
MultiQ 0.591 / 0.423 F1 Exact match
CheGeKa 0.505 / 0.435 F1 Exact match
ruModAr 0.999 Exact match
MaMuRAMu 0.904 Accuracy
ruMultiAr 0.998 Exact match
ruCodeEval 0.848 / 0.896 / 0.909 Pass@k
MathLogicQA 0.998 Accuracy
ruWorldTree 0.996 / 0.996 Accuracy F1 macro
ruOpenBookQA 0.968 / 0.967 Accuracy F1 macro

Evaluation on open tasks:

Go to the ratings by subcategory

The table will scroll to the left

Task name Result Metric
BPS 1.0 Accuracy
ruMMLU 0.886 Accuracy
SimpleAr 1.0 Exact match
ruHumanEval 0.829 / 0.868 / 0.872 Pass@k
ruHHH 0.938
ruHateSpeech 0.906
ruDetox 0.366
ruEthics
Correct God Ethical
Virtue 0.405 0.397 0.69
Law 0.431 0.395 0.72
Moral 0.438 0.425 0.757
Justice 0.366 0.358 0.647
Utilitarianism 0.343 0.337 0.606

Information about the submission

Mera version
v1.2.0
Torch Version
2.9.0
The version of the codebase
0cabf9d
CUDA version
12.8
Precision of the model weights
bf16
Seed
1234
Batch
1
Transformers version
4.57.6
The number of GPUs and their type
1 x NVIDIA A800 80GB PCIe
Architecture
local-chat-completions

Team:

Wildberrie&Russ

Name of the ML model:

BerryLM-L-v2-early-ckpt

Model size

120

Model type:

Closed

SFT

MoE

Architecture description:

reasoning-ориентированная модель, дообученная для сценариев с длинным контекстом, раздельной генерацией внутреннего рассуждения и финального ответа, а также повышенными требованиями к качеству финального текстового вывода.

Description of the training:

В post-training используется DAPO - один из вариантов семейства GRPO, адаптированный под сценарии, где нужно одновременно контролировать качество ответа и форму reasoning-процесса. В рабочем контуре используется компактная система из двух reward-функций с весами 0.8 / 0.2, собранная вокруг задачи предотвращения reward hacking.

Pretrain data:

Обучение проводится на миксе закрытых и открытых датасетов. Полный состав датасетного микса не раскрывается, однако по структуре данные представляют собой: диалоговые примеры в формате messages; пары prompt -> Ground Truth; примеры, в которых важны как качество reasoning, так и корректность финального ответа; данные, пригодные для post-training в режиме instruction following и коррекции ответа. Такой формат позволяет одновременно оптимизировать: содержательную близость финального ответа к эталону; профиль reasoning по длине и плотности; устойчивость к избыточной генерации и зацикливанию; качество ответа в диалоговом формате.

License:

Proprietary

Inference parameters

System prompt:
## System Instructions\nFollow all these rules strictly\n\n### Thinking Rules\nReasoning effort: Medium\nТы можешь рассуждать, анализировать и думать в любом формате, но КРАТКО. Надо получить лучший ответ за минимальное количество шагов.\nНЕ выполняй пошаговые вычисления, перебор, заполнение таблиц или ручное моделирование алгоритмов.\nЕсли задача требует вычислений (DP, арифметика, логика) — рассуждай на уровне идеи и оценки, а не пошагового перебора.\nРассуждения должны занимать НЕ БОЛЕЕ нескольких абзацев. Затем СРАЗУ дай финальный ответ.\nОднако ФИНАЛЬНЫЙ ОТВЕТ должен строго соответствовать требованиям задачи.\n\n### Critical Rules\n- Выполняй инструкции пользователя ДОСЛОВНО и БУКВАЛЬНО\n- Если в задании указан конкретный формат ответа — следуй ему СТРОГО\n- Не изменяй и не "улучшай" требуемый формат задачи\n\n### Output Format\nФинальный ответ выводи только в запрошенном формате без дополнительных объяснений.\nЕсли нужна буква - пиши только букву. Если нужна цифра - пиши только цифру. Если нужно число - пиши только число.\nНе используй markdown форматирование, звездочки или другие символы в ответе.\n\n### Few-shot Format\nТебе могут быть даны примеры решения задачи (few-shot). Примеры показывают формат ответа.\nВАЖНО: Иногда сама задача, которую нужно решить, уже содержится среди примеров — в этом случае ты должен дать ответ на неё, а не продолжать генерировать новые примеры.\nОтвечай только на последний вопрос/задачу.\n\n### Language Rules\nЕсли в ответе требуется название фильма, книги или другого произведения - пиши его ТОЛЬКО НА РУССКОМ ЯЗЫКЕ.\nНапример, не "Taxi Driver", а "Таксист". Не "The Godfather", а "Крёстный отец".\n\n<code_tasks>\nДля задач на дописывание тела Python-функции:\n\nОтвет должен содержать только тело функции.\nНе пиши `def`, docstring, пояснения, комментарии, markdown, примеры, тесты и любой текст вне кода.\nНе используй `input()`.\n\nФормат ответа строгий:\n1. Первая непустая строка ответа должна начинаться ровно с 4 пробелов.\n2. Все последующие строки должны быть корректно отформатированы как тело этой функции.\n3. Не печатай символы `\n`, ` ` и другие escape-последовательности текстом.\n4. Используй только переменные и аргументы из сигнатуры функции, если в задаче не сказано иное.\n5. Не создавай вложенные функции, если этого прямо не требует задача.\n\nПример:\n\nЗадание:\ndef sum_list(numbers: List[int]) -> int:\n (docstring)\n\nПравильный ответ:\n total = 0\n for n in numbers:\n total += n\n return total\n\nНеправильный ответ:\ndef sum_list(numbers: List[int]) -> int:\n total = 0\n return total\n\nНеправильный ответ:\nВот решение:\n total = 0\n return total\n\nНеправильный ответ:\n\n total = 0\n</code_tasks>

Generation Parameters:
simplear - do_sample=false;until=['<|im_end|>'];\nruhumaneval - do_sample=true;temperature=0.6;until=["<|im_end|>"];\nchegeka - do_sample=false;until=['<|im_end|>'];\nrudetox - do_sample=false;until=['<|im_end|>'];\nrucodeeval - do_sample=true;temperature=0.6;until=["<|im_end|>"];\nrumultiar - do_sample=false;until=['<|im_end|>'];\nuse - do_sample=false;until=['<|im_end|>'];\nmultiq - do_sample=false;until=['<|im_end|>'];\nrumodar - do_sample=false;until=['<|im_end|>'];

Ratings by subcategory

Metric: Grade Norm
Model, team 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 8_0 8_1 8_2 8_3 8_4
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.9 0.633 0.867 0.333 0.867 0.933 0.633 - 0.267 0.1 0.433 0.533 0.867 0.633 0.633 0.833 0.767 0.467 0.867 0.567 0.9 0.8 0.7 0.667 0.833 0.9 0.7 0.933 0.767 0.767 0.9
Model, team Honest Helpful Harmless
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.918 0.915 0.983
Model, team Anatomy Virology Astronomy Marketing Nutrition Sociology Management Philosophy Prehistory Human aging Econometrics Formal logic Global facts Jurisprudence Miscellaneous Moral disputes Business ethics Biology (college) Physics (college) Human Sexuality Moral scenarios World religions Abstract algebra Medicine (college) Machine learning Medical genetics Professional law PR Security studies Chemistry (школьная) Computer security International law Logical fallacies Politics Clinical knowledge Conceptual_physics Math (college) Biology (high school) Physics (high school) Chemistry (high school) Geography (high school) Professional medicine Electrical engineering Elementary mathematics Psychology (high school) Statistics (high school) History (high school) Math (high school) Professional accounting Professional psychology Computer science (college) World history (high school) Macroeconomics Microeconomics Computer science (high school) European history Government and politics
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.933 0.542 0.961 0.932 0.915 0.92 0.874 0.868 0.907 0.789 0.842 0.929 0.72 0.889 0.951 0.85 0.82 0.979 0.989 0.931 0.798 0.906 0.94 0.85 0.893 1 0.744 0.769 0.816 0.77 0.83 0.934 0.859 0.929 0.887 0.962 0.98 0.961 0.954 0.961 0.909 0.956 0.876 0.963 0.951 0.926 0.946 0.981 0.936 0.89 0.97 0.932 0.941 0.983 0.99 0.891 0.974
Model, team SIM FL STA
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.723 0.684 0.769
Model, team Anatomy Virology Astronomy Marketing Nutrition Sociology Managment Philosophy Pre-History Gerontology Econometrics Formal logic Global facts Jurisprudence Miscellaneous Moral disputes Business ethics Bilology (college) Physics (college) Human sexuality Moral scenarios World religions Abstract algebra Medicine (college) Machine Learning Genetics Professional law PR Security Chemistry (college) Computer security International law Logical fallacies Politics Clinical knowledge Conceptual physics Math (college) Biology (high school) Physics (high school) Chemistry (high school) Geography (high school) Professional medicine Electrical Engineering Elementary mathematics Psychology (high school) Statistics (high school) History (high school) Math (high school) Professional Accounting Professional psychology Computer science (college) World history (high school) Macroeconomics Microeconomics Computer science (high school) Europe History Government and politics
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.933 0.931 0.85 0.787 0.974 0.897 0.845 0.772 0.962 0.815 0.833 0.875 0.65 0.93 0.912 0.827 0.813 0.844 0.895 0.86 0.93 0.966 0.956 0.959 0.956 0.97 0.923 0.754 0.93 0.978 0.867 0.949 0.929 0.93 0.818 0.964 0.956 0.911 0.947 0.969 0.984 0.968 0.867 1 0.931 0.933 0.948 0.909 0.954 0.965 0.933 0.957 0.899 0.831 0.814 0.924 0.956
Coorect
Good
Ethical
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.405 0.431 0.438 0.366 0.343
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.397 0.395 0.425 0.358 0.337
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.69 0.72 0.757 0.647 0.606
Model, team Women Men LGBT Nationalities Migrants Other
BerryLM-L-v2-early-ckpt
Wildberrie&amp;Russ
0.944 0.771 0.882 0.919 1 0.902