BerryLM-v2-reasoning-budget-low

Wildberries & Russ Created at 23.03.2026 13:46
0.81
The overall result
7
Place in the rating
In the top by tasks:
3
ruHHH
The result on the task is higher than human
4
LCS
The result on the task is higher than human
The task is one of the main ones
Weak tasks:
137
PARus
66
RCB
87
ruEthics
24
MultiQ
22
ruWorldTree
44
CheGeKa
25
ruDetox
47
ruTiE
23
SimpleAr
+5
Hide

Ratings for leaderboard tasks

The table will scroll to the left

Task name Result Metric
LCS 0.836 Accuracy
RCB 0.578 / 0.436 Accuracy F1 macro
USE 0.663 Grade norm
RWSD 0.838 Accuracy
PARus 0.882 Accuracy
ruTiE 0.866 Accuracy
MultiQ 0.616 / 0.468 F1 Exact match
CheGeKa 0.407 / 0.329 F1 Exact match
ruModAr 0.998 Exact match
MaMuRAMu 0.89 Accuracy
ruMultiAr 0.996 Exact match
ruCodeEval 0.663 / 0.895 / 0.915 Pass@k
MathLogicQA 0.994 Accuracy
ruWorldTree 0.99 / 0.99 Accuracy F1 macro
ruOpenBookQA 0.955 / 0.955 Accuracy F1 macro

Evaluation on open tasks:

Go to the ratings by subcategory

The table will scroll to the left

Task name Result Metric
BPS 0.999 Accuracy
ruMMLU 0.873 Accuracy
SimpleAr 0.999 Exact match
ruHumanEval 0.662 / 0.868 / 0.878 Pass@k
ruHHH 0.921
ruHateSpeech 0.909
ruDetox 0.352
ruEthics
Correct God Ethical
Virtue 0.383 0.437 0.628
Law 0.397 0.414 0.638
Moral 0.425 0.456 0.67
Justice 0.368 0.387 0.573
Utilitarianism 0.336 0.36 0.539

Information about the submission

Mera version
v1.2.0
Torch Version
2.9.0
The version of the codebase
0cabf9d
CUDA version
12.8
Precision of the model weights
fp8
Seed
1234
Batch
1
Transformers version
4.57.6
The number of GPUs and their type
1 x NVIDIA A800 80GB PCIe
Architecture
local-chat-completions

Team:

Wildberries & Russ

Name of the ML model:

BerryLM-v2-reasoning-budget-low

Model size

30.0B

Model type:

Closed

API

SFT

MoE

Architecture description:

Обновленная версия модели BerryLM. Рецепт alignment был упрощен. Сжатие Reasoning и улучшенная валидация ответа в RL стадии.

Description of the training:

DAPO. 2 reward функций. Instruct Model as is.

Pretrain data:

Микс открытых и закрытых данных

License:

proprietary

Inference parameters

Generation Parameters:
simplear - do_sample=false;until=['<|im_end|>']; \nchegeka - do_sample=false;until=['<|im_end|>']; \nrudetox - do_sample=false;until=['<|im_end|>']; \nruhumaneval - do_sample=true;temperature=0.6;until=["<|im_end|>"]; \nrumultiar - do_sample=false;until=['<|im_end|>']; \nrucodeeval - do_sample=true;temperature=0.6;until=["<|im_end|>"]; \nuse - do_sample=false;until=['<|im_end|>']; \nmultiq - do_sample=false;until=['<|im_end|>']; \nrumodar - do_sample=false;until=['<|im_end|>'];

System prompt:
## System Instructions \nFollow all these rules strictly \n \n### Thinking Rules \nReasoning effort: low \nТы можешь рассуждать, анализировать и думать в любом формате, но КРАТКО. Надо получить лучший ответ за минимальное количество шагов. \nНЕ выполняй пошаговые вычисления, перебор, заполнение таблиц или ручное моделирование алгоритмов. \nЕсли задача требует вычислений (DP, арифметика, логика) — рассуждай на уровне идеи и оценки, а не пошагового перебора. \nРассуждения должны занимать НЕ БОЛЕЕ нескольких абзацев. Затем СРАЗУ дай финальный ответ. \nОднако ФИНАЛЬНЫЙ ОТВЕТ должен строго соответствовать требованиям задачи. \n \n### Critical Rules \n- Выполняй инструкции пользователя ДОСЛОВНО и БУКВАЛЬНО \n- Если в задании указан конкретный формат ответа — следуй ему СТРОГО \n- Не изменяй и не "улучшай" требуемый формат задачи \n \n### Output Format \nФинальный ответ выводи только в запрошенном формате без дополнительных объяснений. \nЕсли нужна буква - пиши только букву. Если нужна цифра - пиши только цифру. Если нужно число - пиши только число. \nНе используй markdown форматирование, звездочки или другие символы в ответе. \n \n### Few-shot Format \nТебе могут быть даны примеры решения задачи (few-shot). Примеры показывают формат ответа. \nВАЖНО: Иногда сама задача, которую нужно решить, уже содержится среди примеров — в этом случае ты должен дать ответ на неё, а не продолжать генерировать новые примеры. \nОтвечай только на последний вопрос/задачу. \n \n### Language Rules \nЕсли в ответе требуется название фильма, книги или другого произведения - пиши его ТОЛЬКО НА РУССКОМ ЯЗЫКЕ. \nНапример, не "Taxi Driver", а "Таксист". Не "The Godfather", а "Крёстный отец". \n \n### Code Tasks \nДля задач на дописывание кода функции на языке Python: \n- Начинай ответ с 4 ПРОБЕЛОВ, затем сразу код (первая строка тела функции) \n- НИКОГДА не пиши литерально " \n" как текст - просто начинай с пробелов и кода \n- Начни ответ С ПУСТОЙ СТРОКИ, затем на новой строке пиши код с отступом 4 пробела \n- Используй только аргументы из сигнатуры функции в инструкции \n- НЕ пробуй считывать данные через функцию input \n- НЕ давай пояснений, НЕ пиши комментарии \n- НИКОГДА не пиши "def ..." - сигнатура функции УЖЕ ЕСТЬ в задании \n- НИКОГДА не повторяй docstring - он уже есть в задании \n- НЕ создавай вложенные функции \n- НЕ добавляй markdown (```python), примеры или тесты \n \nПример: \nЗадание: дописать тело функции после docstring \ndef sum_list(numbers: List[int]) -> int: \n (docstring с описанием задачи) \n \nПравильный ответ (ПУСТАЯ СТРОКА в начале, потом код с отступом): \n total = 0 \n for n in numbers: \n total += n \n return total \n \nНеправильный ответ (нет пустой строки в начале): \ndef sum_list(numbers: List[int]) -> int: \n total = 0 \n ...

Ratings by subcategory

Metric: Grade Norm
Model, team 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 8_0 8_1 8_2 8_3 8_4
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.667 0.7 0.833 0.367 0.567 0.933 0.6 - 0.133 0.2 0.467 0.333 0.8 0.733 0.467 0.733 0.8 0.433 0.833 0.5 0.7 0.7 0.767 0.6 0.733 0.867 0.6 0.833 0.767 0.8 0.733
Model, team Honest Helpful Harmless
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.852 0.915 1
Model, team Anatomy Virology Astronomy Marketing Nutrition Sociology Management Philosophy Prehistory Human aging Econometrics Formal logic Global facts Jurisprudence Miscellaneous Moral disputes Business ethics Biology (college) Physics (college) Human Sexuality Moral scenarios World religions Abstract algebra Medicine (college) Machine learning Medical genetics Professional law PR Security studies Chemistry (школьная) Computer security International law Logical fallacies Politics Clinical knowledge Conceptual_physics Math (college) Biology (high school) Physics (high school) Chemistry (high school) Geography (high school) Professional medicine Electrical engineering Elementary mathematics Psychology (high school) Statistics (high school) History (high school) Math (high school) Professional accounting Professional psychology Computer science (college) World history (high school) Macroeconomics Microeconomics Computer science (high school) European history Government and politics
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.904 0.56 0.961 0.885 0.902 0.925 0.864 0.849 0.917 0.776 0.816 0.952 0.63 0.87 0.943 0.815 0.8 0.965 0.989 0.924 0.787 0.906 0.95 0.89 0.884 1 0.701 0.722 0.812 0.76 0.88 0.926 0.822 0.97 0.906 0.953 0.98 0.958 0.947 0.951 0.934 0.945 0.848 0.96 0.946 0.907 0.926 0.989 0.876 0.864 0.96 0.916 0.949 0.983 0.97 0.897 0.933
Model, team SIM FL STA
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.707 0.685 0.762
Model, team Anatomy Virology Astronomy Marketing Nutrition Sociology Managment Philosophy Pre-History Gerontology Econometrics Formal logic Global facts Jurisprudence Miscellaneous Moral disputes Business ethics Bilology (college) Physics (college) Human sexuality Moral scenarios World religions Abstract algebra Medicine (college) Machine Learning Genetics Professional law PR Security Chemistry (college) Computer security International law Logical fallacies Politics Clinical knowledge Conceptual physics Math (college) Biology (high school) Physics (high school) Chemistry (high school) Geography (high school) Professional medicine Electrical Engineering Elementary mathematics Psychology (high school) Statistics (high school) History (high school) Math (high school) Professional Accounting Professional psychology Computer science (college) World history (high school) Macroeconomics Microeconomics Computer science (high school) Europe History Government and politics
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.867 0.921 0.833 0.833 0.947 0.862 0.81 0.772 0.942 0.831 0.808 0.833 0.608 0.899 0.877 0.84 0.832 0.844 0.912 0.825 0.895 0.966 0.956 0.959 0.978 0.939 0.91 0.737 0.965 0.956 0.867 0.91 0.946 0.965 0.803 0.946 0.956 0.889 0.912 0.954 0.963 0.952 0.844 0.978 0.914 0.933 0.931 0.932 0.938 0.947 0.956 0.971 0.873 0.805 0.814 0.854 0.967
Coorect
Good
Ethical
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.383 0.397 0.425 0.368 0.336
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.437 0.414 0.456 0.387 0.36
Model, team Virtue Law Moral Justice Utilitarianism
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.628 0.638 0.67 0.573 0.539
Model, team Women Men LGBT Nationalities Migrants Other
BerryLM-v2-reasoning-budget-low
Wildberries & Russ
0.972 0.8 0.765 0.892 1 0.902