Модель BerryLM-XL от RWB вошла в топ-3 русскоязычного бенчмарка MERA

Дообученная RWB модель приблизилась к человеческому бенчмарку 0,852 и замкнула топ-3 текстового рейтинга MERA. Разбираем цифры и продуктовое применение BerryLM.

Обложка: Модель BerryLM-XL от RWB вошла в топ-3 русскоязычного бенчмарка MERA

Если следите за русскоязычными большими языковыми моделями — обратите внимание: команда RWB дообучила модель BerryLM-XL, которая заняла третье место в текстовом рейтинге независимого бенчмарка MERA. По итогам 15 заданий она набрала 0,835 — всего в шаге от человеческого бенчмарка 0,852.

Кратко

BerryLM-XL заняла 3-е место в общем рейтинге MERA и 2-е среди ИИ-моделей.

Интегральная оценка — 0,835, эталон Human Benchmark — 0,852.

Вторая модель семейства, BerryLM-v2, с результатом 0,810 замкнула топ-5.

Модели применяются в продуктах Wildberries и приносят компании более 1 млрд рублей дополнительной выручки в год.

Что известно

MERA (Multimodal Evaluation for Russian-language Architectures) — открытый бенчмарк для оценки моделей, работающих с русским языком. Текстовый рейтинг строится на единой методологии с фиксированными заданиями и параметрами: модели проверяют на понимание текста, знания, логику и прикладные задачи.

BerryLM-XL получила интегральный балл 0,835. Для сравнения: Human Benchmark — эталонная оценка, рассчитанная на ответах людей на те же задания, — составил 0,852. Таким образом, дообученная RWB модель приблизилась к человеческому уровню на одном из крупнейших русскоязычных тестов.

Помимо BerryLM-XL, в топ-5 вошла ещё одна модель семейства — BerryLM-v2. Она набрала 0,810 и заняла пятое место в лидерборде.

Характеристики BerryLM-XL

  • Архитектура: MoE-модель с 358 млрд параметров.
  • Тип: закрытая модель с дообучением SFT и упором на reasoning.
  • Контекст: до 202 000 токенов.
  • Post-training: вариант GRPO с двумя reward-функциями для контроля качества рассуждений.

Где применяются модели BerryLM

Семейство BerryLM работает в продуктах Wildberries: ИИ-ассистент для покупателей, сравнение и поиск товаров, инструменты для продавцов — подготовка ответов на отзывы и вопросы. Кроме того, модели автоматизируют внутренние процессы RWB. По внутренней оценке компании, суммарный эффект от ИИ-инструментов на базе BerryLM превышает 1 млрд рублей дополнительной выручки в год.

Для нас важна не только позиция модели в бенчмарке, но и её эффективность в реальных продуктах. Мы дообучаем модели под конкретные сценарии маркетплейса — от поиска и сравнения товаров до инструментов для продавцов — и измеряем их влияние на продуктовые и бизнес-метрики.
Павел Раваевдиректор по данным RWB
			{
  "model": "BerryLM-XL",
  "overall_score": 0.835,
  "human_baseline": 0.852,
  "mera_rank": 3,
  "ai_models_rank": 2,
  "parameters": "358B",
  "context": 202000
}
		

Вопросы и ответы

Вопросы и ответы
1
Что такое MERA?

MERA — открытый независимый бенчмарк для оценки моделей, работающих с русским языком. Платформа проверяет текстовые, кодовые, отраслевые и мультимодальные навыки по единой методологии.

2
Почему результат BerryLM-XL важен?

Интегральная оценка 0,835 сопоставима с показателями ведущих мировых моделей Anthropic и OpenAI. Это показывает, что российская дообученная модель приблизилась к человеческому бенчмарку 0,852.

3
Кто разработал BerryLM-XL?

Модель создана командой RWB — технологического подразделения Wildberries. Она дообучена для сценариев маркетплейса и внутренних процессов компании.

Выводы

BerryLM-XL подтвердила уровень мировых LLM на русскоязычном бенчмарке. Главное же, по словам представителей RWB, — не сама позиция в рейтинге, а то, что модель приносит измеримый бизнес-эффект: покупатели получают более точные ответы, продавцы экономят время, а компания наращивает выручку. Подробные цифры и методику оценки можно посмотреть на странице сабмита BerryLM-XL на MERA.

Источники

Рекомендуем