Модель BerryLM-XL от RWB вошла в топ-3 русскоязычного бенчмарка MERA
Дообученная RWB модель приблизилась к человеческому бенчмарку 0,852 и замкнула топ-3 текстового рейтинга MERA. Разбираем цифры и продуктовое применение BerryLM.
Новости TprogerЕсли следите за русскоязычными большими языковыми моделями — обратите внимание: команда RWB дообучила модель BerryLM-XL, которая заняла третье место в текстовом рейтинге независимого бенчмарка MERA. По итогам 15 заданий она набрала 0,835 — всего в шаге от человеческого бенчмарка 0,852.
Кратко
BerryLM-XL заняла 3-е место в общем рейтинге MERA и 2-е среди ИИ-моделей.
Интегральная оценка — 0,835, эталон Human Benchmark — 0,852.
Вторая модель семейства, BerryLM-v2, с результатом 0,810 замкнула топ-5.
Модели применяются в продуктах Wildberries и приносят компании более 1 млрд рублей дополнительной выручки в год.
Что известно
MERA (Multimodal Evaluation for Russian-language Architectures) — открытый бенчмарк для оценки моделей, работающих с русским языком. Текстовый рейтинг строится на единой методологии с фиксированными заданиями и параметрами: модели проверяют на понимание текста, знания, логику и прикладные задачи.
BerryLM-XL получила интегральный балл 0,835. Для сравнения: Human Benchmark — эталонная оценка, рассчитанная на ответах людей на те же задания, — составил 0,852. Таким образом, дообученная RWB модель приблизилась к человеческому уровню на одном из крупнейших русскоязычных тестов.
Помимо BerryLM-XL, в топ-5 вошла ещё одна модель семейства — BerryLM-v2. Она набрала 0,810 и заняла пятое место в лидерборде.
Характеристики BerryLM-XL
- Архитектура: MoE-модель с 358 млрд параметров.
- Тип: закрытая модель с дообучением SFT и упором на reasoning.
- Контекст: до 202 000 токенов.
- Post-training: вариант GRPO с двумя reward-функциями для контроля качества рассуждений.
Где применяются модели BerryLM
Семейство BerryLM работает в продуктах Wildberries: ИИ-ассистент для покупателей, сравнение и поиск товаров, инструменты для продавцов — подготовка ответов на отзывы и вопросы. Кроме того, модели автоматизируют внутренние процессы RWB. По внутренней оценке компании, суммарный эффект от ИИ-инструментов на базе BerryLM превышает 1 млрд рублей дополнительной выручки в год.
Для нас важна не только позиция модели в бенчмарке, но и её эффективность в реальных продуктах. Мы дообучаем модели под конкретные сценарии маркетплейса — от поиска и сравнения товаров до инструментов для продавцов — и измеряем их влияние на продуктовые и бизнес-метрики.
Вопросы и ответы
Вопросы и ответы
Что такое MERA?
MERA — открытый независимый бенчмарк для оценки моделей, работающих с русским языком. Платформа проверяет текстовые, кодовые, отраслевые и мультимодальные навыки по единой методологии.
Почему результат BerryLM-XL важен?
Интегральная оценка 0,835 сопоставима с показателями ведущих мировых моделей Anthropic и OpenAI. Это показывает, что российская дообученная модель приблизилась к человеческому бенчмарку 0,852.
Кто разработал BerryLM-XL?
Модель создана командой RWB — технологического подразделения Wildberries. Она дообучена для сценариев маркетплейса и внутренних процессов компании.
Выводы
BerryLM-XL подтвердила уровень мировых LLM на русскоязычном бенчмарке. Главное же, по словам представителей RWB, — не сама позиция в рейтинге, а то, что модель приносит измеримый бизнес-эффект: покупатели получают более точные ответы, продавцы экономят время, а компания наращивает выручку. Подробные цифры и методику оценки можно посмотреть на странице сабмита BerryLM-XL на MERA.