Рейтинг российских нейросетей: GigaChat, Alice AI LLM, T-pro-it - лидеры ИИ-инструментов
К списку новостей

Рейтинг российских нейросетей: лидеры и ориентиры для ИИ-инструментов


Открытый международный бенчмарк сравнил 112 языковых моделей по живым голосованиям пользователей. Среди российских разработок картина оказалась неоднородной. Один продукт держится в топ-10 мирового рейтинга, остальные - в середине и нижней части таблицы. Для тех, кто выбирает ИИ-инструменты для бизнеса, эти данные дают конкретную точку отсчёта.

Как устроен рейтинг: не синтетика, а живые голоса

Платформа LLM Arena строит рейтинг иначе, чем классические бенчмарки с правильными ответами. Пользователь задаёт вопрос и получает два ответа от анонимных моделей - без логотипов и названий. Затем выбирает лучший ответ или фиксирует ничью. Результаты обрабатываются по модели Брэдли-Терри - той же математической схеме, что лежит в основе шахматного рейтинга Эло. Чем сильнее соперник, которого модель «обыгрывает», тем больше очков она получает.

На момент фиксации данных в рейтинге накопилось свыше 157 тысяч голосований по 112 моделям. Это не лабораторный тест на заранее подготовленных задачах. Это агрегированное мнение реальных людей с разнообразными запросами: от кода и рассуждений до творческих текстов и фактических вопросов. Именно поэтому позиция в таком рейтинге говорит о практической полезности модели точнее, чем балл на узком академическом датасете.

Важная методологическая деталь: анонимность моделей при голосовании устраняет эффект бренда. Пользователь не знает, ответ какой компании перед ним, и голосует исключительно за качество текста. Это делает рейтинг устойчивым к маркетинговому шуму.

Статистическая строгость подхода подтверждается и академическими работами. Исследователи указывают, что привычные метрики для языковых моделей часто разрознены и зависят от конкретных датасетов. Вероятностные модели на основе попарных сравнений позволяют делать статистически обоснованные выводы о превосходстве одной системы над другой с учётом вариативности ответов.

Кто из российских моделей где стоит

Среди российских разработок в рейтинге представлены продукты нескольких компаний. Сравнивать их корректно только при одном условии: берётся актуальная флагманская версия каждого игрока, заявленная как основной публичный или коммерческий продукт.

По этому критерию расстановка выглядит так:

  • GigaChat 3.5 (Сбер) - 7-е место среди 112 моделей, Arena Elo 1130. Модель с открытой лицензией. В рейтинге присутствует около десяти версий GigaChat разных поколений, но именно 3.5 - флагман.
  • Alice AI LLM (Яндекс) - 19-е место, Elo 1069. Ассистентская модель Яндекса заметно опережает базовую линейку YandexGPT: версия YandexGPT 5.1 Pro с наивысшим показателем в линейке занимает лишь 55-е место с Elo 985. Разрыв в 84 пункта Elo - это существенно.
  • T-pro-it-2.0 (Т-Банк) - 36-е место, Elo 1024, открытая лицензия. Более ранние версии T-lite и T-pro находятся на 72-м и 59-м местах соответственно.

Отдельно в рейтинге присутствуют модели независимых исследовательских команд - линейки saiga, RefalMachine и Vikhrmodels. Они занимают места в диапазоне от 56-го до 93-го. Однако прямое сравнение этих моделей с корпоративными продуктами некорректно: за ними стоят разные масштабы ресурсов, разные цели разработки и разная степень продуктовой полировки.

Что означает 7-е место GigaChat в мировом контексте

Седьмая строчка из 112 - это не просто высокая позиция внутри российского сегмента. GigaChat 3.5 соседствует в таблице с глобальными флагманами и при этом опережает несколько версий моделей из топовых международных линеек. Это означает, что по критерию живых пользовательских предпочтений модель конкурентоспособна на мировом уровне.

Для практического применения это важно по нескольким причинам. Во-первых, модель с открытой лицензией в топ-10 - редкость: большинство лидеров рейтинга являются проприетарными системами с закрытым доступом к весам. Открытость означает возможность локального развёртывания, тонкой настройки под конкретные задачи и отсутствие зависимости от внешнего API.

Во-вторых, высокая позиция именно в краудсорсном рейтинге говорит о том, что модель хорошо справляется с разнообразными запросами на русском языке - не только с академическими тестами, но и с реальными пользовательскими сценариями. Это принципиально для любого бизнес-применения, где модель обрабатывает неструктурированный пользовательский ввод.

В-третьих, присутствие в рейтинге десяти версий GigaChat - от экспериментальных 3.1.x до флагманской 3.5 - показывает активный цикл разработки. Это косвенный сигнал о том, что модель продолжает улучшаться, а не законсервирована.

Парадокс Яндекса: ассистент сильнее базовой модели

Разрыв между Alice AI LLM (19-е место, Elo 1069) и YandexGPT 5.1 Pro (55-е место, Elo 985) заслуживает отдельного внимания. Обычно логика такова: базовая модель - фундамент, ассистентская версия - надстройка над ней. Но в рейтинге предпочтений пользователей картина обратная.

Объяснение, скорее всего, в том, что ассистентская модель прошла более глубокое выравнивание по человеческим предпочтениям (RLHF или аналогичные техники), что напрямую влияет на качество ответов в диалоговых сценариях. Краудсорсный рейтинг измеряет именно это: насколько ответ нравится живому человеку, а не насколько он точен по формальным метрикам.

Для тех, кто выбирает модель под конкретную задачу, это важный урок: позиция базовой модели в академических бенчмарках и позиция ассистентской версии в пользовательских рейтингах - разные показатели, и подменять один другим нельзя.

Как работает попарное сравнение и почему это надёжнее балльных оценок

Методология попарных сравнений имеет статистическое преимущество перед классическим подходом «оцени ответ по шкале от 1 до 5». Когда человека просят поставить оценку, он опирается на внутреннюю шкалу, которая у разных людей калибрована по-разному. Когда его просят выбрать предпочтительный из двух ответов - задача становится проще, и результаты между аннотаторами согласуются лучше.

Ещё более информативен формат best-worst scaling (BWS): аннотатору показывают сразу несколько ответов (например, четыре) и просят отметить наиболее и наименее удачный. Одна такая аннотация несёт больше ранжировочной информации, чем четыре отдельные оценки по шкале, потому что фиксирует относительные позиции сразу нескольких объектов.

Именно такие подходы лежат в основе современных систем оценки языковых моделей. Собранные голосования используются не только для построения рейтингов, но и как обучающие данные для дальнейшего выравнивания моделей по предпочтениям пользователей - замыкая цикл: чем больше голосов, тем точнее рейтинг, тем лучше данные для обучения следующих версий.

При этом исследователи честно признают ограничения подхода: краудсорсные голосования вносят естественную вариативность человеческих суждений, результаты зависят от состава аудитории платформы, а распределение запросов может смещаться в сторону определённых типов задач. Поэтому рейтинг следует читать как сигнал о качестве в широком спектре пользовательских сценариев, а не как абсолютную истину.

Что рейтинг говорит о применении ИИ в бизнесе

Для команд, которые выбирают языковую модель под конкретные бизнес-задачи - генерацию текстов, обработку обращений, аналитику - данные рейтинга дают несколько практических ориентиров.

Во-первых, позиция модели в краудсорсном рейтинге коррелирует с качеством в реальных диалоговых сценариях лучше, чем результаты на синтетических тестах. Если модель стабильно выигрывает у конкурентов в анонимных сравнениях живых пользователей - это сильный аргумент в пользу её применения там, где конечный потребитель оценивает текст субъективно.

Во-вторых, открытая лицензия у двух из трёх лидирующих российских моделей (GigaChat 3.5 и T-pro-it-2.0) - это практически значимый факт. Открытые модели можно дообучить на отраслевых данных, развернуть локально и интегрировать в собственную инфраструктуру без зависимости от внешнего провайдера.

В-третьих, разрыв между моделями внутри одной компании (как в случае с Яндексом) напоминает: при выборе инструмента важно тестировать именно ту версию, которую планируете использовать, а не ориентироваться на репутацию бренда в целом.

Для задач, где модель работает с пользовательскими текстами в потоке - например, в системах автоматизации ответов на отзывы или аналитики отзывов маркетплейсов - качество генерации напрямую влияет на то, насколько ответ воспринимается покупателем как живой и уместный. Именно здесь разница в 100+ пунктов Elo между моделями становится ощутимой на практике.

Как применить эти данные прямо сейчас

Если вы выбираете или переоцениваете ИИ-инструменты для своей команды, вот конкретные шаги на основе данных рейтинга.

Что делать:

  • Сверяйтесь с актуальной версией рейтинга, а не с результатами полугодовой давности: модели обновляются быстро, и позиции меняются. Смотрите на конкретную версию модели, а не на название линейки.
  • Тестируйте ассистентскую и базовую версии модели раздельно, если поставщик предлагает обе. Как показывает пример Яндекса, разрыв может быть существенным.
  • Если задача предполагает обработку русскоязычного пользовательского ввода в диалоговом режиме - краудсорсный рейтинг на живых голосованиях более релевантен, чем академические бенчмарки на английском.
  • Для задач, где нужна кастомизация или локальное развёртывание, обращайте внимание на тип лицензии: открытые модели в топе рейтинга - реальная альтернатива проприетарным API.

Типичные ошибки:

  • Ориентироваться на рейтинг базовой модели при выборе ассистентской версии - это разные продукты с разными характеристиками.
  • Считать исследовательские дообученные модели прямыми конкурентами коммерческим флагманам: за ними стоят принципиально разные ресурсы и цели разработки.
  • Принимать решение по одному бенчмарку. Краудсорсный рейтинг - сильный сигнал, но он отражает предпочтения конкретной аудитории платформы. Дополняйте его тестами на своих реальных данных.

На что смотреть при выборе:

  • Позиция в рейтинге + тип лицензии + активность обновлений модели - три параметра, которые вместе дают более полную картину, чем каждый по отдельности.
  • Если ваш сценарий - автоответы на отзывы или коммуникация с покупателями в потоке, проверьте, как модель справляется именно с короткими диалоговыми ответами на русском языке, а не только с длинными генерациями.

Сервисы вроде SaleSynergy, которые строят автоматизацию ответов на отзывы поверх языковых моделей, как раз решают задачу выбора и настройки модели «под капотом» - так что при оценке подобных инструментов стоит уточнять, какая модель используется в основе и как она обновляется вместе с развитием рейтингов.

Часто задаваемые вопросы

Как выбрать языковую модель для бизнеса, если нужно обрабатывать русскоязычные тексты?

Для задач, связанных с обработкой русскоязычного пользовательского ввода, особенно в диалоговом режиме, лучше ориентироваться на краудсорсные рейтинги, основанные на живых голосованиях. Они точнее отражают практическую полезность модели в реальных сценариях, чем академические бенчмарки на других языках.

Нужно ли тестировать разные версии языковых моделей от одного производителя?

Да, обязательно. Даже внутри одной компании разные версии моделей, например, базовая и ассистентская, могут существенно отличаться по качеству и занимать разные позиции в рейтингах. Важно тестировать именно ту версию, которую планируется использовать.

Чем отличаются открытые языковые модели от проприетарных?

Открытые модели имеют лицензию, позволяющую локальное развёртывание, тонкую настройку под специфические задачи и интеграцию в собственную инфраструктуру без зависимости от внешнего провайдера. Проприетарные модели обычно предоставляются через API и имеют закрытый доступ к своим внутренним механизмам.

На что обратить внимание при выборе языковой модели, если нужна кастомизация под отраслевые данные?

Для задач, требующих кастомизации или локального развёртывания, стоит отдавать предпочтение моделям с открытой лицензией. Это позволит дообучить их на ваших отраслевых данных и интегрировать в существующие системы.

Почему важно учитывать активность обновлений языковой модели при её выборе?

Активный цикл разработки и регулярные обновления модели свидетельствуют о том, что она постоянно улучшается и не является законсервированной. Это важно для долгосрочного использования, так как технологии ИИ быстро развиваются.

ДАВАЙТЕ ОБСУДИМ
ВАШУ ЗАДАЧУ