Что такое быстрые ответы и при чём тут модель
Быстрый ответ Алисы это текст над результатами поиска Яндекса, который собирает ответ из найденных страниц. По описанию самой команды, это самый массовый генеративный продукт Яндекса: ответ должен приходить за секунды даже в час пиковой нагрузки.
Внутри работает цепочка из нескольких моделей: одна ищет документы, другая вырезает из них только нужные фрагменты, третья пишет ответ. Модель, которую открыли, это основа третьего звена: базовая версия, прошедшая первый этап обучения на общих данных и ещё не настроенная под ответы пользователям.
Открытая модель в этом контексте означает, что файлы с её обученными параметрами выложены публично, их можно скачать и запустить на своём сервере. Чем открытые модели отличаются от закрытых и зачем это бизнесу, разбирали в статье про открытые нейросети.
Что произошло
10 сентября 2026 года на Hugging Face появилась карточка модели yandex/AliceAI-T5-35B-A0.6B. 11 сентября команда Alice AI Search опубликовала разбор на Хабре: как устроен быстрый ответ, зачем совместили энкодер-декодер с разреженной архитектурой и что изменилось в июньском релизе.
Что указано в карточке модели:
- энкодер-декодер с MoE-слоями: 34,35 млрд уникальных параметров, 512 экспертов в каждом MoE-слое, для каждого токена выбираются 8;
- энкодер 16 слоёв, декодер 12 слоёв, размер словаря 135 040;
- контекст 128 тысяч токенов;
- лицензия Apache 2.0, файл лицензии лежит в репозитории;
- можно загрузить отдельно только энкодер, есть раздел «как дообучить под свои задачи».
В статье на Хабре оговорка: внешним пользователям доступен запуск через библиотеку Hugging Face Transformers, а оптимизированный быстрый запуск, который держит нагрузку поиска, пока работает только внутри Яндекса. Издание 3DNews добавляет по материалам компании: из 35 млрд параметров на обработку одного токена подключаются около 600 млн, меньше 2% от объёма, и слепые тесты показали качество выше, чем у Qwen 3.5 2B и 4B и T5 Gemma 2 4B, примерно на уровне Qwen 3.5 35B-A3B.
Термины из списка. MoE, или смесь экспертов, означает, что модель состоит из многих небольших блоков, и для каждого токена работают только несколько из них, поэтому большая модель считает быстро. Энкодер-декодер это устройство, где одна часть читает и сжимает входной текст, а другая пишет ответ.
Цифры, которые называет Яндекс
| Показатель | Значение |
|---|---|
| Уникальных параметров | 34,35 млрд |
| Активных на токен | около 600 млн |
| Экспертов в MoE-слое / выбирается | 512 / 8 |
| Контекст | 128 тысяч токенов |
| Словарь | 135 040 токенов |
| Лицензия | Apache 2.0 |
| Дата публикации | 10 сентября 2026 |
Из таблицы бенчмарков в карточке: на тесте WikiWebFacts модель набирает 81,3 против 62,4 у Qwen 3.5 35B-A3B, на тесте длинного контекста Ruler 32K 94,7 против 93,0, а на MMLU (общий тест знаний из вопросов по десяткам школьных и вузовских предметов) уступает: 78,5 против 84,4. Замеры внутренние, сделаны самим Яндексом, независимых пока нет.
Что это значит бизнесу
Первое: появилась открытая модель от российского поисковика, которую можно запустить у себя. Для компаний, где переписку с клиентами нельзя отправлять на чужие серверы, это ещё один вариант рядом с Qwen, DeepSeek и Mistral. Лицензия Apache 2.0 разрешает коммерческое использование и изменение модели; что она требует взамен, разбирали в статье про Apache License 2.0.
Второе: это не готовый чат. Базовая модель продолжает текст и хорошо помнит факты, но отвечать на вопросы в диалоге её надо дообучать на своих примерах. В карточке есть инструкция, но для этого нужны разработчик, данные и сервер с видеокартами. Малому бизнесу проще взять готовую модель через API или платформу, о чём есть разбор в статье LLM: что это.
Третье: модель сильна ровно в том, для чего сделана. Высокие результаты на тестах фактов и длинного контекста при среднем результате на общем тесте знаний MMLU означают, что она хорошо извлекает и сжимает информацию из документов. Это задачи поддержки, поиска по базе знаний, ответов по инструкциям. Для рассуждений и кода есть модели сильнее.
Четвёртое: понимание того, как устроены быстрые ответы, полезно каждому, кто хочет в них попасть. Из разбора на Хабре видно, что модель-экстрактор оставляет из найденной страницы только фрагменты, которые помогают ответить. Страница без чётких фактов в такой фильтр не проходит. Как работает Алиса AI с точки зрения бизнеса, разбирали отдельно.
Что делать уже сейчас
- Если у вас есть команда разработки и запрет на внешние API, добавить модель в список кандидатов и проверить на 20 своих задачах по извлечению фактов из документов.
- Если команды нет, ничего не запускать: пользы от базовой модели без дообучения не будет. Взять готовую модель через API или платформу.
- Всем, кто зависит от поиска Яндекса: проверить, как ваши страницы выглядят в быстрых ответах по 5 главным запросам, и добавить на страницы факты, которые модель сможет извлечь: цены, сроки, характеристики.
- Следить за независимыми замерами: внутренние тесты Яндекса показывают сильные и слабые места, но сравнение с Qwen и Gemma сделано самой компанией.
Чего ждать
Яндекс открыл базовую версию, и логичный следующий шаг, дообученная под ответы модель, в сообщении не обещан. Стоит следить за тем, появятся ли дообученные версии от сообщества на Hugging Face и войдёт ли модель в каталоги вроде OpenRouter, где её можно будет попробовать без своего сервера. Второй вопрос: цена. Разреженная архитектура обещает дешёвый запуск, и если модель появится у российских облаков по цене ниже YandexGPT Lite, это изменит расчёты для тех, кто держит агентов на своих данных.
