Что такое открытая модель и почему вокруг Large 4 столько внимания
Большинство сильных нейросетей закрыты. Claude, ChatGPT и Gemini работают на серверах своих компаний: вы отправляете текст и получаете ответ, а сама модель, то есть огромный файл с числами, остаётся у разработчика. Открытыми называют модели, чьи веса опубликованы. Веса можно скачать и запустить на своём сервере, например, чтобы документы не уходили за границу.
Mistral AI делает ставку на открытость: её прошлая флагманская модель Large 3 вышла 2 декабря 2025 года с весами и лицензией Apache 2.0, которая разрешает коммерческое использование. Что значит запускать нейросеть у себя, мы разбирали в обзоре Gemma 4.
У Large 4 архитектура Mixture-of-Experts, «смесь экспертов». Внутри модели много специализированных блоков, и на каждое слово включается лишь часть. Поэтому в описании два числа: общее, 1,05 трлн параметров, и активное, около 49 млрд. Платите и ждёте вы по активной части, а хранить на сервере приходится всю модель.
Preview значит «пробная версия»: Mistral ещё дообучает модель и проверяет её вместе с партнёрами по кибербезопасности. Итоговые результаты могут измениться.
Что произошло: Large 4 доступна по API, веса обещаны
6 октября Mistral опубликовала анонс Large 4. Главное из него и из документации модели:
- Размер: 1,05 трлн параметров всего. Активных 49 млрд в анонсе и 52 млрд на странице документации на 7 октября. Mistral расхождение не объяснила.
- Контекст: 1 млн токенов по документации Mistral. В каталоге шлюза OpenRouter, через который мы запускали модель, окно 524 288 токенов. OpenRouter — сервис, где одним ключом вызывают модели разных компаний.
- Возможности: понимает текст и изображения, умеет вызывать функции и работать с документами. Обучалась на данных на 160 с лишним языках.
- Обучение: с нуля на 3 800 видеокартах NVIDIA Grace Blackwell в собственных дата-центрах Mistral в Европе. NVIDIA — американский производитель чипов для нейросетей.
- Веса: компания пишет, что выложит их к концу октября. Версия в документации помечена как 26.10.
- Красная команда: до публикации весов модель проверяют с партнёрами по кибербезопасности и государственными органами. Эти участники получают версию с ослабленной модерацией.
Прямую регистрацию в Mistral Studio из России мы не проверяли. Нашу проверку мы делали с российского сервера платформы Ноя через OpenRouter: модель ответила 7 октября.
Сколько стоит Large 4 в рублях
Цены Mistral на странице прайса: $0,68 за миллион токенов на входе, $0,07 на входе из кэша и $2,09 на выходе. Они показаны как «sale price», со скидкой 50% от $1,36, $0,14 и $4,18. Срока скидки на странице нет. У шлюза OpenRouter цены те же, $0,68 и $2,09.
Токены у разных моделей считаются по-разному, поэтому мы пересчитали цену в рубли за 1 000 знаков русского текста. Курс ЦБ на 7 октября: 85,7116 ₽ за доллар.
| Модель | Вход, ₽ за 1 000 знаков | Выход, ₽ за 1 000 знаков |
|---|---|---|
| Mistral Large 4 со скидкой | 0,015 | 0,046 |
| Mistral Large 4 по полной цене | 0,030 | 0,092 |
| Mistral Large 3 | 0,013 | 0,038 |
| Gemini 3.8 Flash | 0,016 | 0,081 |
| GPT-6.1 Sol | 0,043 | 0,214 |
| Claude Sonnet 5.5 | 0,069 | 0,344 |
Large 4 со скидкой в 2,9 раза дешевле GPT-6.1 Sol на входе и в 4,6 раза на выходе. По полной цене она всё равно дешевле Sol, но дороже Gemini 3.8 Flash. У Gemini цена действует до 31 декабря 2026 года, с 1 января вдвое выше. Large 3 стоит дешевле Large 4: $0,5 и $1,5 за миллион токенов.
Что модель умеет по данным самой Mistral
В анонсе много результатов тестов. Мы выбрали те, что понятны без специальной подготовки. Все цифры принадлежат Mistral. Часть из них, по анонсу, получена от сторонних оценщиков (Artificial Analysis, Surge AI, Lakera, vals.ai), но мы не сверяли их с отчётами этих компаний.
| Тест | Результат Large 4 |
|---|---|
| DeepSWE v1.1: правка кода в реальных репозиториях | 61,7% |
| Terminal-Bench 4.0: работа в терминале | 28,3% |
| CyberGym-E2E: воспроизвести уязвимость и исправить | 82%, первое место в таблице Mistral |
| Cybench: 40 задач с соревнований по безопасности | 93% |
| AutomationBench: 657 бизнес-процессов в Gmail, Sheets, Slack | 59,9% |
| Слепая оценка кода Surge AI, из 5 баллов | 3,74, второе место из 5 моделей |
| Lakera B3: устойчивость к атакам через текст | 93,3% |
В слепой оценке кода выше Large 4 стоит только Claude Opus 5 с 4,22 балла. В CyberGym-E2E Claude Opus 5.5 и GPT-6 Astra, по словам Mistral, получили почти ноль, потому что отказывались выполнять задание. Это значит, что тест измеряет и способности, и осторожность модели. Для бизнеса, где нет задач по взлому, эта строка менее показательна, чем остальные.
Наш замер: русский текст в токенах
Токен — кусочек текста, на которые нейросеть режет всё, что читает и пишет. Чем меньше токенов на русский текст, тем дешевле и тем больше помещается в окно контекста.
Мы взяли 3 прозаических русских текста из открытого корпуса ru-token-tax, который использовали в прошлом замере токенов, и посчитали токены тем же методом: разность двух запросов к модели.
| Модель | Токенов на 2 569 знаков | Знаков на токен |
|---|---|---|
| GPT-6.1 Sol | 641 | 4,01 |
| Gemini 3.8 Flash | 646 | 3,98 |
| Mistral Large 4 | 662 | 3,88 |
| Mistral Large 3 | 766 | 3,35 |
| Claude Sonnet 5.5 | 1 032 | 2,49 |
Токенизатор Large 4 стал экономнее: на тех же текстах токенов на 13,6% меньше, чем у Large 3 (662 против 766). Разрыв между русским и английским у Large 4 составил 1,22 раза (662 токена против 543 на английских версиях тех же текстов), у Large 3 было 1,41 раза. Результат получен на 3 текстах, на других числа сдвинутся на единицы процентов.
Наш тест: 3 документа, 4 спрятанных расхождения
Чтобы проверить модель на задаче, которую делают в офисе, мы взяли пакет из договора поставки, спецификации и дополнительного соглашения. В нём спрятаны 4 расхождения: сумма 480 000 и 504 000 ₽, срок оплаты 10 и 30 дней, неустойка 0,1% и 0,5% в день, суд в Москве и в Татарстане. Контрольный пакет отличается тем, что все значения в нём совпадают: честная модель не должна найти ни одного расхождения.
Каждый пакет мы прогнали по 3 раза на Mistral Large 4, GPT-6.1 Sol и Claude Sonnet 5.5. Всего 18 запусков с одним и тем же промптом. Результат проверял скрипт: нашлись ли все 4 расхождения в таблице, есть ли в ответе придуманные расхождения и каждая ли цитата дословно есть в пакете.
| Что смотрели | Mistral Large 4 | GPT-6.1 Sol | Claude Sonnet 5.5 |
|---|---|---|---|
| Нашла 4 из 4 расхождений | 3 из 3 | 3 из 3 | 3 из 3 |
| Придумала расхождение в контрольном пакете | 0 из 3 | 0 из 3 | 0 из 3 |
| Вынесла в «возможно, нужна проверка» неясность из-за доставки | 3 из 3 | 0 из 3 | 3 из 3 |
| Время ответа в среднем | 90 с (66–145) | 29 с (23–33) | 35 с (27–46) |
| Токенов в ответе в среднем | 5 675 | 1 535 | 4 851 |
| Цена одного запуска, ₽ | 1,11 | 1,58 | 4,55 |
Цена запуска посчитана по токенам ответа, ценам за миллион токенов из таблицы выше и курсу ЦБ на 7 октября. Время зависит от нагрузки провайдера: мы мерили утром 7 октября.
Цитаты скрипт проверял строго. Из 46 цитат Mistral не совпала дословно 1: она оборвана многоточием. У Sol из 35 цитат все дословные. У Sonnet из 54 цитат 6 не совпали: в 5 ответах это ссылка на «Договор поставки № 14 от 1 сентября 2026 года» с другим падежом слова, ещё 1 раз общая фраза «пункт X изложить в редакции». Выдуманных находок в 18 ответах нет.
Для читателя вывод такой. На простом тесте качество у всех 3 моделей одинаковое, и выбор идёт по цене и скорости. Large 4 на запуск выходит на 30% дешевле Sol и в 4,1 раза дешевле Sonnet.
Но она много «думает»: в среднем 5 675 токенов ответа против 1 535 у Sol. Поэтому токен на входе у неё дешевле в 2,9 раза, на выходе в 4,8 раза, а запуск только на 30%. Для чата с клиентом 90 секунд ожидания много, для ночной проверки пачки документов подходит.
В контрольном пакете расхождений нет, и ни одна модель их не придумала.
Mistral и Sonnet в 3 ответах из 3 вынесли в раздел «возможно, нужна проверка» неясность, которую создала добавленная доставка. Mistral спросила, кто и когда подписывает накладную, от которой зависит переход риска по п. 3.2 договора. Sonnet спросила, от какого события считать 10 дней на оплату, если товар привозит поставщик. Sol во всех 3 ответах написала, что сомнительных мест нет.
Промпт разрешает такие пункты и отделяет их от расхождений. Полезны они или это лишняя осторожность, решает ваш юрист.
Мы тестировали один пакет из 3 коротких документов и 2 пакета на каждую модель. Результат не доказывает, что на 80-страничном договоре картина будет такой же.
Что это значит для бизнеса
- Если вы проверяете документы пачкой. Large 4 по цене запуска выгоднее GPT-6.1 Sol и Claude Sonnet 5.5, если время ответа вам не важно. Проверьте на 20 своих договорах, а не на нашем.
- Если нужен быстрый ответ клиенту. Здесь скорость важнее цены токена. Sol отвечает втрое быстрее.
- Если важно, чтобы данные оставались у вас. Дождитесь весов и лицензии. Арифметика: 1,05 трлн параметров при 1 байте на параметр занимают около 1 050 гигабайт (ГБ), при 4 битах около 525 ГБ. Формат весов Mistral пока не назвала, но это сервер с сотнями гигабайт видеопамяти, а не офисный компьютер.
- Если вы используете Claude или GPT. Сначала прогоните 20 своих запросов. Результаты тестов Mistral сделала Mistral, а ваши документы могут вести себя иначе. Как сравнивать модели по цене 1 000 знаков вашего текста, а не по цене токена, показано в обзоре Gemini.
- Если в документах персональные данные клиентов. Отправка их в API за границу требует отдельной оценки по закону о персональных данных. Стоит уточнить у юриста.
Что делать сейчас
- Определите задачу. Одна и та же нейросеть по-разному справляется с чатом, документами и кодом.
- Соберите 20 реальных примеров без персональных данных: договоры, письма, заявки.
- Прогоните их на 2–3 моделях и сравните цену запуска, время и ошибки. Промпт для сверки договоров ниже мы проверили на 18 запусках.
- Посчитайте месяц. Цена запуска × число запусков в месяц, в рублях по курсу ЦБ.
- Вернитесь к расчёту после конца скидки. Срок скидки Mistral не назвала. По полной цене Large 4 обойдётся вдвое дороже при тех же токенах: 2,22 ₽ за наш запуск вместо 1,11 ₽, то есть дороже Sol (1,58 ₽).
Чего ждать
- Веса. Mistral обещает опубликовать их в конце октября вместе с деталями архитектуры, тестами и методикой обучения. Сроки и условия могут сдвинуться.
- Лицензия. В карточке модели поле лицензии пустое. У Large 3 была Apache 2.0, у Large 4 это нужно проверить в момент публикации весов.
- Независимая проверка. Цифры анонса нужно сверить с отчётами сторонних оценщиков. Mistral обещает вместе с весами раскрыть тесты и методику обучения.
- Цена. У скидки 50% нет срока. Считайте бюджет и по полной цене $1,36 и $4,18 как по возможному сценарию.
Наш прогон промпта
Промпт ниже сверяет пакет документов и показывает расхождения с цитатами. Он тот же, на котором мы сделали 18 запусков. В таблице расхождений Large 4 для пакета с подменами выглядело так:
| Что не совпадает | Что нашла модель |
|---|---|
| Итоговая сумма | Договор, п. 2.1: 480 000 рублей. Спецификация: 504 000 рублей. Риск переплаты 24 000 рублей |
| Срок оплаты | Договор, п. 2.2: 10 календарных дней. Спецификация: 30 календарных дней |
| Неустойка | Договор, п. 4.1: 0,1% в день. Допсоглашение, п. 2: 0,5% в день. Штраф вырастает в 5 раз |
| Суд | Договор, п. 6.1: Арбитражный суд города Москвы. Допсоглашение, п. 3: суд Республики Татарстан |
К каждой строке модель привела две дословные цитаты с номером пункта и риск для покупателя. В конце она предложила 3 вопроса контрагенту, которые закроют расхождения.
Частые вопросы
Mistral Large 4 открытая модель? Пока доступна только по API. Веса Mistral обещает выложить в конце октября, лицензию не назвала. Прошлая Large 3 вышла под Apache 2.0.
Сколько стоит Mistral Large 4? $0,68 за миллион токенов на входе и $2,09 на выходе со скидкой 50%, полная цена $1,36 и $4,18. Срок скидки не указан. Для русского текста это 0,015 ₽ за 1 000 знаков на входе и 0,046 ₽ на выходе.
Сколько активных параметров у Large 4, 49 или 52 млрд? В анонсе 49 млрд, в документации на 7 октября 52 млрд. Mistral не пояснила расхождение. Общий размер везде 1,05 трлн.
Работает ли Large 4 на русском языке? Mistral пишет об обучении на 160 с лишним языках. В нашем тесте с русскими договорами модель нашла все 4 расхождения 3 раза из 3. Токенов на русский текст у неё на 13,6% меньше, чем у Large 3.
Можно ли запустить Large 4 у себя? После публикации весов и при подходящей лицензии. Размер весов около 525 ГБ при 4 битах на параметр и около 1 050 ГБ при 8 битах, это серверное железо.
Лучше ли Large 4, чем Claude или GPT? По данным Mistral, в слепой оценке кода она второе из 5 после Claude Opus 5. На нашем тесте с договорами все 3 модели справились одинаково. Выбор зависит от цены, скорости и ваших задач.
Что значит Le Chonk? Прозвище модели, которое Mistral использует в анонсе. На Хабре его переводят как «пухляш». Официального пояснения компания не давала.
