Что значит «мультимодальная» и зачем это бизнесу
Первые языковые модели работали только с текстом: вы пишете — они отвечают. Мультимодальная модель принимает несколько типов данных сразу, в этом случае — текст и изображения. Практическая разница огромна: можно отправить фотографию накладной, скриншот отчёта, схему или фото товара и попросить разобрать содержимое.
Пара слов про единицы измерения. Токен — кусочек текста примерно в 3–4 символа, счёт за работу модели идёт именно в токенах. Контекстное окно — сколько токенов модель удерживает в одном разговоре: миллион токенов это примерно объём нескольких сотен страниц.
Доступ к таким моделям бывает двух видов. Через привычное окно чата — человек сидит и общается. Через программный доступ, он же API, — когда ваша система отправляет запросы сама, без участия человека: тысяча накладных за ночь, разбор фотографий товаров, автоматическая проверка документов.
DeepSeek — китайский разработчик, который в начале 2025 года встряхнул рынок дешёвыми и сильными моделями. Что это за компания и чем она отличается от западных, разбирали в отдельном материале — DeepSeek: что это за нейросеть.
Что произошло
DeepSeek объявил о запуске на своей API-платформе модели DeepSeek-V4-Flash-Vision-Exp. Это экспериментальная версия V4-Flash, к которой добавили понимание изображений.
Текстовая часть при этом не пострадала: работа с агентами, рассуждения и общие знания остались на уровне базовой модели. Компания подчёркивает, что версия экспериментальная — то есть параметры и доступность могут меняться.
Как устроена модель
Базовая V4-Flash собрана по схеме разреженной смеси экспертов: всего 284 млрд параметров, но на каждый запрос включается только 13 млрд. Такой подход даёт скорость и дешевизну работы при большом общем объёме знаний. Архитектуру самой версии со зрением компания отдельно не раскрывала.
Контекстное окно — 1 048 576 токенов, в документации оно обозначено как 1M; длина ответа — до 384 000 токенов, то есть 384K. Изображение после автоматического уменьшения занимает до 384 токенов.
Сколько это стоит
Цена доступа зависит от времени суток. Во внепиковые часы — $0,22 за миллион входных токенов и $0,66 за миллион выходных; в пиковые тарифы вдвое выше: $0,44 и $1,32. Повторное чтение из кэша стоит $0,007 и $0,014 за миллион соответственно. Пиковыми считаются часы 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу — по московскому времени это примерно с 4 до 7 утра и с 9 до 13 часов.
Переведём в понятное: изображение занимает до 384 токенов, то есть тысяча картинок во внепиковые часы стоит около восьми центов по входным токенам плюс оплата ответов модели.
Что показывают тесты
По данным SiliconANGLE, на двух визуальных тестах — ALE и ZeroBench — версия со зрением обошла Claude Opus 4.8. Речь о результатах, опубликованных вокруг релиза; независимых широких проверок пока нет, и относиться к ним стоит как к заявке, которую рынок будет проверять. Модель доступна только через платную платформу для разработчиков.
Что это значит для бизнеса
Интерес к DeepSeek в России стабильно высокий: запрос «deepseek» набирает около 141 тысячи показов в месяц, вместе с уточнениями — свыше 294 тысяч. Появление у него работы с картинками расширяет круг задач, где дешёвая модель заменяет дорогую.
Главное следствие — цена операций с документами. Распознавание накладных, счетов, актов, фотографий с объекта, скриншотов отчётов — всё это раньше требовало либо специализированных сервисов, либо дорогих моделей. При $0,22 за миллион токенов такие задачи переходят в разряд рутинных расходов.
Второе — экспериментальный статус. Строить на такой версии критичный процесс рискованно: параметры и доступность меняются без предупреждения. Разумный сценарий — пилот на неважном участке, замер качества на своих данных, и только потом решение.
Третье — выбор модели перестаёт быть вопросом бренда. Под каждую задачу считается стоимость и качество на ваших примерах: где-то выигрывает дешёвая модель, где-то дорогая экономит на переделках. Как этот выбор делать по задачам, разбирали в обзоре нейросетей 2026 года.
Что это значит для специалиста
- Владельцу бизнеса. Посмотрите на участки, где сотрудники вручную переносят данные с бумаги или скриншотов в таблицы. Именно там дешёвая модель со зрением окупается быстрее всего.
- Бухгалтеру и финансисту. Разбор первичных документов по фото — самый очевидный сценарий. Проверять результат всё равно нужно: модель может ошибиться в цифре, и цена такой ошибки выше экономии.
- Разработчику. Доступ идёт через API; часовые цены и лимиты у экспериментальных моделей меняются. Что такое программный доступ и как он устроен, объясняли в материале про API.
- Аналитику. Работа с таблицами и выгрузками у моделей уже неплохая, а картинки добавляют разбор дашбордов и скриншотов — рядом полезен разбор нейросетей для таблиц и Excel.
- Тем, кто выбирает между открытыми и закрытыми моделями. DeepSeek традиционно ближе к открытому лагерю; чем это отличается на практике, собрано в разборе открытых нейросетей.
Что делать уже сейчас
- Выберите одну задачу с картинками. Накладные, чеки, фото товара, скриншоты — что-то одно, где объём измерим.
- Соберите тестовый набор. Двадцать–тридцать реальных примеров, включая плохие: смазанные, перевёрнутые, с печатями.
- Замерьте качество на своих данных. Заявленные бенчмарки к вашим документам отношения не имеют.
- Посчитайте стоимость. Число изображений в месяц, средний размер ответа, тариф — получите расход в рублях.
- Сравните с текущим решением. Ручной труд, специализированный сервис или дорогая модель — считайте по стоимости обработанного документа.
- Заложите проверку. Для денежных документов результат модели проверяет человек; выборочно или полностью — решается по цене ошибки.
- Не переносите критичное на экспериментальную версию. Пилот — да, единственный рабочий процесс — нет.
Чего ждать дальше
Ближайшее — появление модели у посредников и в сервисах-агрегаторах, через которые к ней получат доступ те, кто не работает с китайской платформой напрямую. Обычно это происходит за считанные дни после релиза.
Второе — давление на цены. Каждый раз, когда сильная модель выходит с ценой в разы ниже западных аналогов, конкуренты отвечают снижением тарифов или бесплатными лимитами. Для покупателя это хорошая новость.
Третье — независимые тесты. Заявка «приближается к Opus 4.8» будет проверена сторонними замерами в ближайшие недели, и картина может измениться в обе стороны.
Частые вопросы
Что нового в этой модели?
Понимание изображений: модель принимает картинки вместе с текстом. Текстовые возможности остались на уровне базовой V4-Flash.
Сколько стоит?
Во внепиковые часы — $0,22 за миллион входных токенов и $0,66 за миллион выходных, в пиковые вдвое дороже. Одно изображение занимает до 384 токенов.
Насколько она сильная?
На двух визуальных тестах, ALE и ZeroBench, она обошла Claude Opus 4.8. Широких независимых проверок пока нет.
Что означает «экспериментальная»?
Компания может менять параметры, цены и доступность без гарантий стабильности. Для критичных процессов это риск.
Какой у неё контекст?
1 048 576 токенов на запрос (в документации — 1M) и до 384 000 токенов в ответе (384K).
Чем мультимодальная модель полезна малому бизнесу?
Дешёвым разбором документов и фотографий: накладные, чеки, акты, фото с объекта, скриншоты отчётов.
