#ИИ и нейросети6 мин

Qwen3.8-Omni-Flash: слушает, смотрит, держит 1 млн токенов и дешевле на 98%

18 сентября 2026 года команда Qwen из Alibaba выпустила Qwen3.8-Omni-Flash: модель, которая в одной архитектуре принимает текст, изображения, аудио и видео и держит контекст в 1 млн токенов, то есть многочасовую запись целиком. По данным разработчика, средний результат в 29 тестах вырос больше чем на 25% против прошлого поколения, а цена часа аудио по API снизилась больше чем на 98%, часа аудио с видео больше чем на 93%. Модель умеет не читать запись подряд, а сама решать, куда смотреть и что слушать под вопрос, и тратит на это на 45–52% меньше токенов. Для бизнеса это значит, что расшифровка и разбор звонков, совещаний и видео перестают быть дорогой статьёй.

Qwen3.8-Omni-Flash: слушает, смотрит, держит 1 млн токенов и дешевле на 98%
Коротко
  • Что вышло: Qwen3.8-Omni-Flash, единая модель для текста, картинок, аудио и видео с контекстом 1 млн токенов; доступна по API на платформе Alibaba Cloud, отдельная версия Realtime для живого диалога.
  • Цена: час аудио на входе дешевле на 98%, час аудио с видео на 93% по сравнению с Qwen3.5-Omni-Plus, по расчёту самого разработчика.
  • Качество: в среднем +25% по 29 тестам; по звуку выше Gemini 3.8 Flash, по аудио с видео близко к ней; распознавание речи на 74 языках, включая русский, синтез на 29.
  • Агентное понимание: модель ищет нужный фрагмент в долгой записи по запросу, а не обрабатывает всё подряд; на тесте OmniVideoBench это дало +4,4 балла при расходе токенов на 45,7% меньше.
  • Открытый код: выложены Qwen-Live Harness для живого взаимодействия и модуль Video2Note для превращения видео в конспект; сама модель доступна через API.
  • 🔎 Для владельца бизнеса это разбор записей звонков, встреч и видеоинструкций по цене, при которой их можно прогонять все, а не выборочно.

Что произошло

18 сентября 2026 года команда Qwen опубликовала в блоге анонс Qwen3.8-Omni-Flash, следующего поколения своей «всеядной» модели. Слово «omni» здесь означает, что одна модель работает с текстом, изображениями, звуком и видео без переключения между отдельными системами.

Модель доступна на платформе Alibaba Cloud с контекстным окном в 1 млн токенов, при этом качество работы с текстом, по словам разработчика, сопоставимо с чисто текстовой моделью того же размера.

Главные цифры из анонса: средний результат по 29 тестам вырос больше чем на 25% против Qwen3.5-Omni-Plus; цена часа аудио на входе по API снизилась больше чем на 98%, часа аудио с видео больше чем на 93%. В тестах на аудиовизуальных агентов, код и длинные задачи модель прибавила 36,5 балла на WildClawBench-MM и 22,3 балла на AgenticVBench, набрав 69,6 на UniClawBench.

По оценке разработчика, по совместной обработке звука и видео модель близка к Gemini 3.8 Flash, а по чистому звуку превосходит её.

Пересказ на русском с деталями вышел на 3DNews 19 сентября: распознавание речи поддерживает 74 языка и диалекта, синтез 29 языков.

Что такое контекст в 1 млн токенов и зачем он звуку и видео

Контекстное окно это объём, который модель держит в памяти за один запрос. Токен это единица текста размером в часть слова; для звука и видео токены получаются из секунд записи и кадров. Миллион токенов означает, что в один запрос помещается многочасовая запись совещания или длинное видео целиком, без нарезки на куски и потери связи между ними.

Подробно про то, как окно ограничивает нейросети и почему «больше» не всегда «лучше», мы писали в статье про контекстное окно нейросети.

Проблема больших записей в цене: обработать 3 часа видео покадрово это сотни тысяч токенов на каждый вопрос. Qwen3.8-Omni-Flash решает её «агентным пониманием»: модель отталкивается от вопроса, сама решает, какие участки смотреть и слушать, и сужает поиск за несколько проходов, не читая всё подряд.

В анонсе это показано на тесте OmniVideoBench: результат вырос с 63,4 до 67,8 балла, а расход токенов на запрос упал со 145 736 до 79 117, на 45,7%.

Что ещё выложено и как это использовать

Вместе с моделью команда расширила набор модулей Qwen-MM-Plugins для работы с долгими аудио и видео и открыла код Qwen-Live Harness: среды для непрерывного взаимодействия голосом и видео в реальном времени, с делегированием задач, памятью и управлением контекстом.

Для живого диалога есть отдельная версия Qwen3.8-Omni-Flash-Realtime, которая отвечает по ходу приёма потока и может вызывать инструменты прямо в разговоре.

Отдельно открыт модуль Video2Note: он превращает обучающее видео в структурированный конспект с ключевыми шагами, отобранными кадрами и выгрузкой в PDF. Для компаний с библиотекой видеоинструкций это готовый способ сделать из них текстовую базу знаний.

В анонсе есть и показательный эксперимент: модели дали 12 часов, чтобы улучшить распознавание сычуаньского диалекта у более компактной модели. Она сама отобрала тестовую выборку, замерила исходный результат, за 4 серии собрала 3 413 обучающих примеров и снизила долю ошибок в символах с 25,79% до 15,30%. То есть модель может не только пользоваться другими моделями, но и дообучать их.

Цифры и даты

ЧтоЗначение
Дата выхода18 сентября 2026
Контекст1 млн токенов
Входытекст, изображения, аудио, видео
Цена часа аудио по APIниже на 98% против Qwen3.5-Omni-Plus
Цена часа аудио с видеониже на 93%
Средний прирост по 29 тестамбольше 25%
Языкираспознавание 74, синтез 29
Экономия токенов при агентном просмотре видео45,7% на OmniVideoBench

Что это значит для бизнеса

Первое: разбор звонков и встреч перестаёт быть выборочным. Когда час аудио дешевеет в 50 раз, можно прогонять через модель все звонки отдела продаж, а не 5% для контроля. Что даёт такой разбор и как его строить, мы описывали в статье про речевую аналитику; Qwen меняет в этой схеме только цену.

Второе: длинные записи можно не нарезать. Совещание на 3 часа или вебинар целиком помещаются в запрос, а ответ на вопрос «что решили по бюджету» находится по нужным минутам записи, без расхода токенов на остальное. Для расшифровки и протоколов это другой уровень удобства по сравнению с инструментами, которые разбирали в материале про расшифровку аудио в текст.

Третье: видеоинструкции превращаются в базу знаний. Video2Note делает из записи конспект с кадрами; для сервисных компаний, где обучение новичков живёт в видео, это способ получить текст для поиска и для ИИ-помощников.

Четвёртое: доступ и оплата. Модель живёт на платформе Alibaba Cloud, оплата по API требует зарубежного способа платежа; что из продуктов Qwen открывается из России и как это проверялось, разобрано в нашем обзоре Qwen. Цифры про цену и качество здесь пока по данным самого разработчика: независимых тестов на 21 сентября нет.

Что делать уже сейчас

  1. Собрать 3 записи, на которых вы бы проверяли модель: типовой звонок продаж, совещание на час и видеоинструкцию; заранее записать, какие ответы вы ждёте.
  2. Проверить доступ к платформе Alibaba Cloud и способ оплаты; если его нет, отложить внедрение и следить за появлением модели у посредников.
  3. Посчитать текущую стоимость расшифровки и разбора записей за месяц: это база, с которой сравнивать новую цену.
  4. Прогнать Video2Note на одной инструкции и оценить, годится ли конспект как основа для базы знаний.
  5. Для звонков отдела продаж составить список из 5 вопросов, которые модель должна отвечать по каждой записи, и проверить точность на 10 звонках руками.

Чего ждать

Alibaba выпускает модели Qwen сериями, и после Flash обычно появляются более крупные и более дешёвые версии, а также доступ через сторонние платформы. Реалистичный сценарий на осень: конкуренты ответят снижением цен на аудио и видео по API, а главным вопросом станет не качество, а то, у кого запись можно обработать целиком и дёшево. Независимые замеры цены и качества ожидаемы в ближайшие недели.

Частые вопросы

Это открытая модель, которую можно запустить у себя? Нет. Сама Qwen3.8-Omni-Flash доступна по API на платформе Alibaba Cloud; открыт код среды Qwen-Live Harness и модулей, включая Video2Note.

Понимает ли модель русскую речь? Русский есть в списке из 74 языков распознавания по данным разработчика. Качество на реальных звонках стоит проверить на своих записях.

Чем это отличается от расшифровки речи в текст? Расшифровка переводит звук в текст, а здесь модель отвечает на вопросы по записи, находит нужные фрагменты и работает с видео и звуком вместе, не превращая всё в текст заранее.

Промпт: разобрать запись звонка или встречи по 5 вопросам и собрать протокол

Загрузите запись или её расшифровку в модель с работой со звуком (Qwen3.8-Omni-Flash или другую) и вставьте промпт, заполнив скобки. На выходе получите ответы на ваши вопросы с отметками времени, протокол решений и список того, что модель не смогла подтвердить.

Промпт
Ты — аналитик записей звонков и встреч в небольшой компании. Ты отвечаешь на вопросы по записи с указанием места, где это прозвучало, отделяешь сказанное от своих предположений и собираешь протокол, пригодный для отправки участникам.

ЗАДАЧА
Разобрать запись по моим вопросам, собрать протокол решений и назвать всё, что в записи не подтверждается.

ЧТО Я ДАЮ
— запись или её расшифровка: [файл аудио, видео или текст]
— тип записи: [звонок продаж, совещание, вебинар, инструкция]
— участники и роли: [имена и роли или «неизвестно»]
— мои 5 вопросов к записи: [список вопросов]
— что считать решением: [например, названы ответственный и срок]
— ограничения: [что не включать в протокол, кому он уйдёт]

С ЧЕГО НАЧИНАЕШЬ
Если запись длиннее часа и вопросов нет, спроси, что искать, и не пересказывай всё подряд.

ПРОТОКОЛ
1. Определи участников по голосам или репликам и сопоставь с моими ролями; если уверенности нет, отметь это.
2. Ответь на каждый из 5 вопросов: ответ, отметка времени, дословная фраза из записи, на которую опираешься.
3. Выдели решения по моему определению: что решили, кто ответственный, срок; отдельно список открытых вопросов без решения.
4. Отметь обещания и цифры, прозвучавшие в записи: суммы, даты, объёмы, и укажи, кто их назвал.
5. Проверь противоречия: если участники называли разные цифры или сроки, покажи оба варианта с отметками времени.
6. Составь список того, что в записи не подтверждается или неразборчиво, чтобы я проверил руками.
7. Собери протокол: заголовок, участники, решения таблицей, открытые вопросы, следующие шаги с датами.

ФОРМАТ ОТВЕТА
Сначала ответы на 5 вопросов с отметками времени, затем таблица решений (что, кто, срок, отметка времени), затем открытые вопросы и список непроверенного. Объём протокола до 400 слов, отметки времени в формате мм:сс.

ПРАВИЛА
— не дополняешь сказанное своими выводами без пометки «предположение»;
— не выдумываешь имена и роли: если участник не назван, пишешь «участник 2»;
— цифры и даты приводишь дословно, как прозвучали;
— если фрагмент неразборчив, так и пишешь, а не восстанавливаешь смысл.

ПРИМЕР ВЫХОДА (сокращённо)
Вопрос 1 «Согласовали ли бюджет на рекламу?»: да, 04:12, «оставляем 180 тысяч на октябрь, дальше смотрим по лидам», сказал участник в роли владельца. Решения: запуск кампании в Директе, ответственный Мария, срок 28 сентября (11:40); перенос обновления сайта на ноябрь, ответственный не назван (19:05, открытый вопрос). Противоречие: в 04:12 названо 180 тысяч, в 22:30 «150, как договаривались»; оба фрагмента отмечены. Непроверенное: 27:10–27:40 неразборчиво, упоминается поставщик.
Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт
Источники

💬 Комментарии

Пока никто не написал. Будьте первым: расскажите, что оказалось полезным, а чего не хватило.
Ссылки в комментариях не публикуются.

📚Разбираем тему подробно

Все статьи
Qwen: обзор нейросети Alibaba — что умеет, где ломается и как работает из России
11.08.2026#Нейросети: обзоры и сравнения
Qwen: обзор нейросети Alibaba — что умеет, где ломается и как работает из России
Qwen открывается из России без VPN и бесплатна в базовом режиме. Разбираем, что делает хорошо, где ошибается и когда лучше взять российскую модель.
Расшифровка аудио в текст: мой замер точности, цены сервисов и промпт протоколиста
07.09.2026#ИИ-сотрудники для бизнеса
Расшифровка аудио в текст: мой замер точности, цены сервисов и промпт протоколиста
Расшифровка перестала быть проблемой: минута аудио превращается в текст за 4–5 секунд и стоит меньше рубля. Проблема в другом — сплошное полотно текста читать никто не станет, и ценность появляется только на втором шаге.
Речевая аналитика: как ИИ проверяет звонки за отдел контроля качества
07.09.2026#Продажи и переговоры
Речевая аналитика: как ИИ проверяет звонки за отдел контроля качества
Отдел контроля качества успевает прослушать 3–5% записей, а проблемы всплывают ровно в тех звонках, которые никто не открыл. Машина слушает все и по одинаковым критериям.
Контекстное окно нейросети: что это, сколько влезает и почему модель забывает начало
15.09.2026#Термины ИИ и маркетинга
Контекстное окно нейросети: что это, сколько влезает и почему модель забывает начало
Контекстное окно это предел объёма текста, который нейросеть учитывает при ответе: инструкция, документы, история и сам ответ. Что не поместилось, модели не существует. Я измерил, сколько токенов весит страница по-русски, проверил 4 модели на факт из начала длинного текста и получил 2 отказа сервера на границе окна.

🗞Другие новости

Все новости
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября, 17:03#Маркетинг и реклама
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября 2026 года стали известны данные Future Lab (группа компаний Starlink) по видеопотреблению в России за первое полугодие. Среднее время просмотра на крупнейших видеоплощадках выросло на 6% и составило 87,7 минуты в день на пользователя. Но если вычесть YouTube, показатель падает на 5%: весь рост рынку обеспечил именно он. Сам YouTube, несмотря на ограничения скорости, прибавил 24% и вышел на 99 минут в день на пользователя. Для сравнения: годом ранее он терял 28,6%, а российские площадки тогда росли на 32%. Маркетологу здесь важны две вещи сразу: аудитория вернулась туда, где ограничен доступ, а реклама на этой площадке с марта 2026 года признана ФАС незаконной, хотя запрет отложен до конца года.
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
22 сентября, 17:03#Отчёты и цифры
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
21 сентября 2026 года появились данные группы Twiga CG, основанные на замерах Mediascope: инвестиции 20 крупнейших рекламодателей России в офлайн-рекламу (телевидение, радио, пресса и наружная реклама) за первое полугодие 2026 года выросли на 24% год к году. Само по себе это рост, но темпы замедлились более чем в 2,5 раза по сравнению с прошлым годом. Сменился и лидер: после многолетнего первого места «Сбера» вперёд вышла RWB (Wildberries и Russ) с бюджетом 27 млрд рублей и ростом на 64%. «Сбер» второй с 20,6 млрд рублей. Участники рынка объясняют перестановки перетоком бюджетов в интернет и общей экономической ситуацией. Для небольшого бизнеса вывод простой: крупные игроки стали осторожнее с каналами, где эффект трудно посчитать.
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
22 сентября, 17:02#Технологии
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
21 сентября 2026 года появились данные Международной федерации робототехники (IFR), которые приводит Reuters: за 2025 год во всём мире продали около 7 тысяч человекоподобных роботов. Для сравнения: промышленных роботов только за 2024 год установили 542 тысячи, а сервисных ещё 199 тысяч. По правилам IFR к гуманоидным относят устройства с человекоподобным видом, способные работать автономно в среде, рассчитанной на людей; ноги при этом необязательны. Глава IFR Сюзанна Биллер отмечает: несмотря на высокие продажи, доля человекоподобных роботов остаётся небольшой на фоне общего числа. Разрыв в масштабе доходит до 77 раз только по промышленным машинам. Полные данные за 2025 год IFR обещала опубликовать 24 сентября.