Что значит «видео со звуком» и чем это отличается от обычной генерации
Нейросеть для видео получает описание сцены и рисует кадры. Многие модели делают «немое кино»: звук приходится добавлять отдельно, то есть искать озвучку, музыку и подгонять по времени. Видео со звуком означает, что одна модель делает картинку и звук сразу и держит их вместе.
Для этого в англоязычных работах придумали сокращения: T2AV (text-to-audio-video, ролик из текста) и I2AV (image-to-audio-video, ролик из первого кадра и описания).
Звук добавить сложнее, чем кажется: он должен совпасть с картинкой по времени, и авторы отчёта называют такую задачу заметно более трудной, чем картинка или звук по отдельности. Если человек говорит, губы обязаны двигаться в такт словам (это называют lip-sync, синхронизацией губ). Если хлопает дверь, звук должен прозвучать в момент хлопка.
Несколько терминов, которые встретятся дальше:
- Параметры (3 млрд, 29 млрд): грубая мера размера нейросети. Больше параметров обычно значит лучше качество, но нужна более мощная видеокарта.
- SD, HD, Full HD: разрешение картинки. Full HD это 1920 на 1080 точек.
- Super-resolution (суперразрешение): отдельная нейросеть, которая увеличивает готовый ролик. У Kandinsky 6.0 базовая генерация идёт в SD (например, 864 на 480), а Full HD получается этим увеличением.
- Веса и лицензия MIT: веса это файлы обученной нейросети, их можно скачать и запустить у себя. MIT одна из самых свободных лицензий: можно использовать в том числе в коммерческих продуктах.
Что произошло
6 октября 2026 года Сбер представил Kandinsky 6.0 Video. По словам пресс-службы, это первая российская нейросеть, которая создаёт ролики с синхронным звуком, и она доступна разработчикам в открытом виде.
В тот же день вышел технический отчёт «Kandinsky 6.0 Video» (препринт на arXiv от 4 октября, рецензирования он не проходил), а на Hugging Face обновились репозитории модели.
В ГигаЧате пользователи, как пишет Сбер, могут создавать видео с речью, музыкой и звуками окружения бесплатно. Вы описываете сцену текстом или загружаете первый кадр и добавляете описание звука. Качество выбирают в окне ввода: SD быстрее, HD и Full HD чётче. Конкретных лимитов на число роликов в пресс-релизе нет, и мы аккаунт в ГигаЧате не проверяли.
Для разработчиков Сбер опубликовал код и веса под лицензией MIT. Мы проверили Hugging Face: версии Lite, Lite distill, Pro distill, Pro pretrain и увеличитель разрешения не требуют входа, а основной репозиторий Pro на 29 млрд параметров (около 90 ГБ файлов) помечен как закрытый с автоматическим доступом: нужно войти на Hugging Face и принять условия.
Сбер заявляет, что модель появится и в инструментах FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni (это сервисы и программы, в которых нейросети запускают без своей сборки с нуля).
Модели дополняют прежнюю картиночную линейку Кандинского: новый Video говорит и озвучивает, но смотрит на мир в короткой «нарезке» из 5 секунд.
Что внутри: Lite и Pro
| Параметр | Kandinsky 5.0 Video | Kandinsky 6.0 Video Lite | Kandinsky 6.0 Video Pro |
|---|---|---|---|
| Размер модели | Lite 2 млрд, Pro 19 млрд | 3 млрд | 29 млрд |
| Длина ролика | до 10 секунд | 5 секунд | 5 секунд |
| Звук | нет | да, 44 кГц, речь, музыка, шумы | да, 44 кГц |
| Разрешение | до 1280 на 768 | SD, до Full HD через увеличение | SD, до Full HD через увеличение |
| Лицензия | MIT | MIT | MIT |
Данные о версии 5.0 взяты с сайта Kandinsky Lab, о 6.0 из карточки модели и отчёта. Главное, что стоит заметить: ролик стал вдвое короче. Для рекламы и соцсетей 5 секунд хватает на один «крючок», но не на рассказ.
Для речи авторы использовали русские и английские описания: подсказки к моделям писали на обоих языках, а в обучение добавили набор с «российским культурным кодом» из 1,2 млн изображений и 530 тысяч видеосцен. Отдельных замеров качества именно русской речи отчёт не приводит.
Что показывает отчёт: наш пересчёт «71%»
Сбер в пресс-релизе заявляет, что новая модель оказалась лучше Kandinsky 5.0 «в среднем в 71% случаев по всем критериям». В отчёте такой цифры в тексте нет, результаты показаны на графиках: люди смотрят два ролика по одному запросу и выбирают лучший или объявляют ничью. Мы переписали значения с графика (рисунок 15, страница 45) и посчитали сами.
| Как считать | Из текста (5 критериев) | Из первого кадра (6 критериев) | Все 11 сравнений |
|---|---|---|---|
| Новая модель победила | 43,8% | 41,5% | 42,5% |
| Ничья | 40,2% | 46,2% | 43,5% |
| Победила 5.0 | 16,0% | 12,3% | 14,0% |
| Победы среди решённых сравнений без ничьих | 72,6% | 76,6% | 74,7% |
| «Не хуже» (победа или ничья) | 84,0% | 87,7% | 86,0% |
Вывод простой: 71% нельзя получить ни из прямых побед (42,5%), ни из «не хуже» (86%). Ближе всего доля побед среди сравнений без ничьих: 72,6% в режиме «из текста» и 74,7% в целом. Мы не знаем, какой именно способ использовал Сбер. Это не обвинение: цифра по сути верна, но читателю надо понимать, что почти в половине сравнений разницы люди не увидели, а в 14% предпочли старую модель.
Самые сильные улучшения по картинке: общее качество в режиме «из первого кадра» (64% побед против 11%) и меньшее число артефактов (49% против 18–19%). Реализм движения чаще всего оценён как ничья (59% и 72%), хотя новая модель и здесь выигрывает чаще, чем проигрывает: 28% против 13% и 21% против 7%.
Как модель выглядит рядом с сильнейшими
В отчёте люди сравнивали Kandinsky 6.0 Pro с пятью другими моделями. Мы пересказываем вывод авторов без цифр с графиков:
| Соперник | Что показало сравнение |
|---|---|
| Kandinsky 5.0 Pro | Явное преимущество новой модели по всем критериям |
| LTX 2.5 (открытая) | Новая лучше по картинке и речи; у LTX небольшое преимущество по общему качеству звука, статистически незначимое |
| Kling 2.6 | Смешанный результат: Kling лучше по общему качеству картинки и звука, Kandinsky лучше по соответствию звуков описанию, речь почти вровень |
| Veo 3.1 Fast (Google) | Разделение: Kandinsky чище по картинке и точнее держит исходный кадр, Veo лучше следует описанию и делает звук |
| MiniMax H3 и Seedance 2.0 | MiniMax H3 предпочли по большинству критериев, Seedance 2.0 сильнее по картинке; у обоих Kandinsky остаётся конкурентным по речи и синхронизации |
Авторы сами пишут в заключении (в нашем переводе): «остаётся разрыв с сильнейшими закрытыми системами по качеству картинки и общему качеству звука». Среди открытых моделей отчёт сравнивает её только с LTX 2.5, и там она впереди по картинке и речи; лучшей среди всех её отчёт не называет.
Отдельный бенчмарк VABench для видео со звуком дал такую картину по сравнению с открытой LTX 2.5.
| Показатель | LTX 2.5 | Kandinsky 6.0 Lite | Kandinsky 6.0 Pro |
|---|---|---|---|
| Точность синхронизации губ (больше лучше) | 1,567 | 1,761 | 2,072 |
| Рассинхрон звука и картинки (меньше лучше) | 0,521 | 0,474 | 0,396 |
| Реализм картинки | 4,366 | 4,459 | 4,485 |
| Ошибки в распознанной речи (меньше лучше) | 0,099 | 0,103 | 0,117 |
Рассинхрон меньше, губы точнее, но по ошибкам в проговоренном тексте Pro хуже LTX 2.5. Для роликов, где герой говорит длинную фразу, это стоит проверять глазами и ушами. Авторы пишут, что на отдельном наборе из 64 запросов доля ошибок речи у Pro после обучения с подкреплением упала с 0,235 до 0,124, то есть на 47%.
Сколько стоит запустить у себя
В отчёте есть главное, чего не хватает пресс-релизам: время генерации на разных видеокартах. Мы взяли время одного 5-секундного клипа и перевели в рубли по ценам аренды сервера Selectel на 6 октября 2026 года: 290,15 ₽ в час за сервер с видеокартой Nvidia RTX PRO 6000 (профессиональная карта) на 96 ГБ памяти.
| Модель и качество | Время клипа на RTX PRO 6000 | Клипов в час | Цена клипа |
|---|---|---|---|
| Lite, SD | 4,0 мин | 14,9 | 19,5 ₽ |
| Lite, Full HD | 6,5 мин | 9,3 | 31,2 ₽ |
| Pro, SD | 10,3 мин | 5,8 | 50,1 ₽ |
| Pro, Full HD | 12,8 мин | 4,7 | 61,7 ₽ |
Сто роликов Lite в Full HD обойдутся в 3 119 ₽ и займут около 11 часов, сто роликов Pro в Full HD в 6 166 ₽ и около 21 часа. Расчёт учитывает только время генерации: загрузка весов, сборка файла и простой сервера в него не входят.
На домашних видеокартах модель тоже запускается, но медленно. По таблице отчёта Lite в Full HD на игровой карте Nvidia RTX 4090 занимает 9,6 минуты, а Pro 20,8 минуты; на RTX 5090 6,8 и 14,2 минуты; на RTX 5060 Ti на 16 ГБ Lite Full HD почти полчаса.
Для карт на 16, 24 и 32 ГБ авторы сделали режим, где в память видеокарты помещаются лишь 2 блока модели, а остальное подгружается из оперативной памяти. Пик памяти при этом 21,7 ГиБ вместо 72,8 ГиБ у Pro в SD, но Pro на 16 ГБ требует около 58 ГиБ оперативной памяти компьютера.
Проще говоря: модель можно запустить дома, но ждать придётся минуты.
Для сравнения вы платите 0 ₽ в ГигаЧате, пока Сбер не поменял условия. Свой запуск имеет смысл, если нельзя отправлять материалы наружу, нужен большой поток роликов или вы настраиваете модель под свою задачу.
Что это значит для бизнеса
- Пять секунд хватает для одного кадра рекламы. Оживить фото товара, показать продукт с шумом кофемашины, сделать «шапку» для сторис. Рассказ из нескольких сцен придётся склеивать из роликов.
- Русская речь заявлена, но не измерена отдельно. Сбер пишет про речь, музыку и звуки окружения. Отчёт не даёт замеров качества именно русского произношения, поэтому проверяйте фразы на слух до публикации.
- Нельзя изображать реальных людей без согласия. Авторы прямо пишут, что модель не предназначена для имитации голоса и внешности людей в обманных целях, и просят помечать такие ролики как созданные нейросетью. Требования к раскрытию ИИ-контента в вашей юрисдикции нужно проверить самим.
- Открытая лицензия не отменяет проверки прав на сам ролик. MIT относится к весам и коду. Что вы выпускаете в рекламе, остаётся вашей ответственностью.
- Это новый выпуск. По картинке модель уступает сильнейшим закрытым системам, и для массовой рекламы лучше сначала сделать пробную партию и показать её тем, кто будет смотреть ролики.
Что делать сейчас
- Попробуйте в ГигаЧате. Опишите одну сцену и одну реплику, выберите HD и посмотрите результат на слух и на глаз.
- Проверьте русскую речь. Скажите модели короткую фразу из 4–10 слов и послушайте, нет ли съеденных звуков.
- Не обещайте клиенту «видео на минуту». Ролик длится 5 секунд, нужен монтаж.
- Если нужен запуск у себя, начните с Lite: по отчёту он работает на видеокартах от 16 ГБ, а клип в аренде стоит от 20 до 31 ₽.
- Сравните с закрытыми сервисами по своей задаче: по отчёту Veo 3.1 Fast лучше следует описанию и звуку, подробности об этом сервисе смотрите в обзоре Google Veo, а общий выбор поможет сделать обзор нейросетей для видео.
Полезные ссылки по теме: GigaChat: возможности и цены и открытые нейросети и чем они отличаются от закрытых.
Мы не запускали саму модель: у нас нет доступа к ГигаЧату с аккаунтом для проверки и видеокарты для локального запуска, поэтому качество роликов мы по результатам не оцениваем. Скорость и цену мы взяли из таблицы отчёта авторов и цен Selectel.
Наш прогон промпта
Промпт ниже мы прогнали на трёх условных бизнесах: кофейня у офисов, столярная мастерская, доставка продуктов. Прогон шёл на модели Claude Sonnet 5.5 через шлюз нашей платформы. Видео мы не создавали, поэтому проверили только то, что можно проверить по тексту: выполняет ли ответ правила из самого промпта.
Так выглядит часть реального ответа для кофейни (мы сократили описание места, света и фона, остальное слово в слово):
> Запрос, картинка: cinematic shot: one continuous 5-second take, no cuts, with a slow smooth push-in from a medium shot to a medium close-up at eye level. A woman barista of about 28, with her dark brown hair in a low bun, wears a beige knit sweater and a plain dark green apron. She looks straight into the camera as if at a regular customer and speaks with a warm smile; she makes no other movements.
> Тот же фрагмент по-русски: Кинематографичный кадр: один непрерывный дубль на 5 секунд без склеек, плавный наезд от среднего плана к крупному на уровне глаз. Бариста, женщина около 28 лет, с тёмно-русыми волосами, собранными в низкий пучок, в бежевом вязаном свитере и простом тёмно-зелёном фартуке. Она смотрит прямо в камеру, как на постоянного гостя, и говорит с тёплой улыбкой; других движений у неё нет.
> Запрос, звук: Audio: 1) the barista's voice, a female voice about 28 years old, warm and calm, at a medium pace, saying in Russian: "Доброе утро! Вам как обычно?"; 2) a soft hiss of steam from the espresso machine in the background; 3) quiet soft acoustic guitar music, noticeably quieter than the voice. No text, prices, signage or logos, and no recognizable faces of real people.
Ниже в ответе шёл список «Что проверить после генерации»: фраза звучит целиком и по-русски, на стаканах и фасаде нет случайных букв, гитара тише голоса.
Версий было три. В первой, на 1 300 знаков, в кофейне героиня и говорила, и тянулась за стаканом: два действия на 5 секунд. А «не больше трёх звуков» держалось на том, что два шума записывались в один пункт.
Вторая версия, около 2 000 знаков, оставила обе проблемы, а в мастерской русский перевод разошёлся с английским запросом: в английском «middle-aged» (средних лет), в русском «пожилого мастера». Тогда мы добавили три правила: одно действие на героя, один источник звука на пункт и сверка перевода с оригиналом. В новости стоит третья версия, результат ниже.
| Правило | Кофейня | Мастерская | Доставка |
|---|---|---|---|
| Один план и одно движение камеры | 1 наезд | 1 наезд | 1 наезд |
| Каждый герой делает одно действие | да | да | да |
| Реплика не длиннее 10 слов | 4 слова | речи нет по заданию | 4 слова |
| Звуков не больше трёх, по одному источнику в пункте | 3 | 3 | 3 |
| Запрет надписей и логотипов в конце запроса | вписан | вписан | вписан |
| Перевод совпадает с английским запросом | да | да | почти |
| Лишних вопросов к нам | 0 | 0 | 0 |
Формальные правила третья версия выполнила во всех трёх ответах. Остаётся одно замечание: в доставке «blank mailboxes» (почтовые ящики без надписей) переведено как «пустые почтовые ящики», и смысл про отсутствие надписей потерялся. Качество готового ролика проверяйте в ГигаЧате: мы проверили запрос, а не видео.
