Kandinsky 6.0 Video от Сбера теперь генерирует ролики со звуком
06.10.2026 в 12:33Сбер представил новую версию генеративной модели Kandinsky 6.0 Video, которая получила способность автоматически создавать аудиосопровождение для синтезированного видео. О запуске платформы компания сообщила в официальном пресс-релизе.
Звук под видео и более реалистичная физика
Обновленный Kandinsky умеет формировать не только картинку, но и звуковой ряд. Нейросеть способна синтезировать речь, музыкальное оформление и фоновые шумы окружающей среды, которые соответствуют визуальному содержанию ролика. Для старта генерации пользователю достаточно ввести текстовый промпт или загрузить исходное изображение — система на его основе соберет короткий видеоклип со звуком.
По словам старшего вице-президента, руководителя блока «Развитие генеративного ИИ» «Сбера» Антон Фролов, «Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона». В компании делают ставку на удобство и интуитивность использования.
Разработчики отмечают прогресс в передаче физики реального мира. В новой итерации движения людей, животных и предметов выглядят более естественными, а сцены в целом воспринимаются правдоподобнее. Это результат доработки модели под реалистичную динамику объектов в кадре.
Ограничения и планы
На текущем этапе генерация ограничена длительностью. Из-за высоких вычислительных затрат модель пока не создает ролики длиннее пяти секунд. В Сбере сообщили, что параметр планируется наращивать по мере оптимизации инфраструктуры.
- Автоматическая генерация речи, музыки и ambient-звуков
- Запуск по текстовому запросу или по изображению
- Улучшенная физика движения объектов и персонажей
- Ограничение по длительности до 5 секунд
Параллельно Сбер развивает линейку больших языковых моделей. 10 сентября компания представила GigaChat 3.5 Reasoning с режимом рассуждений. В пресс-материалах новинка позиционируется как единственная российская открытая модель с режимом рассуждений.