В Givon AI появились четыре новые модели: Wan 2.7, Grok Imagine, Kling O1 и Kling 3.0 Omni.
Каждая закрывает свой сценарий — в каталоге теперь есть и мультирежимная линейка для изображений и видео, и длинное видео со звуком, и точный контроль через кадры, и AI-раскадровка для многосценовых роликов.
Wan 2.7: изображения и видео с motion-референсами
Wan 2.7 — линейка от Alibaba, которая охватывает и изображения, и видео. Для изображений доступны генерация по тексту с поддержкой до 9 референсов и редактирование (1K/2K; Wan Image Pro добавляет 4K). Для видео — два режима: обычный ролик по тексту или изображению длиной 2–15 секунд и Reference-to-Video (R2V) для работы с motion-ориентиром.
Wan 2.7 включает Thinking Mode: прежде чем генерировать, модель анализирует промпт и планирует композицию — результат получается осмысленнее на сложных описаниях, где важны цвет, расположение объектов и характер движения.
R2V — отдельный режим: загрузи стартовый кадр и видео-образец, модель ориентируется на характер движения из этого ролика. Полезно, когда нужно повторить определённый тип камеры, походку персонажа или стиль сцены из существующего клипа.
Изображения: до 9 референсов, 1K–4K
Wan 2.7 Image принимает до 9 визуальных ориентиров и поддерживает редактирование. Image Pro добавляет разрешение 4K.
Видео: 2–15 секунд, 720p/1080p
Текст или изображение на вход, первый и последний кадр, пять форматов кадра. Без нативного звука.
Reference-to-Video (R2V): motion-ориентир
Стартовый кадр обязателен. Добавь видео-образец — модель ориентируется на характер движения из него при создании нового ролика.
Grok Imagine: изображения и длинное видео со звуком
Grok Imagine от xAI — это и изображения, и видео. Для изображений: до 5 референсов, редактирование. Для видео — один из самых длинных форматов в каталоге: от 6 до 30 секунд. Нативный ambient-звук включён в каждый ролик автоматически.
Изображения с референсами
Grok Imagine принимает до 5 визуальных ориентиров и поддерживает редактирование исходника.
Видео до 30 секунд
Самая длинная форматная модель видео в каталоге: от 6 до 30 секунд. Подходит для развёрнутых клипов, сцен с нарративом или форматов, где нужно больше времени.
Нативный звук
Ambient-аудио всегда включён в ролик — встроенная особенность архитектуры, не отдельная настройка.
Kling O1 и Kling 3.0 Omni: контроль движения и сцены
Kling O1 и Kling 3.0 Omni решают разные задачи. O1 — для точного контроля: первый и последний кадр, motion-референс, до 7 ориентиров. Omni — для более свободных сцен: нативный звук, до 15 секунд, многосценовой формат и AI Director — встроенный инструмент, который автоматически планирует углы камеры, типы планов и расположение персонажей по промпту.
Kling O1: первый и последний кадр
3–10 секунд, до 7 визуальных ориентиров, motion-референс как образец движения. Для предсказуемых переходов и точного контроля начала и финала.
Kling 3.0 Omni: сцены со звуком и AI Director
3–15 секунд, нативный звук (можно включить или выключить). AI Director автоматически планирует углы камеры, типы планов и расположение персонажей. Задай несколько сцен в одном запросе — каждая со своим промптом.
Какую модель выбрать под задачу
Нужны изображения — Wan 2.7
До 9 референсов, редактирование, 1K–4K. Для видео без звука по тексту и изображению.
Нужно длинное видео со звуком — Grok Imagine
До 30 секунд, нативный ambient-звук, текст или стартовый кадр на вход.
Важен точный контроль через кадры — Kling O1
Первый + последний кадр, motion-референс, до 7 ориентиров, 3–10 секунд.
Нужны сцены со звуком — Kling 3.0 Omni
Многосценовое видео, нативный аудио-toggle, до 15 секунд.
Новые модели доступны в каталоге — одну сцену удобно запустить сразу в нескольких и сравнить характер результата.


