В Givon AI появились Wan, Grok Imagine, Kling O1 и Kling 3.0 Omni

В каталог Givon AI добавили новые модели для изображений и видео: Wan, Grok Imagine, Kling O1 и Kling 3.0 Omni.

В Givon AI появились четыре новые модели: Wan 2.7, Grok Imagine, Kling O1 и Kling 3.0 Omni.

Каждая закрывает свой сценарий — в каталоге теперь есть и мультирежимная линейка для изображений и видео, и длинное видео со звуком, и точный контроль через кадры, и AI-раскадровка для многосценовых роликов.

Wan 2.7: изображения и видео с motion-референсами

Wan 2.7 — линейка от Alibaba, которая охватывает и изображения, и видео. Для изображений доступны генерация по тексту с поддержкой до 9 референсов и редактирование (1K/2K; Wan Image Pro добавляет 4K). Для видео — два режима: обычный ролик по тексту или изображению длиной 2–15 секунд и Reference-to-Video (R2V) для работы с motion-ориентиром.

Wan 2.7 включает Thinking Mode: прежде чем генерировать, модель анализирует промпт и планирует композицию — результат получается осмысленнее на сложных описаниях, где важны цвет, расположение объектов и характер движения.

R2V — отдельный режим: загрузи стартовый кадр и видео-образец, модель ориентируется на характер движения из этого ролика. Полезно, когда нужно повторить определённый тип камеры, походку персонажа или стиль сцены из существующего клипа.

  • Изображения: до 9 референсов, 1K–4K

    Wan 2.7 Image принимает до 9 визуальных ориентиров и поддерживает редактирование. Image Pro добавляет разрешение 4K.

  • Видео: 2–15 секунд, 720p/1080p

    Текст или изображение на вход, первый и последний кадр, пять форматов кадра. Без нативного звука.

  • Reference-to-Video (R2V): motion-ориентир

    Стартовый кадр обязателен. Добавь видео-образец — модель ориентируется на характер движения из него при создании нового ролика.

Grok Imagine: изображения и длинное видео со звуком

Grok Imagine от xAI — это и изображения, и видео. Для изображений: до 5 референсов, редактирование. Для видео — один из самых длинных форматов в каталоге: от 6 до 30 секунд. Нативный ambient-звук включён в каждый ролик автоматически.

  • Изображения с референсами

    Grok Imagine принимает до 5 визуальных ориентиров и поддерживает редактирование исходника.

  • Видео до 30 секунд

    Самая длинная форматная модель видео в каталоге: от 6 до 30 секунд. Подходит для развёрнутых клипов, сцен с нарративом или форматов, где нужно больше времени.

  • Нативный звук

    Ambient-аудио всегда включён в ролик — встроенная особенность архитектуры, не отдельная настройка.

Kling O1 и Kling 3.0 Omni: контроль движения и сцены

Kling O1 и Kling 3.0 Omni решают разные задачи. O1 — для точного контроля: первый и последний кадр, motion-референс, до 7 ориентиров. Omni — для более свободных сцен: нативный звук, до 15 секунд, многосценовой формат и AI Director — встроенный инструмент, который автоматически планирует углы камеры, типы планов и расположение персонажей по промпту.

  • Kling O1: первый и последний кадр

    3–10 секунд, до 7 визуальных ориентиров, motion-референс как образец движения. Для предсказуемых переходов и точного контроля начала и финала.

  • Kling 3.0 Omni: сцены со звуком и AI Director

    3–15 секунд, нативный звук (можно включить или выключить). AI Director автоматически планирует углы камеры, типы планов и расположение персонажей. Задай несколько сцен в одном запросе — каждая со своим промптом.

Какую модель выбрать под задачу

  • Нужны изображения — Wan 2.7

    До 9 референсов, редактирование, 1K–4K. Для видео без звука по тексту и изображению.

  • Нужно длинное видео со звуком — Grok Imagine

    До 30 секунд, нативный ambient-звук, текст или стартовый кадр на вход.

  • Важен точный контроль через кадры — Kling O1

    Первый + последний кадр, motion-референс, до 7 ориентиров, 3–10 секунд.

  • Нужны сцены со звуком — Kling 3.0 Omni

    Многосценовое видео, нативный аудио-toggle, до 15 секунд.

Новые модели доступны в каталоге — одну сцену удобно запустить сразу в нескольких и сравнить характер результата.

Вопросы о новых моделях

Читай также