Я давно следил за генерацией видео и каждый раз спотыкался об одно и то же: инструменты либо слишком сложные, либо выдают картонный результат. Потом Google открыл создание видео прямо в Gemini, и я решил разобраться на практике. Собрал инструкцию, которая избавит от лишних кликов.
Коротко: чтобы создать видео, не нужно быть монтажёром. Открываешь приложение, выбираешь раздел «Видео», пишешь, что хочешь, при желании прикрепляешь картинки и готовое видео. Дальше модель собирает всё в один ролик. Но есть нюансы, о которых расскажу ниже.
Что нужно для старта
Для старта понадобится Android-устройство или доступ к gemini.google.com. В приложении в левом верхнем углу нажимаешь на меню и выбираешь пункт «Видео». В вебе аналогичный раздел появился после обновления. Если не видишь, обнови страницу и перезайди в аккаунт.
Часть функций, вроде редактирования голоса, доступна с подпиской AI Ultra. Но базовую генерацию видео можно попробовать и без неё. Google официально говорит, что генерация через Gemini Omni занимает считанные минуты. По моим замерам - от тридцати секунд до пары минут в зависимости от длины и количества референсов.
Шаблоны и форматы
Шаблоны в Gemini работают как пресеты. Они задают стиль, длительность и структуру, а тебе остаётся вписать детали. Удобно, когда не хочешь придумывать всё с нуля. Но для уникального результата лучше описывать сцену своими словами.
Соотношение сторон выбирай до запуска. Для вертикальных сторис это 9:16, для YouTube 16:9, для ленты 1:1. После генерации кадрировать сложнее, потому что модель строит композицию под выбранный формат.
Пошаговый процесс создания видео
Сам процесс проще, чем кажется. Я разбил его на шаги, чтобы ничего не упустить.
- Открой приложение Gemini или зайди на gemini.google.com.
- В левом верхнем углу нажми на значок меню и выбери «Видео».
- Если есть готовый шаблон, выбери его. Если нет, пропускай.
- В текстовом поле опиши сюжет. Чем конкретнее, тем лучше.
- Чтобы сделать видео на основе изображений или другого видео, нажми «Добавить изображение» или «Добавить видео» и выбери нужные файлы.
- Проверь соотношение сторон, выбери подходящее и запусти генерацию.
За раз можно загрузить одно видео и до пяти изображений. Этого достаточно, чтобы передать персонажа, стиль или атмосферу. Модель Gemini Omni смешивает текст, картинки и видео, поэтому из простого набора референсов получается полноценный ролик.
Gemini Omni умеет больше, чем кажется
Вся магия держится на модели Gemini Omni. Это не просто генератор картинок, а мультимодальная модель. Она понимает текст, изображения и видео одновременно. Запоминает детали персонажа, следит за логикой движения и позволяет редактировать результат в диалоге.
Например, я загрузил фото человека с собакой и написал «сделай так, будто они бегут по пляжу на закате». Модель оживила картинку, сохранила лица и добавила движение волн. Никаких масок и покадровой анимации. Просто описал сцену словами.
Весь сгенерированный контент в приложении Gemini помечается водяным знаком SynthID. Это невидимая метка, которая позволяет проверять, создан ли ролик Google AI. Для маркировки рекламы и соцсетей это плюс. Если нужно доказать происхождение файла, просто спроси у Gemini, сгенерирован ли он с помощью Google AI.
Редактирование в чате: от замены фона до новых голосов
Самое интересное начинается, когда генерация превращается в диалог. Загрузил видео, попросил изменить фон - получил новую версию. Попросил поменять одежду персонажа - модель перерисовывает детали, сохраняя общий стиль. Перенос стиля тоже работает.
Редактирование можно делать в несколько этапов в одном чате. На каждом шаге добавляешь референсные изображения или видео, уточняешь запрос, получаешь обновлённый ролик. С подпиской AI Ultra доступно редактирование голоса: можно добавить реальный голос или заменить существующий. Звучит как фантастика, но это уже текущая функциональность.
Расширение сцены: что будет дальше
Мне больше всего нравится функция продления ролика. Можно спросить Gemini: «что произойдёт дальше?» и модель продолжит сцену, сохраняя сюжет и персонажей. Это сильно экономит время, когда делаешь серию коротких видео для сторис или рилс.
Реальный пример: ролик из одного фото
Мне нужно было показать клиенту, как будет выглядеть анимированная обложка для курса. Вместо того чтобы нанимать дизайнера, я загрузил в Gemini обложку и написал: «оживи этот кадр, добавь лёгкое движение фона и блики». Через минуту получил видео, которое можно было отправлять в презентации.
Такой подход работает для предпросмотра идей. Сначала генерируешь несколько вариантов, выбираешь лучший, потом уже передаёшь в производство. Экономит часы и нервы.
Gemini API: когда генерацию нужно встроить в продукт
Для автоматизации и продакшена Google предлагает два пути. Первый - Gemini Omni Flash, точнее Gemini Omni 1.1 Flash. В официальной документации она указана как модель по умолчанию для генерации видео. Быстро превращает текст и изображения в короткие ролики. Поддерживает multi-input рассуждения и позволяет уточнять результат в несколько ходов через Interactions API.
Второй путь - Veo 3.1. Эта модель создаёт видео с нативным звуком. Умеет расширять сцену, контролировать последний кадр и работать по изображению как референсу через generateContent API. Если нужен полный контроль и интеграция с legacy-пайплайнами, выбирай Veo 3.1. Для большинства задач хватит Omni Flash, она проще и быстрее.
Промпты, которые работают
Пиши не «сделай красиво», а «девушка в красном платье идёт по ночной улице, неон, дождь, камера медленно наезжает». Указывай действие, окружение, свет, движение камеры и настроение. Если хочешь сохранить персонажа, добавь референсное фото. Если нужна определённая длительность, укажи её в промпте или выбери шаблон. На Reddit практикующие маркетологи советуют то же самое: конкретика в промпте решает.
Начинай с короткого ролика на 3-5 секунд. После генерации задавай уточняющие вопросы: «сделай фон темнее», «ускорь движение», «поверни камеру». Gemini Omni понимает контекст всего чата, поэтому каждое следующее изменение опирается на предыдущее.
Частые ошибки и как их избежать
Типичные ошибки повторяются у всех.
- Слишком абстрактный промпт. Модель не знает, что ты имеешь в виду под «красиво».
- Пропущенные референсы. Одно видео и до пяти изображений это главный инструмент.
- Желание получить всё с первого раза. Генерация это диалог.
- Неправильное соотношение сторон. Его лучше выбрать до запуска.
Проверяй, под какой формат делаешь ролик: вертикальный для сторис, горизонтальный для YouTube, квадратный для ленты. Тогда не придётся переделывать композицию после генерации.
Что делать, если видео не генерируется
Чаще всего проблема в регионе, версии приложения или слишком сложном промпте. Сначала обнови приложение и перезайди в аккаунт. Затем упрости запрос: убери лишние объекты, уменьши количество референсов, разбей сцену на короткие отрезки. Если используешь веб-версию, попробуй другой браузер или режим инкогнито.
Когда ничего не помогает, загляни в официальную справку Google и проверь, доступна ли функция в твоём аккаунте. Иногда генерация видео открывается не сразу, а после обновления приложения или смены региона. В таких случаях не грех держать под рукой альтернативный сервис для генерации видео.
Как получить доступ из России
Пока Google ограничивает доступ из некоторых регионов, генерация видео в Gemini может быть недоступна. На Reddit пользователи часто жалуются на региональные блокировки Gemini и советуют использовать сервисы-агрегаторы вроде 3GPT. Мне в таких случаях удобно пользоваться сервисом 3GPT от 3SELLER. Он даёт доступ ко всем флагманским моделям нейросетей из России без иностранных карт. Старт от 149 рублей, пополнение российской картой, через СБП или криптой.
Внутри есть не только текстовые модели вроде Chat GPT 6 Astra, Claude Fable 5 и других, но и генерация реалистичных изображений, видео и голоса. Для картинок есть отдельная модель Nano Banana. Можно создавать продающие тексты, сайты, обрабатывать картинки и собирать ролики под задачи бизнеса. Получить доступ ко всем флагманским моделям нейросетей из России можно на официальном сайте 3GPT: https://3seller.com/3gpt.
Готовые ИИ агенты на 3GPT
Отдельная фишка 3GPT - готовые ИИ агенты под задачи. Выбираешь готового агента и начинаешь общение. Модель агента можно менять прямо в чате. Удобно, когда хочешь сравнить, какая модель справляется лучше.
Например, можно начать с одного агента для написания сценария, а потом переключиться на другого для генерации идеи. Ссылка на каталог агентов: https://3seller.com/ai/agents.
Практический вывод
Генерация видео в Gemini уже перестала быть игрушкой. С помощью Gemini Omni можно собрать ролик за минуты, отредактировать его в диалоге и получить нормальный результат для соцсетей и рабочих задач. Главное - правильно формулировать запрос и не бояться уточнять.
Мой совет такой: начни с короткого теста, добавь референсы, поиграй с соотношением сторон. Если упрёшься в ограничения доступа, попробуй 3GPT. Там есть всё нужное для работы с нейросетями из России, включая генерацию видео. А если появятся вопросы по промптам, просто спроси модель - она подскажет.