qvib.pro
EN

~7 мин чтения · всем · Обновлено: 17.07.2026

Промпты для ИИ-видео: как писать в 2026

Промпты для ИИ-видео: как писать в 2026

Коротко

Промпт для ИИ-видео — это текстовое задание генератору: кто в кадре, что происходит, как движется камера, какой свет и сколько это длится. В 2026 году тон задают три модели — Sora 2, Kling 3.0 и Google Veo 3.1, — и у каждой свой «характер». Но базовая структура промпта у них общая: субъект → окружение → действие → свет и стиль → движение камеры (в самом конце). Главные правила: одно действие и одно движение камеры на кадр, 2–3 коротких «бита» вместо десяти, конкретика вместо общих слов. Ниже — разбор структуры, таблица приёмов, отличия по генераторам и частые ошибки. Цены и способы доступа даны с пометкой «на июль 2026», без выдуманных цифр.

Из чего состоит промпт для ИИ-видео?

Хороший промпт для видео читается как бриф для съёмочной группы. Профессиональные гайды сходятся на такой последовательности блоков:

  • Субъект — кто или что в кадре, с 2–3 деталями внешности.
  • Окружение — место, время суток, 3–5 деталей обстановки.
  • Действие — что делает субъект: один глагол, одно движение.
  • Свет и палитра — источник света и 3–5 опорных цветов, чтобы кадр не «плыл» по тону.
  • Стиль — жанр, оптика, референс («кинематографично», «документально», «35 мм»).
  • Движение камеры — ставится в самом конце фразы.

Бит (beat) — это одно короткое действие внутри кадра. Модели 2026 года уверенно держат 2–3 бита; если попросить пять действий подряд, картинка «поедет». Длительность и ориентацию (вертикаль или горизонталь) лучше задавать в настройках генератора, а не словами в промпте.

Как описывать движение камеры?

Движение камеры (camera move) — это то, как «оператор» перемещается относительно сцены. Модели понимают киношную лексику, но только по одному приёму на кадр: два движения в одном промпте дают путаницу.

Приём Что делает камера Как писать
Dolly in/out Едет вперёд или назад «медленный наезд на лицо»
Track/truck Едет вбок, параллельно субъекту «камера едет сбоку от бегущего»
Pan Поворот по горизонтали «плавная панорама слева направо»
Tilt Наклон по вертикали «наклон вверх на небоскрёб»
Crane/boom Подъём или спуск «кран поднимается над толпой»
Static Штатив, кадр неподвижен «статичный кадр, камера не движется»

Отдельно про «биты движения»: описывайте то, что видно, — дым тянется вверх, пламя гнётся на ветру, бегун наклоняется вперёд. Открытые формулировки вроде «камера движется куда-то» модель считывает плохо.

Чем отличаются промпты для Sora, Kling и Veo?

Все три модели едят одну и ту же структуру, но реагируют по-разному. Обобщённо, по гайдам на июль 2026:

Параметр Sora 2 Kling 3.0 Veo 3.1
Сильная сторона нарратив, физика, звук плавное движение, цена фотореализм, 4K, цвет
Стиль промпта сюжетный, «сценка по битам» строгая формула, камера в конце точная операторская лексика, часто JSON
Негативные промпты нет есть ограниченно/нет
Нативное аудио да у части версий нет да

Практический вывод: Sora любит короткий сценарий с репликой и звуком, Kling — чистую формулу «субъект → окружение → действие → свет → камера», Veo — предельно точное описание оптики и света, вплоть до структурированного JSON для консистентности между кадрами. Подробное сравнение возможностей — в разборе Sora vs Kling vs Veo, а обзор самих сервисов — в статье нейросети для создания видео 2026.

Таблица приёмов: что усиливает промпт

Приём Зачем Пример формулировки
Якорь субъекта не даёт лицу «плыть» «мужчина 40 лет, седая борода, синяя куртка»
3–5 цветовых опор держит тон кадра «палитра: янтарный, графитовый, тёплый белый»
Один источник света реалистичная тень «свет от окна слева, мягкий»
2–3 бита связное действие «наливает кофе, поднимает взгляд, улыбается»
Камера в конце чистое движение «…медленный наезд»
Негатив на 3–5 артефактов меньше брака «без текста, без искажений, без лишних пальцев» (где поддерживается)

Негативный промпт — это список того, чего в кадре быть не должно. Он работает на Kling и Runway; раздувать его до 50 слов вредно — берите 3–5 артефактов, которые реально видели в своих генерациях, а не «всё подряд».

Какие ошибки чаще всего портят видео?

  • Слишком много действий. «Бежит, прыгает, падает, встаёт» в одном кадре — гарантированная каша. Разбивайте на отдельные сцены.
  • Нет камеры. Без указания движения кадр выходит статичным и «мёртвым».
  • Размытые пространственные слова. «Где-то рядом», «на фоне» дают геометрические искажения — пишите конкретнее.
  • Два движения камеры. Одно на кадр, и точка.
  • Стоп-слова. Невинные на вид слова могут задеть фильтры модерации — переформулируйте.
  • Негатив-«свалка». Длинный список запретов ухудшает картинку сильнее, чем помогает.

Навык здесь тот же, что и в текстовых промптах: структура, конкретика, одна мысль на блок. Чтобы прокачать базу, начните с гайда как писать промпты и загляните в готовые промпты для нейросетей.

Сколько это стоит и как получить доступ из РФ?

Коротко и без выдумок, по открытым источникам на июль 2026:

  • Sora 2. Отдельные веб-версия и приложение Sora закрыты с 26 апреля 2026; доступ остался внутри ChatGPT (планы Plus и Pro) и через API — по данным источников, API работает до сентября 2026.
  • Kling 3.0. Есть бесплатный тариф (около 66 кредитов в день) и платные планы примерно от $10 в месяц; российские карты сервис напрямую не принимает.
  • Veo 3.1. Премиум-качество (4K, нативное аудио), стоимость — примерно от $0,40 за секунду генерации.

Цены и условия меняются — перед оплатой сверяйтесь с официальными тарифами и пользуйтесь только легально доступными способами, без обходов блокировок. Про доступ и оплату из России — отдельный разбор Kling AI: как пользоваться в России.

С чего начать?

Возьмите одну сцену, распишите её по шести блокам, задайте одно движение камеры и сгенерируйте. Потом меняйте по одному параметру за раз — так «характер» модели становится понятен быстрее, чем после ещё десяти прочитанных гайдов. Тот же структурный промптинг, что помогает управлять кодом в Claude Code и Cursor через движок Quest, работает и с видео: чёткая структура, один шаг за раз, проверяемый результат. А озвучку и монтаж под готовые ролики закроют нейросети для озвучки текста и нейросети для монтажа видео.

Частые вопросы

С чего начинать промпт — с камеры или с субъекта?

С субъекта и окружения. Движение камеры почти все модели (особенно Kling) считывают лучше, когда оно стоит в самом конце фразы. Сначала — кто и где, потом — что делает, свет и стиль, и только в финале — как движется камера.

Нужен ли негативный промпт?

Не всегда. Его поддерживают не все модели: на Kling и Runway он помогает, у Veo поддержка ограничена или отсутствует. Если используете — держите список коротким: 3–5 артефактов, которые реально портили ваши генерации.

Почему видео получается статичным?

Скорее всего, в промпте нет движения — ни камеры, ни субъекта. Добавьте один приём камеры (наезд, панорама) и один видимый «бит» движения в кадре: дым, ветер, шаг. Одного явного движения обычно достаточно.

Можно ли одним промптом сделать длинную сцену со сменой планов?

Как правило, нет: один промпт — один план с 2–3 битами. Мультишот есть у Kling 3.0, но надёжнее собирать длинное видео из отдельных генераций и склеивать на монтаже.

Промпт для картинки и для видео — это одно и то же?

Нет. В видео добавляются два измерения: время (последовательность битов) и движение (камера плюс динамика в кадре). Хороший промпт для изображения описывает момент, а для видео — ещё и то, как этот момент разворачивается.