Промпты для ИИ-видео: как писать в 2026
Коротко
Промпт для ИИ-видео — это текстовое задание генератору: кто в кадре, что происходит, как движется камера, какой свет и сколько это длится. В 2026 году тон задают три модели — Sora 2, Kling 3.0 и Google Veo 3.1, — и у каждой свой «характер». Но базовая структура промпта у них общая: субъект → окружение → действие → свет и стиль → движение камеры (в самом конце). Главные правила: одно действие и одно движение камеры на кадр, 2–3 коротких «бита» вместо десяти, конкретика вместо общих слов. Ниже — разбор структуры, таблица приёмов, отличия по генераторам и частые ошибки. Цены и способы доступа даны с пометкой «на июль 2026», без выдуманных цифр.
Из чего состоит промпт для ИИ-видео?
Хороший промпт для видео читается как бриф для съёмочной группы. Профессиональные гайды сходятся на такой последовательности блоков:
- Субъект — кто или что в кадре, с 2–3 деталями внешности.
- Окружение — место, время суток, 3–5 деталей обстановки.
- Действие — что делает субъект: один глагол, одно движение.
- Свет и палитра — источник света и 3–5 опорных цветов, чтобы кадр не «плыл» по тону.
- Стиль — жанр, оптика, референс («кинематографично», «документально», «35 мм»).
- Движение камеры — ставится в самом конце фразы.
Бит (beat) — это одно короткое действие внутри кадра. Модели 2026 года уверенно держат 2–3 бита; если попросить пять действий подряд, картинка «поедет». Длительность и ориентацию (вертикаль или горизонталь) лучше задавать в настройках генератора, а не словами в промпте.
Как описывать движение камеры?
Движение камеры (camera move) — это то, как «оператор» перемещается относительно сцены. Модели понимают киношную лексику, но только по одному приёму на кадр: два движения в одном промпте дают путаницу.
| Приём | Что делает камера | Как писать |
|---|---|---|
| Dolly in/out | Едет вперёд или назад | «медленный наезд на лицо» |
| Track/truck | Едет вбок, параллельно субъекту | «камера едет сбоку от бегущего» |
| Pan | Поворот по горизонтали | «плавная панорама слева направо» |
| Tilt | Наклон по вертикали | «наклон вверх на небоскрёб» |
| Crane/boom | Подъём или спуск | «кран поднимается над толпой» |
| Static | Штатив, кадр неподвижен | «статичный кадр, камера не движется» |
Отдельно про «биты движения»: описывайте то, что видно, — дым тянется вверх, пламя гнётся на ветру, бегун наклоняется вперёд. Открытые формулировки вроде «камера движется куда-то» модель считывает плохо.
Чем отличаются промпты для Sora, Kling и Veo?
Все три модели едят одну и ту же структуру, но реагируют по-разному. Обобщённо, по гайдам на июль 2026:
| Параметр | Sora 2 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|
| Сильная сторона | нарратив, физика, звук | плавное движение, цена | фотореализм, 4K, цвет |
| Стиль промпта | сюжетный, «сценка по битам» | строгая формула, камера в конце | точная операторская лексика, часто JSON |
| Негативные промпты | нет | есть | ограниченно/нет |
| Нативное аудио | да | у части версий нет | да |
Практический вывод: Sora любит короткий сценарий с репликой и звуком, Kling — чистую формулу «субъект → окружение → действие → свет → камера», Veo — предельно точное описание оптики и света, вплоть до структурированного JSON для консистентности между кадрами. Подробное сравнение возможностей — в разборе Sora vs Kling vs Veo, а обзор самих сервисов — в статье нейросети для создания видео 2026.
Таблица приёмов: что усиливает промпт
| Приём | Зачем | Пример формулировки |
|---|---|---|
| Якорь субъекта | не даёт лицу «плыть» | «мужчина 40 лет, седая борода, синяя куртка» |
| 3–5 цветовых опор | держит тон кадра | «палитра: янтарный, графитовый, тёплый белый» |
| Один источник света | реалистичная тень | «свет от окна слева, мягкий» |
| 2–3 бита | связное действие | «наливает кофе, поднимает взгляд, улыбается» |
| Камера в конце | чистое движение | «…медленный наезд» |
| Негатив на 3–5 артефактов | меньше брака | «без текста, без искажений, без лишних пальцев» (где поддерживается) |
Негативный промпт — это список того, чего в кадре быть не должно. Он работает на Kling и Runway; раздувать его до 50 слов вредно — берите 3–5 артефактов, которые реально видели в своих генерациях, а не «всё подряд».
Какие ошибки чаще всего портят видео?
- Слишком много действий. «Бежит, прыгает, падает, встаёт» в одном кадре — гарантированная каша. Разбивайте на отдельные сцены.
- Нет камеры. Без указания движения кадр выходит статичным и «мёртвым».
- Размытые пространственные слова. «Где-то рядом», «на фоне» дают геометрические искажения — пишите конкретнее.
- Два движения камеры. Одно на кадр, и точка.
- Стоп-слова. Невинные на вид слова могут задеть фильтры модерации — переформулируйте.
- Негатив-«свалка». Длинный список запретов ухудшает картинку сильнее, чем помогает.
Навык здесь тот же, что и в текстовых промптах: структура, конкретика, одна мысль на блок. Чтобы прокачать базу, начните с гайда как писать промпты и загляните в готовые промпты для нейросетей.
Сколько это стоит и как получить доступ из РФ?
Коротко и без выдумок, по открытым источникам на июль 2026:
- Sora 2. Отдельные веб-версия и приложение Sora закрыты с 26 апреля 2026; доступ остался внутри ChatGPT (планы Plus и Pro) и через API — по данным источников, API работает до сентября 2026.
- Kling 3.0. Есть бесплатный тариф (около 66 кредитов в день) и платные планы примерно от $10 в месяц; российские карты сервис напрямую не принимает.
- Veo 3.1. Премиум-качество (4K, нативное аудио), стоимость — примерно от $0,40 за секунду генерации.
Цены и условия меняются — перед оплатой сверяйтесь с официальными тарифами и пользуйтесь только легально доступными способами, без обходов блокировок. Про доступ и оплату из России — отдельный разбор Kling AI: как пользоваться в России.
С чего начать?
Возьмите одну сцену, распишите её по шести блокам, задайте одно движение камеры и сгенерируйте. Потом меняйте по одному параметру за раз — так «характер» модели становится понятен быстрее, чем после ещё десяти прочитанных гайдов. Тот же структурный промптинг, что помогает управлять кодом в Claude Code и Cursor через движок Quest, работает и с видео: чёткая структура, один шаг за раз, проверяемый результат. А озвучку и монтаж под готовые ролики закроют нейросети для озвучки текста и нейросети для монтажа видео.
Частые вопросы
С чего начинать промпт — с камеры или с субъекта?
С субъекта и окружения. Движение камеры почти все модели (особенно Kling) считывают лучше, когда оно стоит в самом конце фразы. Сначала — кто и где, потом — что делает, свет и стиль, и только в финале — как движется камера.
Нужен ли негативный промпт?
Не всегда. Его поддерживают не все модели: на Kling и Runway он помогает, у Veo поддержка ограничена или отсутствует. Если используете — держите список коротким: 3–5 артефактов, которые реально портили ваши генерации.
Почему видео получается статичным?
Скорее всего, в промпте нет движения — ни камеры, ни субъекта. Добавьте один приём камеры (наезд, панорама) и один видимый «бит» движения в кадре: дым, ветер, шаг. Одного явного движения обычно достаточно.
Можно ли одним промптом сделать длинную сцену со сменой планов?
Как правило, нет: один промпт — один план с 2–3 битами. Мультишот есть у Kling 3.0, но надёжнее собирать длинное видео из отдельных генераций и склеивать на монтаже.
Промпт для картинки и для видео — это одно и то же?
Нет. В видео добавляются два измерения: время (последовательность битов) и движение (камера плюс динамика в кадре). Хороший промпт для изображения описывает момент, а для видео — ещё и то, как этот момент разворачивается.