mnogoGPTmnogoGPT

Как сделать

Как написать промпт для видео нейросетью: что описывать словами

Игорь Лебедев, видеомейкер · 10 мин чтения · 24 июля 2026

Как написать промпт для видео нейросетью

Открываете генератор, пишете «оживи фото, пусть человек улыбнётся и помашет рукой», и получаете ролик, где лицо дёргается, рука выворачивается под неестественным углом, а от улыбки остаётся гримаса. Знакомая ситуация. Нейросеть не читает мысли, она читает слова, и если слов мало или они спорят друг с другом, результат собирается из того, что осталось от вашей формулировки. Хорошая новость: писать нормальный видео-промпт не сложнее, чем составить список покупок, если знать, из каких частей он складывается.

В этой статье разберу, что стоит описывать словами, чтобы нейросеть поняла задумку с первого раза: что показать в кадре, что должно происходить, куда двигается камера, какой свет и настроение задать. Отдельно разберу движение камеры, его чаще всего забывают указать. Дам готовые заготовки под частые сценарии и честно расскажу, где короткий ролик получается отлично, а где длинная сцена пока разваливается. Проверить формулировку можно в студии https://mnogogpt.ru/studio/, там же есть подсказчик, который помогает собрать описание.

Кратко

Промпт для видео нейросетью строится из шести блоков: что в кадре, что происходит, как движется камера, какой свет и время суток, какой стиль и настроение, какой темп действия. Отдельно стоит прописать, чего в кадре быть не должно, это отсекает случайные искажения. На коротком ролике, 5-10 секунд, лучше всего работает одно чёткое действие, один план и конкретные слова вместо общих фраз вроде «красиво» или «эффектно». Если результат не устроил, правильнее не переписывать промпт с нуля, а поправить один блок и запустить снова. Генерация видео в студии mnogoGPT стоит от 99 рублей за 5 секунд, оплата картой или через СБП, работает из России без VPN.

Из каких частей складывается описание, которое нейросеть понимает

Текст для картинки можно свести к паре слов: «портрет женщины у окна, мягкий свет». С видео так не получится, потому что добавляется время: сцена не просто существует, она разворачивается, и нейросети нужно объяснить, что и в какой момент происходит.

Рабочая схема описания состоит из шести слоёв. Первый: что в кадре, кто или что является героем сцены. Второй: что происходит, какое одно действие разворачивается. Третий: движение камеры, статична она или двигается, и как именно. Четвёртый: свет и время суток. Пятый: стиль и настроение, общая атмосфера ролика. Шестой: темп, с какой скоростью всё происходит. Плюс отдельно список того, чего быть не должно.

Чем короче список, тем выше риск, что нейросеть додумает пропущенное по-своему, и не всегда так, как хотелось бы. Например, если не указать движение камеры, генератор часто сам решает подвигать её, и на коротком ролике это выглядит как случайное дрожание. Разберу каждый блок отдельно, с примерами формулировок.

Что в кадре: как назвать героя и сцену

Начните с того, кто или что находится в центре ролика, и опишите это так, будто объясняете человеку, который никогда не видел исходное фото: возраст, одежда, поза, выражение лица для портрета, форма, материал и цвет для предмета, фон и окружение, если оно важно для сюжета.

Слабая формулировка: «женщина у окна». Нейросеть дорисует произвольную женщину, произвольное окно и произвольный фон, и результат почти наверняка разойдётся с тем, что вы представляли, особенно если работаете не по фото, а по тексту.

Сильная формулировка: «женщина средних лет в светлом свитере сидит у окна, за окном размытый вечерний город, руки лежат на подоконнике». Здесь названы герой, одежда, поза, фон и даже примерное время суток, и у нейросети почти не остаётся места для случайных решений.

Если генерируете видео из своего фото, добавьте фразу «сохрани лицо и фон как на фото, добавь только движение». Так модель будет опираться на реальные детали снимка, а не придумывать своё лицо поверх вашего.

Что происходит: одно действие вместо сюжета

Самая частая причина, по которой короткое видео выходит рваным, это попытка уместить в него сразу несколько событий. На пяти-десяти секундах физически помещается одно ясное действие, максимум два связанных.

Слабая формулировка: «человек встаёт, идёт к двери, открывает её, выходит на улицу и садится в машину». Это пять разных действий, каждое получит меньше секунды, движения смажутся, а переходы будут выглядеть как склейка низкого качества.

Сильная формулировка для одного и того же ролика на пять секунд: «человек медленно встаёт со стула и делает первый шаг к двери». Одно действие, у него есть начало и продолжение, и его можно полностью развернуть за отведённое время. Если нужен весь путь до машины, разумнее собрать его из трёх-четырёх отдельных коротких клипов, а не пытаться впихнуть в один.

Описывайте действие глаголами движения, а не существительными состояния. «Улыбается и медленно поворачивает голову вправо» работает лучше, чем «радостное настроение», потому что глагол задаёт нейросети конкретную траекторию, а существительное оставляет ей додумывать, как эту радость показать.

Движение камеры: как описать простыми словами

Это, пожалуй, самый недооценённый блок промпта. Если не указать, как ведёт себя камера, генератор выбирает движение сам, и часто это выглядит как немотивированное покачивание. Указать движение проще, чем кажется: достаточно назвать один из шести базовых типов и направление.

Статика. Камера неподвижна, стоит как на штативе. Формулировка: «камера статична, кадр не двигается». Это самый предсказуемый вариант и хороший выбор для первого теста нового сюжета, потому что он не добавляет лишних переменных, и вы сразу видите, как ведёт себя сам объект в кадре.

Наезд. Камера медленно приближается к объекту, увеличивая его в кадре. Формулировка: «камера медленно наезжает на лицо» или «плавное приближение к детали, финальный кадр крупным планом». Хорошо работает, когда нужно подчеркнуть эмоцию на лице или деталь предмета: текстуру ткани, гравировку, блик на украшении.

Отъезд. Обратное движение: камера отдаляется, открывая больше пространства вокруг объекта. Формулировка: «камера плавно отъезжает, в кадре появляется вся комната» или «отдаление от лица, открывается вид на улицу за спиной». Подходит для финальных кадров, когда нужно показать масштаб сцены после того, как зритель уже разглядел героя.

Панорама. Камера двигается в сторону, обычно слева направо или справа налево, не приближаясь и не отдаляясь. Формулировка: «камера панорамирует слева направо на уровне глаз» или «медленное горизонтальное движение камеры вдоль витрины». Хорошо подходит для показа протяжённого пространства: интерьера, витрины, пейзажа.

Облёт. Камера двигается по дуге или полному кругу вокруг объекта. Формулировка: «камера облетает человека по кругу слева направо» или «лёгкий облёт вокруг товара, четверть оборота». Эффектный приём для рекламы предмета, потому что показывает объём и форму со всех сторон за одно движение.

Следование. Камера движется вместе с объектом, держа его на одном месте в кадре, пока меняется фон. Формулировка: «камера следует за человеком сбоку, на уровне плеч». Создаёт ощущение живой съёмки, но требует, чтобы траектория героя была простой, иначе камера и объект начинают конфликтовать.

Комбинировать два движения в одном коротком клипе почти всегда лишнее: наезд с одновременным облётом на пяти секундах выглядит суетливо. Возьмите одно движение, назовите его прямо и добавьте скорость, «медленно» или «плавно» вместо молчания.

Свет и время суток

Свет задаёт настроение сильнее, чем кажется на первый взгляд, и нейросеть неплохо считывает словесные описания освещения, если они конкретные.

Готовые формулировки под разное время суток и характер света: «мягкий утренний свет, длинные тени», «яркий полуденный свет, чёткие тени», «золотой час, тёплый оранжевый свет закатного солнца», «пасмурный рассеянный свет без резких теней», «вечерние сумерки, синеватый холодный свет», «свет свечи, тёплые блики на лице», «неоновая подсветка, розово-голубые отблески», «студийный ровный свет без резких теней».

Если снимаете портрет по фото, где свет уже задан снимком, добавьте «сохрани освещение как на фото», так меньше риск, что нейросеть перепишет тон кожи или фона. Если сцена создаётся с нуля по тексту, свет стоит описывать в первую очередь: он задаёт цветовой характер кадра раньше остального.

Стиль и настроение

Отдельно от света стоит блок общей атмосферы: в каком жанре и с каким настроением должен смотреться ролик. Здесь работают короткие устойчивые формулировки, а не длинные рассуждения о чувствах.

Примеры: «кинематографично, как кадр из фильма», «документально, как домашняя съёмка на телефон», «тепло и ностальгически, как старая семейная плёнка», «динамично и энергично, как рекламный ролик», «спокойно и медитативно, без резких движений», «празднично, с лёгким ощущением торжества».

Настроение и свет обычно идут в паре: тёплый вечерний свет плюс «ностальгически» дадут связный результат, а холодный неоновый свет плюс «тепло и по-домашнему» будут спорить друг с другом внутри одного промпта.

Темп: с какой скоростью всё происходит

Темп часто пропускают, а зря, потому что на коротком ролике именно он решает, успеет ли действие развернуться естественно или сожмётся в дёрганую перемотку.

Формулировки для медленного темпа: «плавно, без резких скачков», «замедленно, как в слоу-мо», «неторопливое движение». Для быстрого: «динамично, короткие резкие движения», «энергично, быстрая смена акцента внутри кадра».

Правило простое: чем короче ролик, тем меньше в нём должно происходить, и тем аккуратнее нужно называть темп. Если действие крупное, скажем, человек встаёт со стула и делает шаг, на пяти секундах уместнее плавный темп, потому что резкий будет выглядеть как ускоренная перемотка. Быстрый темп лучше приберечь для мелких движений: взмах ресниц, поворот кисти, короткая вспышка света.

Чего в кадре быть не должно

Указывать запреты так же полезно, как описывать желаемое, особенно если раньше уже сталкивались с конкретным искажением. Нейросеть учитывает негативные формулировки почти так же охотно, как положительные.

Примеры: «без текста и надписей на экране», «без посторонних людей на фоне», «руки не должны сближаться с лицом», «без резкой смены плана», «фон не должен меняться», «без лишних предметов на столе». Если предыдущая попытка вышла неудачной из-за конкретной детали, например лицо исказилось при повороте, добавьте «без поворота головы больше чем на четверть» в следующий запуск. Это работает точнее, чем просто «сделай красивее».

Готовые заготовки под сценарии

Ниже пять шаблонов, собранных по описанной схеме. Меняйте детали под своё фото или свою задумку, сохраняя структуру блоков.

Оживление портрета. «Мужчина на фото медленно поворачивает голову вправо и слегка улыбается, взгляд направлен в камеру. Камера статична. Свет как на фото. Настроение тёплое, спокойное. Темп плавный, без резких движений. Без искажения черт лица, без поворота головы больше чем на четверть».

Ролик из архива. «Пожилая женщина на старом чёрно-белом фото медленно моргает и слегка наклоняет голову, лёгкая улыбка. Камера статична, лёгкий медленный наезд к финалу. Свет и тон как на оригинальном фото, не менять цветовую гамму. Настроение ностальгическое, тёплое. Темп очень плавный. Без цветной раскраски, без посторонних людей на фоне».

Реклама товара. «Крем в стеклянной баночке стоит на светлом фоне, крышка приоткрыта, лёгкий пар поднимается сбоку. Камера медленно облетает баночку слева направо, четверть оборота. Свет мягкий, студийный, без резких теней. Настроение чистое, премиальное. Темп плавный. Без посторонних предметов в кадре, без текста на экране».

Атмосферный фон. «Дождь мягко падает на стекло окна, за стеклом размытые огни вечернего города. Камера статична. Свет вечерний, синеватый, с тёплыми пятнами огней на заднем плане. Настроение спокойное, медитативное. Темп очень медленный, движение только у капель дождя. Без людей в кадре, без резких вспышек света».

Поздравление. «Букет цветов на столе, рядом горит свеча, лёгкое движение пламени. Камера медленно наезжает от общего плана к букету. Свет тёплый, свечной, мягкие блики. Настроение праздничное, уютное. Темп плавный. Без текста внутри кадра, надпись добавим отдельно поверх готового видео».

Держите эти пять каркасов под рукой и подставляйте свои детали, вместо того чтобы каждый раз собирать промпт с нуля.

Частые ошибки в промпте для видео

Слишком много действий в одном коротком ролике. Встречается чаще всех остальных ошибок. Пять-десять секунд физически вмещают одно действие. Если в описании три и больше глаголов движения, урежьте до одного, а остальное перенесите в следующий клип.

Противоречивые требования внутри одного промпта. «Камера статична, но медленно облетает объект» или «холодный зимний свет, тёплое летнее настроение» ставят нейросеть перед выбором не в вашу пользу. Перечитайте промпт перед запуском и проверьте, не спорят ли блоки друг с другом.

Отсутствие указания на движение камеры. Если промолчать про камеру, генератор часто добавляет случайное лёгкое покачивание, которое на коротком ролике читается как техническая тряска, а не художественный приём. Даже простое «камера статична» уже убирает эту случайность.

Попытка уместить целый сюжет в пять секунд. Встреча, разговор, объятия и уход за одну генерацию не получатся связно. Разбейте историю на сцены и генерируйте каждую отдельно, а затем соберите их вместе при монтаже. Так каждая сцена получает достаточно времени, чтобы действие выглядело естественным, а не смазанным.

Как дорабатывать промпт, а не переписывать заново

Частая ошибка после неудачного результата, переписать весь промпт с нуля. Это почти всегда медленнее и хуже, чем точечная правка. Если четыре блока из шести сработали нормально, а один вышел криво, замените только этот один блок и запустите снова.

Например, если герой в кадре получился похожим, действие выглядит естественно, а свет и настроение подошли, но камера дёрнулась не туда, поправьте только фразу про камеру: «камера статична» вместо «камера медленно двигается». Остальной текст трогать не нужно, он уже показал, что работает.

Такой подход экономит генерации и время: вы видите, какой блок влияет на результат, и постепенно нащупываете формулировки, которые стабильно дают нужную картинку для вашего типа сцен. Переписывание с нуля каждый раз возвращает к случайному результату, потому что меняются сразу все переменные.

Честно про пределы: что пока получается хуже

Скажу прямо, чтобы не создавать завышенных ожиданий. Короткие простые сцены с одним действием нейросеть делает уверенно и предсказуемо. А вот длинные сложные сцены с несколькими героями или сменой локации внутри клипа получаются заметно хуже: движения смазываются, лица могут поплыть к середине ролика, логика действия иногда рассыпается.

Это не повод отказываться от амбициозных сюжетов, а повод менять подход к ним. Вместо одного длинного промпта на тридцать секунд соберите три-четыре коротких клипа по пять-десять секунд, каждый с одним чётким действием, и склейте их в видеоредакторе. Результат выйдет заметно чище, чем попытка выжать сложную историю из одной генерации, и отдельный неудачный кусок можно переснять, не трогая остальные.

Как сделать: по шагам

  1. Определите одно действие. Решите, что происходит в кадре, и сформулируйте его одним глаголом движения, а не набором событий.
  2. Опишите, кто или что в кадре. Возраст, одежда, поза, материал, цвет, фон, всё, что нейросеть не должна додумывать сама.
  3. Назовите движение камеры. Выберите один тип из шести: статика, наезд, отъезд, панорама, облёт, следование, и укажите направление.
  4. Задайте свет и настроение. Время суток, характер освещения, общая атмосфера ролика в паре коротких фраз.
  5. Укажите темп. Плавно или динамично, в зависимости от того, насколько крупное действие происходит за отведённые секунды.
  6. Добавьте запреты. Пропишите, чего в кадре быть не должно, особенно если раньше уже видели конкретное искажение.
  7. Запустите и доработайте. Оцените результат, замените только слабый блок и запустите снова, не переписывая весь текст.

Часто задаваемые вопросы

Из чего должен состоять промпт для видео нейросетью?

Из шести частей: что в кадре, что происходит, движение камеры, свет и время суток, стиль и настроение, темп действия. Отдельно полезно указать, чего быть не должно. Чем конкретнее каждый блок, тем меньше нейросеть додумывает сама.

Почему важно указывать движение камеры?

Если промолчать про камеру, генератор часто выбирает движение сам, и на коротком ролике это выглядит как случайное дрожание, а не осознанный приём. Достаточно назвать один из типов, статика, наезд, отъезд, панорама, облёт, следование, и добавить направление, чтобы движение стало предсказуемым.

Сколько действий можно уместить в один короткий ролик?

На пяти-десяти секундах помещается одно ясное действие, максимум два связанных. Если пытаетесь описать сцену с несколькими событиями, движения смажутся, а переходы будут выглядеть как грубая склейка. Разбейте сюжет на несколько коротких клипов и соберите их при монтаже.

Что делать, если результат вышел неудачным?

Не переписывайте промпт целиком. Определите, какой именно блок сработал не так, свет, камера, действие, и поправьте только его, оставив остальной текст без изменений. Так вы видите, что именно повлияло на результат, и быстрее находите рабочую формулировку.

Почему длинные сложные сцены получаются хуже коротких?

На длинных роликах с несколькими событиями или сменой локации внутри одной генерации движения смазываются, а лица иногда плывут к середине клипа. Короткие сцены с одним действием сейчас получаются заметно стабильнее. Сложную историю лучше собрать из нескольких коротких клипов и склеить при монтаже.

Нужно ли описывать свет, если генерирую видео по своему фото?

Не всегда. Если освещение на фото уже подходящее, проще написать «сохрани освещение как на фото», чем описывать его заново словами. Так меньше риск, что нейросеть случайно поменяет тон кожи или цвет фона. Свет стоит описывать отдельно, только если сцена создаётся с нуля по тексту.

Можно ли комбинировать несколько движений камеры в одном ролике?

Технически можно, но на коротком клипе, пять-десять секунд, это почти всегда лишнее. Одновременный наезд и облёт выглядят суетливо и отвлекают от самого действия в кадре. Возьмите одно движение камеры, назовите его прямо и добавьте направление и скорость, этого достаточно для чистого результата.

Сколько стоит генерация видео по промпту?

В студии mnogoGPT видео стоит от 99 рублей за 5 секунд, оплата картой или через СБП, без подписки. Это позволяет протестировать несколько формулировок промпта и выбрать лучший результат, не переплачивая за студийную съёмку. Сервис работает из России без VPN и иностранных карт.

Всё по теме: промпты для видео нейросетью

Хороший промпт для видео нейросетью это не литературный текст, а собранная по схеме конструкция: кадр, действие, камера, свет, настроение и темп, плюс список того, чего быть не должно. Держите ролик коротким и с одним действием, называйте движение камеры прямо, а после неудачного результата дорабатывайте только слабый блок, а не текст целиком. Попробовать можно прямо сейчас в студии https://mnogogpt.ru/studio/: от 99 рублей за 5 секунд, оплата картой или через СБП, из России без VPN.

Открыть студию mnogoGPT →