Этот клип от первой ноты до последнего кадра сделали нейросети. Песню спел ElevenLabs, героиню нарисовал Grok, петь её заставил Seedance, а режиссировал, писал текст и монтировал агент в Claude Code. Я дал задачу, выбрал лучший дубль на слух и несколько раз сказал «не то». Ушло около трёх часов, и всё это время я занимался своими делами. Сам клип и короткий рассказ о нём вышли постом в канале «рис. AI».
Этот гайд для тех, кто никогда не делал видео с агентами и хочет понять, как такое устроено. Здесь мало технических подробностей и много объяснений: что понадобилось, как шла работа, где агент справился сам и где без человека было нельзя. И главное, какие принципы из этого получились. Они пригодятся не только для клипов, а для любой работы, которую вы отдаёте агентам.
Ты кожаный ассистент, а я твой бог.
Строка из первого куплета. Её придумал агент, прочитав чат вайбкодеров
Что вообще произошло
В интернете разошёлся англоязычный клип «Claude Pop: I'm Upping My P(Doom)» от автора OtherReality, поп-песня про то, как быстро развивается ИИ. Его сделал тот же Claude Opus 5.5 в Claude Code, и автор выложил все исходники. Вот он:
Интересно, как он устроен. Этот клип целиком нарисован кодом: модель написала программу, которая рисует каждый кадр мазками кисти, а персонажа Clawd, маскота Claude, его анимацию и переходы между сценами придумала сама. Песня при этом взята готовая, её когда-то спела другая нейросеть. Обычно ИИ-клипы делают одним из двух способов: либо код рисует графику, как здесь, либо видеомодель генерирует ролик целиком.
Наш клип собран иначе, из обоих подходов сразу. Песню, текст и голос мы сгенерировали сами. Героиню нарисовала нейросеть для картинок, а сцены, где она поёт и шевелит губами точно в слова, сняла нейросеть для видео. Код остался режиссёром монтажа: он расставляет эти сцены по времени песни и рисует поверх надписи, рамки и эффекты. Поэтому здесь есть живой персонаж, который поёт, и при этом любую правку можно внести за минуты.
Я отдал этот клип агенту и попросил русскую версию: на языке чата вайбкодеров, с инструментами из моих подписок. Больше указаний не было.
Дальше агент работал как маленькая студия. Он сам разобрался, чем говорит аудитория, написал текст, заказал песню, придумал героиню, нарисовал для неё кадры, снял сцены, где она поёт, собрал монтаж, добавил надписи, эффекты и звуки и ужал файл, чтобы клип сам запускался в Telegram.
Несколько слов, которые встретятся дальше:
- Агент
- Программа на основе языковой модели, которая не просто отвечает в чате, а сама выполняет задачу по шагам: пишет файлы, запускает сервисы, проверяет результат. Здесь это Claude Code с моделью Opus 5.5.
- Субагент
- Помощник, которого главный агент запускает на отдельную задачу, например на исследование. Работает параллельно и возвращает короткий итог.
- Генерация
- Один запуск нейросети: одна песня, одна картинка, одна сцена. Каждая стоит денег или кредитов подписки.
- Дубль
- Один вариант песни. Нейросеть каждый раз поёт по-разному, поэтому делают несколько дублей и выбирают лучший.
- Липсинк
- Сцена, где персонаж поёт, и губы попадают в слова уже записанной песни.

Что нам понадобилось
Кажется, что для клипа нужна команда: музыкант, художник, аниматор, монтажёр. Здесь всех заменили подписки на нейросети и один агент, который ими управлял. Вот полный список ингредиентов.
- Образец. Готовый клип, на который можно показать пальцем: «сделай так же». Образец экономит часы объяснений.
- Язык аудитории. Архив чата вайбкодеров, 40 тысяч сообщений. Из него агент взял слова и шутки, которые люди действительно говорят.
- Подписки. Я дал агенту задачу использовать мои подписки. Список всех сервисов с тарифами и ценами у меня лежит в штабе: это папка с файлами, где агенты хранят всё про мою работу. Так устроена моя личная корпорация агентов Personal Corp. Агент прочитал этот список и сам решил, какой сервис под какую задачу взять.
- Около трёх часов. Работа шла фоном, человек в это время занимался своими делами.
- Человек на четыре решения. Утвердить слова и хук, выбрать дубль песни, одобрить героиню, принять монтаж. Всё остальное агент сделал сам.
Сервисы и сколько каждый стоит по обычному месячному тарифу:





Как мы это сделали
Работа шла по конвейеру из девяти шагов. Важно не столько, что делал каждый шаг, сколько где стоят чёрные рамки: это места, где решал человек. Каждая такая проверка стоит перед шагом, который обходится дороже предыдущего.
Сначала агент изучил аудиторию. Он запустил пять помощников-субагентов одновременно: один разбирал чат вайбкодеров, другой визуальные тренды, третий режиссуру, ещё двое выясняли, что умеют сервисы. Первый вариант текста агент написал на английских мемах вроде P(doom), и я сразу его остановил:
Норм, только что за слова «пи-дум» и «фум»? В русском сленге их никто не знает.
моё сообщение агенту
Проверяй слова по чату вайбкодеров: аудитория именно они.
После этого хуком стала фраза, которую в чате узнают все: «Вы абсолютно правы». Так отвечает ИИ-ассистент на любое замечание, даже когда сам всё сломал.
Потом появилась песня. Агент написал текст и отправил его в ElevenLabs вместе с описанием звука: жанр, темп, женский голос, русский язык. Нейросеть спела 14 вариантов. Агент проверил каждый программой, которая распознаёт слова, и лучший по цифрам оказался с неправильными ударениями. Машина этого не слышит, а человек слышит сразу, поэтому финальный дубль выбрал я.
Дальше героиня. Рисовала её нейросеть Grok Imagine от xAI. Сначала агент заказывал у неё только картинки: они намного дешевле видео. Карандашный набросок и акварель я отклонил, бумажный стиль тоже. Попросил героиню в духе аниме «Призрак в доспехах», белые чистые фоны и рамки, как у камер наблюдения. Когда образ утвердили, Grok Imagine рисовал по нему первый кадр каждой сцены, чтобы героиня везде оставалась собой.




Потом сцены. Для каждой части песни, где героиня поёт в кадре, агент отдавал Seedance три вещи: первый кадр, образ героини и кусок голоса. Нейросеть оживляла картинку так, что губы попадали в слова. Всего вышло 16 сцен, в 15 она поёт и в одной танцует, и ещё 10 вставок без пения: спящий за ноутбуком парень, глаза, дата-центр ночью. Каждую сцену с пением агент проверял сам: сравнивал звук с песней и смотрел, смыкаются ли губы на «п», «б» и «м».












И наконец монтаж. Обычно это дни работы в видеоредакторе: таймлайн, дорожки, ключевые кадры. Сейчас это всё чаще делают кодом. Видео описывается как веб-страница, которая умеет нарисовать любой кадр по его времени, браузер снимает кадры по одному, и из них склеивается ролик. Писать такой код агентам помогают скиллы, то есть готовые инструкции по конкретному инструменту. В январе 2026 года Remotion выпустил скиллы для Claude Code и других агентов, а HeyGen открыл HyperFrames, где видео пишется на HTML и в комплекте больше двадцати скиллов. Подключаете скилл, описываете ролик словами, агент пишет код и рендерит.
Здесь агент пошёл тем же путём, но без готового фреймворка. По образцу оригинального клипа он написал свою программу-монтажёра: страницу в браузере, которая знает, на какой секунде звучит каждое слово, и ставит в этот момент сцену, надпись, рамку, эффект или звук. Браузер без окна снял 3 760 кадров, и из них собрался клип. Благодаря этому правки стоят минуты. Когда я попросил убрать лишнюю строку внизу кадра, «вот это лишнее везде, только добавляет шума», программа просто пересобрала клип, и ничего не пришлось генерировать заново. А в конце агент упаковал всё это в собственный скилл ai-music-video, чтобы следующий клип начинался не с нуля.
Почему это похоже на новую революцию. Сошлись три вещи. Модели вроде Opus 5.5 научились за одну сессию писать и чинить большие программы. Скиллы дают им знания конкретного ремесла, которые раньше жили в голове моушн-дизайнера. А нейросети для видео научились держать персонажа и попадать губами в слова. Раньше код умел только графику, а сгенерированное видео нельзя было поправить точечно. Теперь одно соединяется с другим, и монтаж из ремесла превращается в инструкцию, которую можно написать словами.
Последний штрих: Telegram. Тяжёлое видео в Telegram приходит серой плашкой, и его нужно специально загружать. Агент сжал клип до 9 мегабайт, чтобы он запускался сам, как только появляется в ленте.
Какие принципы мы использовали
Клип тут скорее повод. Ниже то, что работает для любой задачи, которую вы отдаёте агенту.
Человек решает там, где дальше дорого
Агент может сделать почти всё, но решения, от которых зависят большие траты, стоит оставить себе. Как с подрядчиком: смету на съёмку не подписывают, пока не утверждён сценарий.
Сначала одна мысль
Нейросети любят собирать красивые куски без общей идеи. Лекарство старое, как реклама: бриф. Одна страница до начала работы, где написано, о чём песня, кто поёт и кому, какой хук.
Говорить языком тех, для кого делаешь
Агент по умолчанию тянется к англоязычным мемам. Дайте ему реальную речь вашей аудитории: чат, отзывы, комментарии. Лучший хук это фраза, которую люди уже говорят сами.
Цифры отбирают, выбирает человек
Автоматическая проверка помогает отсеять слабые варианты, но финальный выбор за человеком. Здесь метрика предлагала дубль с неправильными ударениями, а ухо поймало ошибку за секунду.
Сначала дёшево, потом дорого
Картинку перерисовать дешевле, чем видео. Поэтому героиню утвердили на картинках, и только потом за неё заплатили генерацией сцен. Один пробный кадр до больших трат экономит больше всего денег.
Всё, что может код, делает код
Надписи, эффекты, монтаж и звуки собирала программа, а не нейросеть. Поэтому любую правку можно внести быстро и без новых трат, а результат каждый раз одинаковый.
Честные цифры
В пост о клипе попадали только факты из журналов работы: сколько сервисов, сколько лимита ушло, сколько времени. Если что-то сказал человек, агент так и помечал. «Без ручного монтажа» честнее, чем «ноль правок»: я много раз направлял работу.
На чём мы споткнулись
Метрика выбрала не тот дубль. Лучший процент распознанных слов был у варианта с неправильными ударениями. Теперь проценты только помогают сравнить дубли, а выбирает ухо.
Песня говорила чужими мемами. Первый текст был про P(doom) и других героев англоязычного интернета. Теперь словарь собирается из чата аудитории.
Фоновый агент принял задание за атаку. Помощник, который запускал генерацию, не видел нашего разговора и заподозрил подвох. Помогла простая вещь: файл в папке проекта, где честно написано, что это за проект и чьи аккаунты подключены.
Лишнее на экране. Строка статуса всё время висела внизу кадра и мешала. Теперь надписи появляются только по событию песни и сразу исчезают.
Как повторить
- Покажите образец. Ссылка на ролик, который нравится, и одна фраза о том, что хотите получить и для кого.
- Перечислите подписки. Агент сам выберет инструменты из того, что уже оплачено.
- Дайте голос аудитории. Архив чата или хотя бы десяток реальных сообщений.
- Попросите бриф. Одна страница с главной мыслью, до первой генерации.
- Оставьте себе четыре решения. Слова и хук, дубль на слух, образ по пробной картинке, правки по готовому монтажу.
- Прочитайте пост сами. Каждая цифра должна быть из журналов работы или помечена как ваша.
Весь этот процесс агент потом упаковал в скилл ai-music-video: инструкцию, по которой следующий клип можно собрать с нуля.
Клип и рассказ о нём: пост в канале «рис. AI». Оригинальный ролик «Claude Pop: I'm Upping My P(doom)» и его исходники. Видео кодом: скиллы Remotion, HyperFrames. Инструменты: ElevenLabs Music, Grok Imagine, субагенты Claude Code. О том, почему распознавание речи ошибается на пении: исследование 2024 года. Мои реплики агенту слегка отредактированы: убраны опечатки.