Нейро.Алексей | Нейросети без магии
Иконка канала Нейро.Алексей | Нейросети без магии

Нейро.Алексей | Нейросети без магии

1 подписчик

1просмотр

1. Он рассказал это между заказами, со смехом. В первую неделю сентября, говорит, очередь бодрая - студенты берут кофе, обсуждают расписание, у всех блокноты, ноутбуки и планы ходить на всё. Он сказал: в эти дни у людей даже осанка другая, будто год точно будет не как прошлый 2. К октябрю картина, по его словам, меняется. Тот же народ берёт стакан побольше, говорит тише, а на вопрос как учёба отвечает - надо будет засесть на выходных. Бариста уверяет, что фразу про выходные слышит от одних и тех же людей месяцами, и выходные каждый раз какие-то другие 3. Он говорит, что взрослые с ноутбуками ведут себя так же. Сидят с вебинаром в наушниках, в сентябре конспектируют, к ноябрю просто ставят на паузу и уходят в ленту. Запись копится, чувство долга копится, а сил открыть её вечером уже нет - те же сутки, та же усталость 4. Бариста в этом смысле философ. Он сказал: не бывает так, что человек взял и пересмотрел сорок часов записей силой воли, за десять лет ни разу такого не видел. Кто справляется, тот не геройствует, а просто иначе всё устроил, чтобы занятие само превращалось во что-то короткое и понятное. Остальные носят долг с собой, как я ношу поднос 5. Смешно, но он прав. Первая неделя всегда про то, что теперь-то всё будет иначе, а меняется это только к следующему сентябрю. Единственное честное окно что-то поправить - как раз сейчас, пока запал не остыл и записей всего пара штук. С понедельника, кстати, разговоры про расшифровку лекций в канале сворачиваются А на этой первой неделе ты тоже ходишь самым собранным - или уже ловишь себя на мысли посмотрю на выходных?
1. Разговор был за столом, между делом. Внук пожаловался, что не успевает записывать за преподавателем - тот тараторит, слайды мелькают, к концу пары в тетради каша. Дед послушал и сказал: запись, которую ты делаешь на бегу и ни разу потом не открываешь, это не запись, а способ занять руки 2. Он объяснил на своём опыте. Полвека назад он так же строчил конспекты, гордился толстыми тетрадями, а на экзамене понимал, что помнит только те темы, где отложил ручку и просто слушал. То, что записано под диктовку, в голове не оседает - через тебя проходит звук, а не смысл. Свои тетради он потом ни разу не перечитал 3. Дед сказал, что сейчас и проще, чем в его годы, и тяжелее. Проще - потому что занятие можно сохранить целиком, не надеясь на почерк. Тяжелее - потому что это сохранённое копится тоннами и создаёт иллюзию, что ты всё потом учтёшь. Папка с двадцатью записями успокаивает ровно до того дня, когда по ним надо готовиться 4. Штука в том, что дедовское наблюдение не про возраст и не про вуз. Оно ровно так же работает на школьном уроке и на вечернем вебинаре у того, кто учится после работы. Живое занятие уходит, а остаётся ощущение, что важное там было, и папка, куда это важное складывали 5. К сессии внук понял, что дед имел в виду. Записать больше или красивее - не та задача. Задача в том, чтобы занятие после себя оставляло не туман и не гору снимков, а что-то, к чему можно вернуться и правда найти нужное. Толстая тетрадь этому не помогает, она просто тяжелее А у тебя от прошлого года что осталось от лекций и вебинаров - рабочие записи, к которым ты возвращался, или папки, которые с тех пор ни разу не открывались?

3просмотра

1. Раньше со мной на эфирах было как у многих. Смотрю, важное фоткаю с экрана, к пятнице в галерее десяток снимков, которые я так и не открыл, и стойкое чувство, что половина сказанного утекла. Записи лежали в папке, но полтора часа ради одной минуты я не пересматривал ни разу 2. На этой неделе я взял свой двухчасовой эфир и прошёл его иначе. Звук завёл в Whisper - это программа от OpenAI, которая переводит речь в текст и с терминами справляется прилично, не идеально, но читать можно. Считала она сама, в фоне, пока я занимался другими делами - вечер машинного времени против недели моих откладываний 3. На выходе весь эфир лёг в один текстовый файл. Не десять снимков по разным папкам, не пять страниц заметок почерком, который я сам через день не разберу - один файл, по которому работает обычный поиск. Скринов с того эфира у меня теперь ровно ноль 4. Дальше я закинул файл в нейросеть на компьютере и задал один вопрос - вот моя задача, пройди по эфиру и собери только то, что её касается, обязательно с цитатами. Получил короткий разбор под свой случай, каждый пункт с куском из расшифровки, чтобы можно было перепроверить. Тот же порядок я потом прогнал на вузовской лекции знакомого, разницы для программы никакой 5. Что изменилось по факту. Раньше занятие после эфира жило у меня в виде тумана и папки скринов, теперь в виде текста, к которому можно вернуться и спросить что угодно. Установку по шагам, отдельно под Windows и Mac, для тех, кто консоли побаивается, я разложил в полную версию, но сама связка работает и без неё А у тебя сколько сейчас непросмотренных записей занятий - и когда последний раз хватало вечера открыть хоть одну, чтобы досмотреть до конца?

1просмотр

1. Он объяснил это на примере, который у всех на слуху. Берёшь текст лекции, кидаешь в нейросеть, просишь краткое содержание - и получаешь водянистый пересказ на две страницы, из которого твою задачу не решить. Он сказал: ты попросил пересказ, вот и получил пересказ, модель тут сделала ровно то, о чём просили. Дальше он дал три поправки 2. Первое. Не проси пересказать, проси применить. Формулировка такая - у меня ситуация такая-то, пройди по тексту и вытащи только то, что к ней относится, остальное пропусти. Он говорит: одна эта замена глагола выключает режим конспекта и включает режим помощника под конкретный случай 3. Второе. Требуй опору на текст. К запросу добавляешь строчку - к каждому пункту дай точную цитату из расшифровки, на которой он держится. Так сразу видно, где спикер это действительно говорил, а где нейросеть додумала за него. Спорное ты перепроверяешь по цитате, а не веришь на слово 4. Третье. Проси не мысли, а порядок действий. Запрос звучит так - собери список конкретных шагов в том порядке, в котором их делать. Редактор объясняет разницу так: мысль в голове следа не оставляет, а список шагов можно открыть завтра и просто идти по нему сверху вниз. Списками он и сдаёт свою работу заказчикам 5. Все три правила он советует собрать в один шаблон и держать в заметках. На новом занятии ты не сочиняешь запрос заново, а подставляешь свою тему в готовую рыбу. Весь фокус, по его словам, в том, что ты перестаёшь просить у нейросети чужую выжимку и начинаешь заказывать разбор под себя, а это два разных инструмента А когда ты просишь нейросеть разобрать длинный текст - описываешь ей свою ситуацию и просишь цитаты или ограничиваешься словами сделай краткое содержание?

3просмотра

1. Он рассказал это в разговоре о том, зачем вообще нужна расшифровка. Клиенты, по его словам, часто думают так - получу совещание текстом, и дело сделано. Он сказал: пятьдесят страниц сплошной стенограммы читать не станет никто, это та же запись, только листать дольше. Голая расшифровка почти всегда лежит мёртвым грузом, как и видео до неё 2. Рабочий приём у него другой. Всю встречу он целиком переводит в текст, а потом отдаёт этот текст нейросети на компьютере - и не читает, а задаёт вопросы. Что из сказанного касается моей задачи. Какие шаги советовали именно под мой случай. Где выступавший сам себе противоречил 3. Разница с обычным конспектом, говорит он, примерно как между стопкой газет и поиском по ним. Конспект это чужая выжимка того, что кто-то другой счёл главным. А тут ты держишь всё занятие целиком и вытаскиваешь ровно то, что нужно тебе сегодня, своими словами, за пару минут. Завтра вопрос будет другой, и ты просто задашь другой 4. Разница между встречей и занятием тут небольшая. Лекция, урок и вебинар устроены так же - один человек долго говорит, а нужное тебе лежит в трёх местах из полутора часов. Пересматривать целиком, чтобы найти эти три места, никто не станет. А спросить у текста можно за минуту, и спросить именно про свою ситуацию, а не про то, что было важно преподавателю 5. Сам аналитик собирает такую связку из двух кусков - чем перевести звук в текст на своём компьютере и как потом задавать вопросы, чтобы получать разбор, а не пересказ. Первый кусок людей пугает зря, там всего пара кнопок. Какие вообще есть пути перевести звук в текст и что у каждого за подвох - разбор такой в канале как раз лежит А что ты первым делом спросишь у текста своего последнего вебинара - краткое содержание для галочки или конкретные шаги под свою задачу?

7просмотров

1. Она сказала это на встрече с абитуриентами и честно предупредила, что мысль спорная. По её словам, вчерашние отличники приходят с рефлексом - звучит слово, рука пишет. Они строчат за ней страницами и к концу пары гордятся полным конспектом. А на экзамене плывут на первом же вопросе, где надо не воспроизвести, а подумать 2. Механизм она объясняет просто. Когда рука занята стенограммой, голова работает диктофоном, а не мыслью - ты переносишь звук на бумагу, минуя понимание. Смысл проходит мимо ровно в тот момент, когда преподаватель его разжёвывает. Дома ты открываешь конспект и учишь его с нуля, как чужой учебник 3. Те, кто сдаёт легко, ведут себя иначе. Во время объяснения они почти не пишут - слушают, спорят про себя, задают вопрос. Рука берётся за ручку, только когда мысль уже понята, и в тетради появляется своя формулировка, а не диктант. Записей у них за пару выходит немного, зато это их собственные слова, а не чужие под диктовку 4. Тот же перекос она видит у взрослых на своих вебинарах для профессионалов. Люди приходят на платный курс, включают запись и первым делом открывают документ, чтобы конспектировать. К третьему занятию у них двадцать страниц, которые никто никогда не перечитает. Она призналась, что сама на чужих лекциях давно не пишет и только тогда начала из них что-то выносить 5. Вывод, который она предлагает, неудобный. Конспект на занятии часто нужен не для материала, а для ощущения, что ты не бездельник - руки заняты, совесть чиста. Материал при этом утекает. Может, честнее отложить ручку, дослушать до конца, а сохранение занятия доверить не своему почерку А ты на лекции или вебинаре что делаешь чаще - записываешь за спикером слово в слово или слушаешь и ловишь мысль, а запись оставляешь на потом?

2просмотра

1. Он сказал это на разборе для родителей, между делом. Первого сентября за парты и за ноутбуки садятся сразу все - школьник на уроки, студент на пары, взрослый на новый поток вебинаров платного курса. Дальше, по его словам, история у всех одинаковая. Смотрят живое занятие полтора-два часа и искренне верят, что вечером всё вспомнят… 2. Не вспоминают. Внимание не делится на три части сразу - слушать, понимать и записывать. Пока ты дописываешь предыдущую фразу, следующую уже пропустил. В тетради оседает три слова из пяти, а связка между ними остаётся только в голове преподавателя. Через неделю свой же конспект читается как чужой 3. Со скринами всё ещё быстрее. Сфоткал доску или слайд, выдохнул, вернёшься потом. Это потом не наступает никогда - снимок уходит вниз галереи, под котов и чеки, и через месяц ты даже не помнишь, что там было важного. Репетитор говорит, что у взрослых на курсах то же самое, только вместо доски слайд вебинара 4. Дальше работает простая арифметика, без всякой психологии. Занятия идут несколько раз в неделю, а свободный вечер, чтобы вернуться к записи, случается заметно реже. Разрыв копится молча, и к середине осени у человека набирается стопка записей, открыть которые он уже не успеет физически 5. Вот почему сентябрь особенный месяц, и репетитор не зря завёл этот разговор именно в начале года. Сейчас у тебя две записи и силы поменять то, как ты вообще сохраняешь занятия. В ноябре под завалом менять подход уже некогда, там бы разгрести то, что есть. Окно короткое А ты помнишь хоть одно занятие с прошлого учебного года целиком - или в памяти остались только общее ощущение и папка скринов, которую так и не открываешь?

93просмотра

1. Google Flow отдаёт 50 кредитов в сутки по обычному аккаунту, и они обновляются каждые 24 часа. Двух клипов в день достаточно, чтобы попробовать нейровидео, не вкладывая ничего 2. CapCut в это же время встроил в Design Studio модель Seedream 5.0 Pro и набор готовых скиллов, на вебе это доступно без доплаты 3. Ещё недавно такой набор выглядел бы списком платных сервисов на месяц вперёд. Сейчас это то, что открывается с обычного браузера, и порог входа больше не выглядит порогом 4. И ровно поэтому доступ перестал отличать один результат от другого. Он есть у всех, кто дочитал до этой строки, включая тех, кто ни разу ничего не генерировал 5. Отличает текст, который человек вставляет в поле. Один пишет три слова и получает случайность, второй заходит с проверенной структурой и получает то, что задумал. Инструмент у них при этом один и тот же Чего сейчас реально не хватает большинству: доступа к нейросети или умения объяснить ей задачу?

2просмотра

1. Он рассказывал это уже без галстука. «Мы по звёздам не гадаем, - сказал он. - Мы не первый десяток лет складываем убытки в таблицу и смотрим, у кого их больше». По его словам, когда в базе набежали сотни тысяч выплат, водители по месяцам рождения сами разошлись по аварийности, и верх списка отличался от низа вдвое 2. Механизм, по его версии, не в гороскопе, а в характере, который дата рождения только помечает. Один за рулём давит на газ, чтобы что-то себе доказать, и лезет в зазор, которого нет. Другой заранее отпускает педаль перед перекрёстком, потому что не любит сюрпризов. «Первый приносит нам протокол раз в два года, - говорил он. - Второй за десять лет не приходит ни разу» 3. От народных примет это, говорит, отличается одним. Не общая черта на весь знак, а набор мелких привычек: как человек держит дистанцию, как реагирует на подрезающего, тормозит заранее или в последний момент. Гадалка обещает судьбу, а страховая считает по уже оплаченным ремонтам. Тот самый набор, который ты сам вписываешь в анкету при оформлении полиса 4. Причём так считает не только его отдел. Похожую разбивку независимо друг от друга видят и те, кто назначает цену полиса, и те, кто выезжает на аварию оформлять протокол. Два отдела почти не общаются, а вывод один. «Мы спорили, кто у кого подсмотрел, - сказал он. - Никто. Просто цифры так легли» 5. В конце он сказал странное. Дата рождения тут не причина. Это бирка на чемодане: по ней удобно найти, но собирал чемодан не календарь, а ты сам, годами, каждой поездкой. Поменяй пару привычек за рулём - и группа риска, в которой ты числишься, тихо перестанет тебя описывать А ты за последний год хоть раз ловил себя на том, что вошёл в поворот быстрее, чем стоило, - просто чтобы никому не уступить?

212просмотров

1. Аккаунт в Нельзяграме вырос с нуля до двадцати семи тысяч подписчиков на контенте, который полностью сделали нейросети. Veo3 и Nano Banana, без камеры и без съёмочной группы 2. За этим нет ни секретного доступа, ни закрытой беты, ни особенной модели, которую не выдают остальным. Инструменты ровно те же, что открыты любому человеку с браузером 3. Разница накопилась в другом месте. Каждый рабочий текст запроса доводился перебором: первый вариант давал не то, второй подходил ближе, пятый попадал. Рабочим он становился не с первого раза 4. И даже готовый промпт не отменяет проверки глазами. Модель спокойно дорисовывает то, чего ты не просил, и заметить это можно только на готовом кадре, а не в тексте запроса 5. Поэтому у меня скопилась пачка текстов, каждый из которых уже отработал на реальном ролике или картинке. Не учебные примеры из статьи, а то, что было вставлено в поле и дало кадр, который потом ушёл в ленту Ты доводишь свои запросы перебором до рабочего состояния или бросаешь после второй неудачной попытки?

541просмотр

1. Четырнадцатого августа CapCut обновил Design Studio: переработанный холст, набор готовых скиллов и модель Seedream 5.0 Pro. Из одного фото товара собираются варианты баннеров и карточек, на вебе это доступно без доплаты 2. Каждое такое обновление вызывает одну и ту же реакцию: надо срочно освоить новый интерфейс. Через месяц выходит следующий сервис, интерфейс снова другой, и человек снова начинает с нуля 3. Между сервисами переносятся не кнопки. Переносится структура запроса: что в кадре, что оно делает, как это снято и освещено, чего быть не должно. Эти четыре части живут в любом генераторе, как бы ни назывались вкладки 4. Поэтому человек с готовой структурой заходит в незнакомый сервис и получает результат почти сразу. А тот, кто учил кнопки, получает пустое поле и ощущение, что опять всё поменялось 5. Инструменты будут меняться и дальше, это единственное, в чём можно быть уверенным. Устаревает интерфейс. Сформулированная мысль про то, что ты хочешь увидеть в кадре, не устаревает Ты учишь новый сервис по кнопкам или сразу переносишь в него свою структуру запроса?

216просмотров

1. Персонаж плывёт. В первом кадре одно лицо, в третьем уже другой человек, и на это натыкается каждый, кто пробовал собрать хотя бы короткую сцену с героем 2. Виноватой обычно назначают модель. Слабая, не держит образ, надо ждать следующую версию. Модель здесь почти ни при чём 3. Причина в том, что у героя нет собранного набора референсов. Нейросеть каждый раз придумывает внешность заново, потому что опереться ей не на что, кроме твоих общих слов 4. Когда попыток в сутки всего две, эта ошибка стоит целого дня. Первый заход даёт одно лицо, второй другое, сравнивать нечего, и назавтра всё начинается с чистого листа 5. Собранный референс снимает проблему до того, как ты нажал кнопку. Не правками после, а решением заранее, как твой герой вообще выглядит. Как такой набор собирается, я разобрал отдельным материалом: код-слово ПЕРСОНАЖ боту в моём телеграм-канале, и он пришлёт разбор Ты собираешь референсы под своего героя заранее или каждый раз надеешься, что нейросеть угадает сама?

212просмотров

1. Двадцать кредитов уходит на один клип Veo 3.1 в режиме Fast. Пятьдесят делятся на двадцать ровно два раза, остаток в десять кредитов лежит мёртвым грузом до следующих суток. Никакой хитрости, обычное деление в столбик 2. Каждый клип это восемь секунд. Два клипа дают шестнадцать секунд в сутки. Для ролика в ленте, который редко живёт дольше пятнадцати секунд, это ровно одна попытка целиком и ни одной запасной 3. К этому прилагается водяной знак «Made with Veo» и потолок в 720p. 1080p живёт на пл@тном Ultra, и спорить тут не с чем: беспл@тный тариф честно показывает свою границу, а не прячет её 4. Дальше начинается развилка, которую каждый проходит сам. Можно вписать в поле первое, что пришло в голову, посмотреть результат, расстроиться и ждать следующих суток. А можно зайти с текстом, который уже давал нужный кадр 5. Разница между этими двумя людьми не в доступе, доступ у них одинаковый и беспл@тный. Разница в том, что один тратит свои шестнадцать секунд на лотерею, а второй на работу Две попытки в день. Ты потратишь их наугад или зайдёшь с готовым текстом запроса?

186просмотров

1. Google Flow пускает по обычному Google-аккаунту, без подписки и без привязки карты. На вход дают 50 кредитов, и они обновляются каждые 24 часа. Это не разовая раздача на пробу, а условие тарифа, которое лежит в справке Google и работает каждый день 2. Один клип Veo 3.1 в режиме Fast стоит 20 кредитов. Значит из суточных пятидесяти выходит до двух клипов, и ещё десятка остаётся неистраченной. Арифметика такая простая, что её можно держать в голове, не заглядывая в кабинет 3. Беспл@тный тариф не притворяется пл@тным. Клип выходит с водяным знаком «Made with Veo», разрешение упирается в 720p, длина не больше восьми секунд. 1080p открывается только на платном Ultra, и это написано прямо, а не спрятано мелким шрифтом 4. Раньше между человеком и первым сгенерированным кадром стоял счёт. Сейчас там не стоит ничего: ни счёта, ни пробного периода, ни карты «на всякий случай». Осталось желание открыть вкладку и что-то напечатать в поле 5. И вот здесь начинается настоящее. Две попытки в сутки это мало для тыканья наугад и вполне достаточно, если ты знаешь, что писать. Инструмент перестал быть дефицитом, дефицитом стал текст, который ты в него вставляешь Ты бы потратил свои две суточные попытки на эксперимент вслепую или пошёл бы за готовым текстом запроса?

154просмотра

1. На неделе, где мы разбирали конвейер ИИ-мультсериала, вышла ещё одна деталь для того же конвейера. MiniMax выложили модель для генерации песен под названием Music 3, и это не демо с ограничениями, а полностью опенсорсная и беспл@тная модель. Значит скачать, изучить код и использовать её может кто угодно, а не только те, кто платит за подписку 2. Отдельный пункт в описании - поддержка русского языка. Для музыки это редкость, большинство генераторов песен уверенно поют только по-английски, а русский текст либо коверкают, либо не принимают вообще. У Music 3 русский язык заявлен прямо в описании модели, без пометки «экспериментально» 3. Промпт разбит на три отдельных поля, а не в одну строку. Отдельно задаётся настроение трека, отдельно вокал, отдельно инструменты. Для мультсериала это как раз то место, где обычно нужна музыкальная тема героя или заставка серии, и три поля вместо одного дают больше контроля над тем, что получится на выходе 4. Я сам с этой моделью пока не работал, песню под свой стиль ещё не собирал. Написать здесь «сделал заставку и вот что вышло» было бы неправдой, поэтому пишу честно: модель вышла, вот что она умеет по описанию разработчиков, а не по моему опыту 5. В конвейере из персонажа, сцены и голоса звуку до этой недели вообще не было отдельного места, разве что фоновая дорожка из стока. Теперь есть открытый инструмент именно под музыку, причём беспл@тный и понимающий русский. В гайде по ИИ-мультсериалу этот шаг уже лежит рядом с остальными Ты бы попробовал доверить нейросети музыкальную тему своего персонажа, или музыка остаётся последним, что отдаёшь на аутсорс?

199просмотров

1. Обычно кажется, что мультсериал в нейросетях - это одна кнопка «сгенерировать». Написал промпт, подождал, получил готовую серию. На деле процесс раскладывается на несколько отдельных шагов, и каждый шаг делает своя отдельная нейросеть. И начинается он вовсе не с видео, а с одной картинки 2. Первый шаг - это лицо и внешность персонажа, собранные в генераторе изображений. NanoBanana, например, только что встроили прямо в CapCut, то есть рисовать героя теперь можно там же, где потом монтируется готовый ролик. Без устойчивого лица персонажа на этом шаге дальше все остальные кадры начинают плыть и превращаться в разных людей 3. Второй шаг - оживление кадра в сцену через видео-модели вроде Kling или VEO. Секунда в Kling стоит около семи центов, у Sora 2 дороже примерно на треть, у Runway цена вообще плавающая, на самой дешёвой настройке может выйти даже ниже Kling. То есть цена одной серии зависит не от таланта, а от того, какую модель и в каком режиме включил 4. Третий шаг - голос. Персонажи должны говорить разными интонациями, а не одним ровным тоном, и для этого нужен отдельный сервис озвучки. Четвёртый шаг - сборка всех кусков в готовый ролик со звуком и субтитрами, и вот тут в дело снова заходит обычный видеоредактор, только уже как финальная точка, а не как единственный инструмент 5. Именно порядок этих четырёх шагов чаще всего и роняет новичков, а не сложность самих нейросетей. Начинают сразу с видео, без устойчивого персонажа, и на третьей серии герой на экране становится неузнаваемым. Четыре шага подряд, каждый своей моделью, и это уже совсем не одна волшебная кнопка Ты бы угадал(а) сходу, что в одной серии мультсериала работают четыре разные нейросети, а не одна?

261просмотр

1. Обложку гайда, раскадровку и промо-кадры я собирал сам, через нейросети, без дизайнера. На каждый кадр уходил отдельный промпт и отдельный просмотр готового результата, без пакетной генерации пачками. Звучит как лишняя трата времени ровно до того момента, пока на одном из кадров не находишь то, что чуть не ушло дальше черновика 2. В промпте для одного из кадров стояло прямое условие: no logos, кроссовки без узнаваемых брендов. Нейросеть условие прочитала и всё равно нарисовала на подошве характерный силуэт, очень похожий на Air Jordan 1. Не название буквами, а именно форму, ту самую, которую узнают даже не увлечённые кроссовками люди. Запрет в тексте промпта для модели оказался пожеланием, а не законом 3. Если бы я сгенерировал партию кадров и без разбора закинул в макет, чужой товарный знак уехал бы в публикацию под моим именем. Между «сгенерировал и выложил» и «сгенерировал и посмотрел» лежит именно этот один кадр. Я отправил его на перегенерацию с явным условием generic sneakers, no recognizable brand silhouette. Второй заход модель отработала чисто 4. Сам факт, что прямой запрет один раз проскочил мимо модели, изменил то, как я смотрю на готовый материал. Промпт-инструкции почти везде объясняют, что написать нейросети, и почти нигде - что за ней нужно пересматривать каждый готовый кадр глазами. Промпт задаёт направление, а решение о том, что уйдёт в публикацию, остаётся за человеком 5. Гайд по ИИ-мультсериалу собирался из этого же принципа: не «нажал кнопку и получил серию», а пошаговая проверка на каждом этапе. Свой сериал я пока не запускал и д*нег на нём не зар*ботал, весь этот текст про другое - про то, что стоит за одной обложкой из шестнадцати страниц гайда. Подробности процесса и остальные кадры я разложил в канале Ты бы заметил чужой логотип на кроссовках персонажа с первого взгляда или тоже пропустил бы этот кадр?

163просмотра

1. Стандартный старт выглядит одинаково у всех: человек открывает нейросеть для картинок и сразу рисует героя, ничего заранее не продумав. Через пару серий выясняется, что у героя нет ни легенды, ни внятного конфликта, сюжет держится на одной смешной сцене, и дальше писать просто не про что. Мультик глохнет не на монтаже, а на пустом сценарии 2. Правильный порядок начинается с текста: сначала легенда сериала, потом конфликт, который держит серию за серией, и только после этого - сам герой и его внешность. Когда конфликт уже прописан, рисовать персонажа проще: понятно, какая история его окружает, а не только как он выглядит на одной картинке 3. Дальше в дело идёт NanoBanana - здесь герой получает лицо, костюм и узнаваемые детали. Следующий шаг - VEO или Kling, где нарисованные кадры оживают в сцены с движением. Здесь важно уже иметь под рукой готового героя и понятный конфликт, иначе сцена оживает красиво, но ни к чему не ведёт и не двигает сюжет вперёд 4. После сцен идёт голос: ElevenLabs озвучивает персонажей, и здесь тоже решает заранее прописанный характер - если легенда и конфликт готовы, понятно, каким тоном говорит герой в конкретной сцене. Последний шаг - сборка в CapCut, где картинка, движение и голос превращаются в готовую серию, которую можно выложить 5. Конвейер целиком выглядит так: сначала легенда и конфликт, затем NanoBanana, дальше VEO или Kling, следом ElevenLabs, и в конце CapCut. Подробно этот порядок и практика по каждому шагу разобраны у меня в гайде. А про то, как не терять героя между кадрами конкретно на шаге с NanoBanana, я писал в среду в Telegram-канале С какого шага ты обычно начинаешь свой мультик - с картинки героя или сначала с легенды и конфликта?

230просмотров

1. Стандартная ловушка выглядит так: в первом кадре у героя одно лицо, в третьем - будто это уже другой человек. Форма носа съехала, цвет волос стал темнее, куртка вдруг поменяла крой. Начинающий винит в этом саму нейросеть, переключается на другую модель понадёжнее и получает ту же историю на новом сервисе через пару кадров 2. У модели здесь просто не было на что опираться. Генерация каждой новой сцены начинается заново, без общего набора картинок героя под рукой, поэтому нейросеть каждый раз рисует персонажа как будто впервые - по памяти о прошлом кадре, а не по собранному образцу перед глазами 3. У тех, чей герой не плывёт, за кадром обычно лежит одно и то же: набор референсов персонажа, собранный заранее и подставляемый в каждую новую генерацию. Лицо анфас, лицо в профиль, костюм при разном свете, пара характерных ракурсов - и модели уже есть на что смотреть, а не что додумывать самой 4. Собрать такой набор руками дольше, чем кажется на старте: нужно понять, сколько ракурсов достаточно, где искать освещение без искажений и как избежать дрейфа даже внутри одной удачной серии кадров. Я разобрал это по шагам в статье и написал, как искать и подбирать референсы под своего персонажа 5. Статью забираешь бесплатно, без формы и подписки на почту. Напиши слово ПЕРСОНАЖ боту в моем ТГ-канале, и в ответ придёт ссылка на статью целиком. Дальше решаешь сам, собирать референсы руками по инструкции или один раз разобраться в логике и делать это на автомате Персонаж на твоих генерациях держит форму от кадра к кадру, или тоже расплывается уже на третьей сцене?