ГЛАВА 1. ГЕНЕРАТИВНАЯ АНИМАЦИЯ С ПОМОЩЬЮ ИИ
Данный проект является учебной работой студента Школы дизайна или исследовательской работой преподавателя Школы дизайна. Данный проект не является коммерческим и служит образовательным целям

Количество ИИ-инструментов и сервисов, пригодных для создания 3D анимации, на данный момент огромное множество. Генеративные нейросети крайне широки в своих возможностях и продолжают прогрессировать с каждым годом, улучшая качество, однако достаточно ли его, чтобы создать полноценную подконтрольную анимацию с возможностью редактирования и получения нужного результата?

Данная глава рассматривает возможности современных ИИ-платформ, начиная от простых задач (генерации базовых телодвижений для минималистичных геометричных персонажей) и постепенно переходя к более сложным: синхронизации речи (lip-sync), созданию детальной мимики и комплексных динамичных сцен.

Самая простая и сложная задача одновременно — генерация анимации лишь с помощью текста. Такую функцию «Text to Video» предоставляют почти все нейросети, способные работать с изображениями в качестве опорного референса, но результат получается крайне непредсказуем, тяжело поддается контролю и какому-либо редактированию, так как каждое новое уточнение может кардинально изменить кадр.

big
Исходный размер 1364x702

Генерация по текстовому промпту / Hailuo AI

_"A simple stylized white humanoid character with smooth blocky shapes, no  facial features, elongated limbs and a  minimalistic design stands in  a  clean 3D  environment. The scene has a  dark glossy floor with soft reflections and a  background that fades from deep navy blue at  the bottom to  a  subtle purple gradient toward the top. The animation begins with the character appearing only halfway waist-deep from the left side a&nbsp0; the frame, leaning a&nbsp1; cautiously a&nbsp2; a&nbsp3; checking the space, then slowly stepping fully into view and moving a&nbsp4; the center. Than performs a&nbsp5; small, shy wave with one a&nbsp6; _

Учитывая, что в качестве ориентира у нейронной сети Hailuo AI был лишь текстовый запрос, она вполне хорошо справилась с поставленной задачей, учитывая практически все нюансы.

Персонаж двигается вполне реалистично, без видимых артефактов. Однако такой уровень неточности подойдет в качестве разве что опорного референса для дальнейшего переноса на конкретного персонажа или для поиска визуального стиля с наименьшими затратами по времени, ведь текст — это самый быстрый способ для получения результата.

Исходный размер 1362x704

Генерация с помощью текста и конечного кадра / Hailuo AI

Чуть усложняя задачу, нейросети был предоставлен дополнительный референс — заранее подготовленный конечный кадр анимации, где должен оказаться персонаж и в какой позе. С помощью уже двух опорных референсов (текст и изображение) Hailuo удалось создать базовое движение, которое также не имеет бросающихся в глаза ошибок и несостыковок.

Исходный размер 1362x700

Генерация с помощью текста, стартового и конечного кадра / Hailuo AI

_"The character stands off-camera, peeking out from the left, showing half-length. Then the character looks back, steps to  the center, strikes a  pose, and waves at  the camera" _

Самым большим функционалом, предоставляемым сервисом, является использование одновременно текстовой подсказки, стартового фрейма и завершающего. Однако вопреки ожиданиям, результат получается менее качественным. Несмотря на то, что персонаж устойчиво делает шаги и не скользит по полу, что является частой ошибкой при генерации, в начальном движении точка опоры смещена и импульс движения исходит неправильно.

Таким образом, Hailuo дает вполне качественный результат генерации 3D анимации, но все равно не лишен ошибок и некоторого непонимания физики тела, если условий для генерации становится слишком много.

Исходный размер 1055x652

Референсное изображение / Персонаж Beta (Agora)

Помимо базовых движений в анимации крайне важна мимика персонажа, ведь, как известно, именно она способна оживить героев на экране, наполнив их жизнью и настоящими эмоциями, вызывающими эмпатию и создающими истории.

Сервис Kling AI известен качеством проработки мимики, которая так важна в крупных планах и обычно используется для значимых эмоциональных моментов повествования.

Исходный размер 1228x748

Генерация с помощью текста и референса/ Персонаж Beta (Agora) / Kling AI

_"The character appears angry, arms crossed over his chest, frowning and leaning slightly forward toward the viewer. Then he  sighs heavily and lowers his arms. His expression becomes sad and puzzled, and he  looks toward the lower right corner" _

В качестве референса был использован заранее выставленный кадр с персонажем и камерой.

Kling AI в версии 2.5 действительно качественно смог передать мимические нюансы. Эмоции правдоподобны: задействуется все лицо, а не только какая-то отдельная часть, что дает комплексные качественный результат.

Исходный размер 1228x748

Генерация более экспрессивной мимики в анимационном стиле / Персонаж Beta (Agora) / Kling AI

Второй вариант промпта включал в себя такие уточнения как "The facial animation is slightly exaggerated, almost cartoonish».

Нейросеть действительно правильно поняла запрос и сделала чуть более экспрессивную анимацию по сравнению с первой: части лица двигаются более динамично, эмоции утрированны и более читаемы.

Задача на уровень сложнее — липсинк (от lip-sync, синхронизация губ). Ведь помимо передачи многогранных эмоций необходимо также тщательно встроить аудио в анимацию так, чтобы движение губ правильно синхронизировалось со звуком, а глаз зрителя не отвлекался на несостыковки.

Аниматор в этом случае должен создать эффект полного погружения в происходящее на экране, а зритель в свою очередь должен верить, что персонаж действительно произносит реплику и разговаривает.

Решение такой задачи предлагает сервис Hedra, который позволяет к референсному изображению прикрепить аудио-файл. Именно с ним нейросеть будет синхронизировать мимику персонажа.

Loading...

Модель Hedra Character 3 генерирует крайне нестабильный результат — речь персонажа неправильно синхронизирована с геометрией губ. Гласные звуки выполнены не совсем точно, но попадают в реплику. Проблема с согласными гораздо более явная: множество лишних звуков в паузах и во время реплики, неправильные силуэты губ.

В классической 3D анимации по устоявшемуся пайплайну, чтобы создать корректный липсинк, подготавливаются отдельные библиотеки — там на каждую гласную и согласную приходится по несколько вариантов произношения. Губы выстраивают в правильное положение, а затем подгоняют ровно под каждую букву. ИИ с этой задачей справился гораздо менее качественно.

Loading...

Более того, с мимикой персонажа Hedra также справилась крайне плохо: на протяжении всей реплики присутствует лишь намек на прописанную в промпте эмоцию. Учитывая, что этот один из немногих сервисов с возможностью синхронизации звука, качество реализации все еще не пригодно даже для низкокачественного продукта.

Loading...

_"The character approaches the camera with his face and smiles creepily with his eyes wide open" _

Глава:
1
2
3
4
5
Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше