Количество ИИ-инструментов и сервисов, пригодных для создания 3D анимации, на данный момент огромное множество. Генеративные нейросети крайне широки в своих возможностях и продолжают прогрессировать с каждым годом, улучшая качество, однако достаточно ли его, чтобы создать полноценную подконтрольную анимацию с возможностью редактирования и получения нужного результата?
Данная глава рассматривает возможности современных ИИ-платформ, начиная от простых задач (генерации базовых телодвижений для минималистичных геометричных персонажей) и постепенно переходя к более сложным: синхронизации речи (lip-sync), созданию детальной мимики и комплексных динамичных сцен.
Самая простая и сложная задача одновременно — генерация анимации лишь с помощью текста. Такую функцию «Text to Video» предоставляют почти все нейросети, способные работать с изображениями в качестве опорного референса, но результат получается крайне непредсказуем, тяжело поддается контролю и какому-либо редактированию, так как каждое новое уточнение может кардинально изменить кадр.

Генерация по текстовому промпту / Hailuo AI
_"A simple stylized white humanoid character with smooth blocky shapes, no facial features, elongated limbs and a minimalistic design stands in a clean 3D environment. The scene has a dark glossy floor with soft reflections and a background that fades from deep navy blue at the bottom to a subtle purple gradient toward the top. The animation begins with the character appearing only halfway waist-deep from the left side a 0; the frame, leaning a 1; cautiously a 2; a 3; checking the space, then slowly stepping fully into view and moving a 4; the center. Than performs a 5; small, shy wave with one a 6; _
Учитывая, что в качестве ориентира у нейронной сети Hailuo AI был лишь текстовый запрос, она вполне хорошо справилась с поставленной задачей, учитывая практически все нюансы.
Персонаж двигается вполне реалистично, без видимых артефактов. Однако такой уровень неточности подойдет в качестве разве что опорного референса для дальнейшего переноса на конкретного персонажа или для поиска визуального стиля с наименьшими затратами по времени, ведь текст — это самый быстрый способ для получения результата.
Генерация с помощью текста и конечного кадра / Hailuo AI
Чуть усложняя задачу, нейросети был предоставлен дополнительный референс — заранее подготовленный конечный кадр анимации, где должен оказаться персонаж и в какой позе. С помощью уже двух опорных референсов (текст и изображение) Hailuo удалось создать базовое движение, которое также не имеет бросающихся в глаза ошибок и несостыковок.
Генерация с помощью текста, стартового и конечного кадра / Hailuo AI
_"The character stands off-camera, peeking out from the left, showing half-length. Then the character looks back, steps to the center, strikes a pose, and waves at the camera" _
Самым большим функционалом, предоставляемым сервисом, является использование одновременно текстовой подсказки, стартового фрейма и завершающего. Однако вопреки ожиданиям, результат получается менее качественным. Несмотря на то, что персонаж устойчиво делает шаги и не скользит по полу, что является частой ошибкой при генерации, в начальном движении точка опоры смещена и импульс движения исходит неправильно.
Таким образом, Hailuo дает вполне качественный результат генерации 3D анимации, но все равно не лишен ошибок и некоторого непонимания физики тела, если условий для генерации становится слишком много.
Референсное изображение / Персонаж Beta (Agora)
Помимо базовых движений в анимации крайне важна мимика персонажа, ведь, как известно, именно она способна оживить героев на экране, наполнив их жизнью и настоящими эмоциями, вызывающими эмпатию и создающими истории.
Сервис Kling AI известен качеством проработки мимики, которая так важна в крупных планах и обычно используется для значимых эмоциональных моментов повествования.
Генерация с помощью текста и референса/ Персонаж Beta (Agora) / Kling AI
_"The character appears angry, arms crossed over his chest, frowning and leaning slightly forward toward the viewer. Then he sighs heavily and lowers his arms. His expression becomes sad and puzzled, and he looks toward the lower right corner" _
В качестве референса был использован заранее выставленный кадр с персонажем и камерой.
Kling AI в версии 2.5 действительно качественно смог передать мимические нюансы. Эмоции правдоподобны: задействуется все лицо, а не только какая-то отдельная часть, что дает комплексные качественный результат.
Генерация более экспрессивной мимики в анимационном стиле / Персонаж Beta (Agora) / Kling AI
Второй вариант промпта включал в себя такие уточнения как "The facial animation is slightly exaggerated, almost cartoonish».
Нейросеть действительно правильно поняла запрос и сделала чуть более экспрессивную анимацию по сравнению с первой: части лица двигаются более динамично, эмоции утрированны и более читаемы.
Задача на уровень сложнее — липсинк (от lip-sync, синхронизация губ). Ведь помимо передачи многогранных эмоций необходимо также тщательно встроить аудио в анимацию так, чтобы движение губ правильно синхронизировалось со звуком, а глаз зрителя не отвлекался на несостыковки.
Аниматор в этом случае должен создать эффект полного погружения в происходящее на экране, а зритель в свою очередь должен верить, что персонаж действительно произносит реплику и разговаривает.
Решение такой задачи предлагает сервис Hedra, который позволяет к референсному изображению прикрепить аудио-файл. Именно с ним нейросеть будет синхронизировать мимику персонажа.
Модель Hedra Character 3 генерирует крайне нестабильный результат — речь персонажа неправильно синхронизирована с геометрией губ. Гласные звуки выполнены не совсем точно, но попадают в реплику. Проблема с согласными гораздо более явная: множество лишних звуков в паузах и во время реплики, неправильные силуэты губ.
В классической 3D анимации по устоявшемуся пайплайну, чтобы создать корректный липсинк, подготавливаются отдельные библиотеки — там на каждую гласную и согласную приходится по несколько вариантов произношения. Губы выстраивают в правильное положение, а затем подгоняют ровно под каждую букву. ИИ с этой задачей справился гораздо менее качественно.
Более того, с мимикой персонажа Hedra также справилась крайне плохо: на протяжении всей реплики присутствует лишь намек на прописанную в промпте эмоцию. Учитывая, что этот один из немногих сервисов с возможностью синхронизации звука, качество реализации все еще не пригодно даже для низкокачественного продукта.
_"The character approaches the camera with his face and smiles creepily with his eyes wide open" _




