Deep-Fake.ai logo
Back
11 min read

Как нейросети (Deepfake) сохраняют лица и консистенцию при работе с несколькими людьми и разными ракурсами?

В статье разбираемся, почему так сложно сохранить одно и то же лицо персонажа при генерации изображений с разных ракурсов или с группой людей. Узнайте, с какими трудностями и компромиссами сталкиваются пользователи и разработчики.

Как нейросети (Deepfake) сохраняют лица и консистенцию при работе с несколькими людьми и разными ракурсами?

Компромиссы в дипфейках: несколько человек в кадре, разные ракурсы и стабильность лица

Создание дипфейков с несколькими людьми или захват одного человека с разных ракурсов ставит уникальные технические задачи. Одно и то же лицо должно оставаться стабильным в разных кадрах, под разными углами и при взаимодействии с другими лицами — проблема, которая вскрывает фундаментальные ограничения современных технологий дипфейков.


Ключевые выводы

  • Системы для создания дипфейков с трудом поддерживают стабильность лица, когда один и тот же человек появляется в сцене несколько раз или снят с разных ракурсов.
  • Дипфейки с несколькими людьми сталкиваются с дополнительными трудностями: каждое лицо требует отдельной обработки, что увеличивает вычислительную нагрузку и риск «дрифта» идентичности.
  • Разные углы камеры показывают разные черты лица, что усложняет для ИИ задачу сохранения единого образа одного и того же человека.
  • Обсуждения в сообществах показывают, что пользователи часто сталкиваются с «перепутыванием лиц» между людьми или постепенным изменением внешности в течение видео.
  • Современные решения предполагают компромисс между временем обработки, качеством и стабильностью — как правило, невозможно оптимизировать все три параметра одновременно.

Проблема нескольких человек в кадре

Когда в дипфейк-видео присутствует несколько человек, каждое лицо должно обрабатываться отдельно. Это создает несколько взаимосвязанных проблем.

Почему несколько лиц усложняют создание дипфейков

Каждый человек в сцене требует:

  • Отдельного обнаружения и отслеживания лиц: Система должна распознавать и следить за каждым лицом независимо.
  • Индивидуального кодирования идентичности: Каждое лицо получает свое собственное представление в модели ИИ.
  • Независимых этапов обработки: Лица заменяются или изменяются по одному.
  • Согласованного результата для всех участников: Все лица должны выглядеть реалистично и сохранять свою идентичность.

Вычислительная сложность растет примерно линейно с количеством лиц. Сцена с тремя людьми обрабатывается примерно в три раза дольше, чем сцена с одним человеком при тех же настройках качества.

Что происходит при обработке нескольких лиц

Пользователи сообщают о нескольких распространенных проблемах при работе с дипфейками с участием нескольких людей:

Смешение или путаница лиц

«Я пытался заменить лица на групповом фото, и в середине видео лицо Человека А стало походить на лицо Человека Б. ИИ запутался, кому какое лицо принадлежит».

Это происходит потому, что алгоритмы отслеживания могут потерять «нить», какое лицо кому принадлежит, особенно если лица пересекаются, быстро двигаются или похожи друг на друга.

Нестабильное качество разных лиц

«Главный герой выглядит идеально, а человек на заднем плане — размытым и искаженным. Как будто у ИИ не хватило мощности на второе лицо».

Когда вычислительные ресурсы ограничены, системы для создания дипфейков часто отдают приоритет главному объекту, оставляя второстепенные лица с более низким качеством или неполной обработкой.

Несоответствия во времени (между кадрами)

Даже если каждое лицо сохраняет свою идентичность, оно может меняться со временем. Лицо одного человека в 50-м кадре может выглядеть немного иначе, чем в 1-м, в то время как лицо другого человека остается стабильным. Это создает неестественный эффект, при котором лица как бы «стареют» или меняются с разной скоростью.


Проблема разных ракурсов

Один и тот же человек выглядит по-разному с разных ракурсов. Это создает фундаментальную проблему для систем дипфейков.

Почему ракурсы так важны

Лицо, снятое спереди, демонстрирует иные черты, чем то же лицо, снятое сбоку:

  • Вид спереди (анфас): Глаза, нос, рот — все четко видно.
  • Вид в профиль: Видна только одна сторона лица, с другими пропорциями.
  • Вид в три четверти: Смесь черт анфаса и профиля.
  • Экстремальные ракурсы: Взгляд вверх или вниз кардинально меняет пропорции лица.

Системы дипфейков обычно обучаются на лицах с разных ракурсов, но поддерживать стабильность, когда один и тот же человек появляется под разными углами в одном видео, очень сложно.

С чем сталкиваются пользователи

«Дрифт» идентичности при смене ракурса

«Когда камера движется вокруг объекта, его лицо меняется. Его все еще можно узнать, но что-то не так — как будто черты лица слегка смещаются при каждом изменении угла».

Это происходит потому, что модель ИИ кодирует черты лица по-разному в зависимости от угла обзора. При смене ракурса система может переключаться между разными внутренними представлениями, вызывая едва заметные изменения в идентичности.

Несоответствие черт лица

Конкретные черты лица могут плохо переноситься между ракурсами:

  • Глаза: Могут казаться разного размера или формы при просмотре с разных углов.
  • Нос: Вид в профиль раскрывает структуру носа, которую не видно спереди.
  • Симметрия лица: Асимметрия становится более или менее заметной в зависимости от ракурса.
  • Текстура кожи: Освещение и тени меняются с ракурсом, влияя на то, как выглядит кожа.

Эффект «зловещей долины»

Когда лица не сохраняют идеальную стабильность при смене ракурсов, зрители замечают, что что-то не так, даже если не могут точно определить проблему. Это создает эффект «зловещей долины», когда дипфейк выглядит почти идеально, но все же вызывает отторжение.


Двойной удар: несколько человек + разные ракурсы

Когда в сцене присутствуют несколько человек, И камера движется, показывая их с разных ракурсов, проблемы усугубляются.

Почему это особенно сложно

Представьте сцену с тремя людьми, где камера вращается на 180 градусов:

  1. Каждый человек должен сохранять стабильную идентичность.
  2. Каждый человек должен выглядеть реалистично при любом ракурсе.
  3. Все люди должны оставаться согласованными по отношению друг к другу.
  4. Сцена должна сохранять временную согласованность на протяжении всего вращения.

Это требует от системы одновременного отслеживания нескольких идентичностей в нескольких представлениях под разными углами — задача, требующая огромных вычислительных мощностей, которая часто выходит за рамки текущих возможностей.

Реальные сценарии, в которых это не работает

Групповые беседы

«Я пытался сделать дипфейк группового обсуждения. Когда люди поворачивались друг к другу, их лица слегка деформировались. Человек слева начинал походить на человека справа».

В группах люди естественно поворачиваются друг к другу, создавая смену ракурсов. Системы дипфейков с трудом сохраняют разные идентичности, когда несколько смен ракурсов происходят одновременно.

Танцевальные или динамичные сцены

«Я хотел сделать дипфейк танцевальной сцены с несколькими исполнителями. По мере их движения и следования камеры лица "плыли". К концу видео некоторые лица едва напоминали оригиналы».

Быстрое движение в сочетании с движением камеры создает быструю смену ракурсов для нескольких объектов. Текущие системы не справляются с поддержанием стабильности в таких условиях.

Сцены с толпой

«Персонажи на заднем плане в сценах с толпой выглядят нормально с одного ракурса, но когда камера движется, они искажаются или меняются лицами с соседними людьми».

Сцены с толпой представляют собой предельную сложность: много лиц, много ракурсов, ограниченные вычислительные ресурсы на каждое лицо.


Технические ограничения, лежащие в основе проблем

Чтобы понять, почему возникают эти проблемы, нужно взглянуть на то, как на самом деле работают системы дипфейков.

Ограничения кодирования лиц

Системы дипфейков кодируют лица в математические представления, называемые «латентными пространствами». Эти представления хорошо работают для одного лица при стабильных ракурсах, но имеют ограничения:

  • Кодирование для конкретного ракурса: Система может использовать разные кодировки для вида спереди и в профиль.
  • Ограниченные данные для обучения: Большинство обучающих данных показывают лица под стандартными углами, а не под экстремальными или необычными.
  • Конфликты кодирования: Когда один и тот же человек появляется под разными углами, система должна согласовывать разные кодировки.

Вычислительные ограничения

Обработка нескольких лиц с разных ракурсов требует значительных вычислительных ресурсов:

Сценарий Приблизительное время обработки (в сравнении с одним лицом, вид спереди)
Одно лицо, разные ракурсы В 2-3 раза дольше
Несколько лиц, один ракурс В 2-4 раза дольше (зависит от количества лиц)
Несколько лиц, разные ракурсы В 5-10 раз дольше

Большинство пользователей не имеют доступа к вычислительным ресурсам, необходимым для высококачественных дипфейков с несколькими людьми и сменой ракурсов.

Пробелы в обучающих данных

Модели дипфейков обучаются на датасетах, которые имеют свои ограничения:

  • Фокус на одном человеке: Большинство обучающих примеров показывают одного человека за раз.
  • Распределение ракурсов: В обучающих данных преобладают распространенные ракурсы (спереди, легкий профиль) и недостаточно представлены экстремальные углы.
  • Данные о взаимодействии: Ограниченное количество примеров, где один и тот же человек взаимодействует с другими, сохраняя свою идентичность.

Эти пробелы означают, что модели не научились эффективно справляться со сложными сценариями с несколькими людьми и сменой ракурсов.


Обсуждения в сообществах и опыт пользователей

Онлайн-форумы показывают общие разочарования и способы их решения.

Часто задаваемые вопросы

«Почему мой дипфейк отлично работает с одним человеком, но "ломается" с двумя?»

Ответ обычно кроется в вычислительных ограничениях. Дипфейки с одним человеком могут использовать всю доступную мощность для одного лица. Дипфейки с несколькими людьми должны делить эту мощность, что часто приводит к снижению качества или неполной обработке.

«Могу ли я исправить "дрифт" идентичности, обрабатывая каждого человека отдельно?»

Некоторые пользователи пытаются обрабатывать каждого человека по отдельности, а затем объединять результаты (композитинг). Это может помочь со стабильностью идентичности, но создает новые проблемы:

  • Лица могут взаимодействовать неестественно (освещение, тени, отражения).
  • Временная согласованность между лицами может нарушиться.
  • Конечный результат может выглядеть искусственным.

«Почему лица выглядят нормально с одного ракурса, но неправильно с другого?»

Это обычно указывает на недостаток обучающих данных для этого конкретного ракурса, или на то, что модель переключается между разными представлениями для конкретных углов без плавных переходов.

Лайфхаки и обходные пути от пользователей

Ограничить количество людей

«Я обнаружил, что если ограничиваться максимум двумя людьми, результаты получаются гораздо лучше. Три или больше — и все начинает ломаться».

Ограничить движение камеры

«Если я держу камеру относительно статичной и позволяю людям лишь слегка поворачиваться, результаты намного стабильнее».

Обрабатывать по частям

«Я разбиваю видео на короткие сегменты, обрабатываю каждый отдельно с одинаковыми настройками, а затем склеиваю их. Это трудоемко, но дает лучшие результаты».

Использовать более низкие настройки качества

«Я научился принимать немного более низкое разрешение, если это означает, что лица остаются стабильными. Идеальное качество не стоит того, если идентичности "плывут"».


Компромиссы, на которые идут пользователи

При работе с дипфейками с несколькими людьми или разными ракурсами пользователи должны выбирать, что для них важнее.

Качество против времени обработки

Более высокие настройки качества улучшают стабильность, но резко увеличивают время обработки. Для сцен с несколькими людьми этот компромисс становится еще более выраженным:

  • Низкое качество, быстрая обработка: Лица могут «плыть» или меняться местами.
  • Высокое качество, медленная обработка: Лучшая стабильность, но может занять дни или недели.
  • Среднее качество, среднее время: Компромисс, который часто все еще показывает некоторые несоответствия.

Стабильность против реализма

Некоторые пользователи сообщают, что принудительное сохранение идеальной стабильности может сделать лица «слишком идеальными» или искусственными:

«Когда я заставляю систему сохранять лица абсолютно одинаковыми, они начинают выглядеть как манекены. Немного вариативности выглядит естественнее, но тогда страдает стабильность».

Количество людей против качества каждого отдельного лица

Добавление большего количества людей в сцену обычно означает:

  • Более низкое качество на каждого человека (вычислительные ресурсы делятся).
  • Более высокая вероятность «дрифта» идентичности.
  • Более длительное время обработки.
  • Больше потенциальных точек сбоя.

Пользователи должны решить, стоит ли наличие нескольких людей компромиссов в качестве.


Существующие решения и их ограничения

Несколько подходов пытаются решить эти проблемы, но у каждого есть свои ограничения.

Техники сохранения идентичности

Некоторые системы используют «эмбеддинги идентичности», которые пытаются поддерживать стабильные черты лица в разных кадрах и под разными углами. Они помогают, но не решают проблему полностью:

  • Хорошо работают для: одного человека, умеренных изменений ракурса.
  • Испытывают трудности с: несколькими людьми, экстремальными ракурсами, быстрыми изменениями.
  • Ограничение: Все еще зависят от обучающих данных для конкретных ракурсов.

Системы с несколькими трекерами

Продвинутые системы используют отдельные трекеры для каждого лица, пытаясь поддерживать независимую идентичность для каждого человека:

  • Преимущество: Лучшее разделение между разными людьми.
  • Недостаток: Увеличенная вычислительная нагрузка.
  • Ограничение: Трекеры все еще могут терять лица или путать идентичности.

Модели, учитывающие ракурс

Некоторые новые модели специально обучены для работы с несколькими ракурсами:

  • Улучшение: Лучшая стабильность при смене ракурсов.
  • Остающаяся проблема: Все еще испытывают трудности, когда несколько ракурсов появляются в быстрой последовательности.
  • Цена: Требуют больше обучающих данных и вычислительных ресурсов.

Часто задаваемые вопросы (FAQ)

Почему дипфейки работают лучше с одним человеком, чем с несколькими?

Каждое лицо требует отдельной обработки. При ограниченных вычислительных ресурсах добавление людей означает их разделение. Кроме того, алгоритмы отслеживания лиц могут запутаться, кому какое лицо принадлежит, особенно если лица похожи или перекрываются.

Могу ли я улучшить качество дипфейка с несколькими людьми, используя более мощное железо?

Более мощное оборудование помогает, но не устраняет фундаментальные проблемы. Даже на мощных системах поддерживать идеальную стабильность для нескольких людей и ракурсов остается сложной задачей из-за ограничений в обучающих данных и архитектуре моделей.

Почему лица меняются при смене ракурса камеры?

Системы дипфейков кодируют лица по-разному в зависимости от угла обзора. При смене ракурса система может переключаться между разными внутренними представлениями, вызывая едва заметные изменения в идентичности. Обучающие данные также, как правило, содержат больше примеров распространенных ракурсов и меньше — экстремальных.

Есть ли способ поддерживать идеальную стабильность при смене ракурсов?

Современные технологии не поддерживают идеальную стабильность при всех ракурсах. Лучшие результаты достигаются путем ограничения смены углов, использования высоких настроек качества и признания того, что некоторая вариативность — это нормально. Исследования продолжаются, но это остается активной областью разработок.

Сколько человек может появиться в дипфейке, прежде чем качество значительно ухудшится?

Это зависит от разрешения видео, вычислительной мощности и настроек качества. Большинство пользователей сообщают, что два человека работают достаточно хорошо, три — уже сложно, а четыре или более обычно демонстрируют значительное ухудшение качества или «дрифт» идентичности.

Могу ли я обработать каждого человека отдельно и затем объединить их?

Некоторые пользователи пробуют такой подход (композитинг). Он может помочь со стабильностью идентичности каждого отдельного человека, но создает новые проблемы: лица могут взаимодействовать неестественно (освещение, тени), временная согласованность может нарушиться, а конечный результат может выглядеть как монтаж, а не естественное видео.


Заключение

Дипфейки с несколькими людьми и сменой ракурсов вскрывают фундаментальные ограничения современных технологий. Те же системы, которые создают убедительные дипфейки с одним человеком, сбоят при увеличении сложности.

Основная проблема заключается не только в вычислениях, но и в том, как модели ИИ представляют и поддерживают идентичность. Лица — это не просто наборы черт; это целостные образы, которые должны оставаться стабильными в разных контекстах, ракурсах и взаимодействиях.

По мере развития технологии дипфейков исследователи работают над лучшими методами сохранения идентичности, системами с несколькими трекерами и моделями, учитывающими ракурс. Но на данный момент пользователи, работающие со сложными сценариями, должны идти на компромиссы: меньше людей, ограниченные ракурсы, более длительное время обработки или более низкое качество.

Технология будет совершенствоваться, но фундаментальная задача — поддержание стабильной идентичности для нескольких людей под разными углами обзора — представляет собой одну из самых сложных проблем в генерации синтетических медиа. Понимание этих ограничений помогает формировать реалистичные ожидания и принимать решения о том, когда и как использовать технологию дипфейков.


Похожие статьи