Светлана Газизова, APO по ИИ в компании UserGate, объясняет на Хабре, как движение волос помогает распознать дипфейк. Биомеханика — раздел науки о том, как тело реагирует на механическую нагрузку: как гасит удар сухожилие, как сгибается сустав, с какой инерцией ведет себя мышца. Те же уравнения описывают прядь волос: у нее есть масса, жесткость на изгиб и собственное демпфирование колебаний. Инженер, проектирующий протез, и художник по спецэффектам, настраивающий колыхание волос анимированного персонажа, решают одну и ту же задачу, просто с разной ценой ошибки.

В физике волосы относятся к категории мягких тел — в противоположность жестким, у которых форма при движении не меняется. Мягкое тело реагирует на нагрузку неравномерно, с задержкой и собственной инерцией. Волосы на видео — почти хрестоматийный пример такого движения: тысячи независимых нитей, у каждой своя масса, жесткость и угол роста из фолликула. Прядь у виска запаздывает на долю секунды относительно пряди на затылке, отдельные волоски вибрируют от воздушного потока, создаваемого движением головы. Волосы вязкоупругие: одновременно упруго возвращаются в форму и вязко гасят колебание. Эти свойства отличаются от пряди к пряди из-за толщины, влажности и степени завивки, поэтому коэффициент демпфирования не одинаков даже в пределах одной прически. Отсюда — легкий хаос движения, который глаз считывает как «живое».

Генеративная модель эту биомеханику не просчитывает. Она не решает уравнения движения мягкого тела для каждой пряди, а статистически угадывает следующий кадр, опираясь на обучающие видео. Возникает системная проблема: качественная симуляция мягких тел — одна из самых ресурсоемких задач даже в играх и кино, где физику считают специально. В дешевых игровых движках волосы часто анимируют как жесткую геометрию на шарнире у корня, потому что полноценная биомеханика съедает бюджет производительности. Дипфейк-генератор приходит к похожему результату не из экономии, а потому что статистическое усреднение множества слегка рассинхронизированных траекторий приводит к одной синхронной. Множество независимых деформаций мягкого тела при усреднении вырождаются в движение жесткого. Специалисты по детекции подделок описывают это так: «волосы двигаются единым куском, будто приклеенным шлемом» — биомеханика пропала, осталась кинематика жесткого объекта. То же нарушение динамики мягкого тела выдает себя в серьгах, которые мерцают между кадрами, и в складках одежды, которые двигаются не по законам деформируемой ткани, а как будто нарисованы поверх неподвижного слоя.

Оговорка обязательна: считать нарушенную биомеханику мягких тел неоспоримым доказательством использования генеративной модели еще рано. Пока это скорее наблюдение практиков, активнее всего его формулирует компания Adaptive Security, специализирующаяся на детекции дипфейков. Рецензируемых биомеханических исследований, которые измеряли бы точность именно этого признака на больших датасетах, найти не удалось. Механизмы создания дипфейков быстро развиваются: несколько лет назад надежным признаком считался характерный след в частотном спектре изображения — артефакт апсемплинга в GAN-архитектурах. Как только индустрия перешла на диффузионные модели, этот след почти исчез. Есть основания полагать, что индикаторы мягкого тела ждет похожая судьба: как только генеративное видео обзаведется встроенной биомеханической симуляцией волос и ткани поверх диффузионного ядра, признак может ослабнуть за один-два цикла обновления моделей.

Но пока у физики мягких тел как индикатора есть практическое преимущество перед сравнением звука с движением губ или анализом пульса по цвету кожи. Чтобы подделать биомеханику убедительно, недостаточно нарисовать правдоподобный кадр: нужно либо честно просчитать деформацию каждой независимой единицы мягкого тела, либо тончайше подделать эту физику, что станет отдельной инженерной задачей дороже генерации самого лица. Тысяча независимых частиц с трением, инерцией и собственным демпфированием — это не то, что легко имитировать статистическим усреднением.