Фейк из соседнего двора: как нейросети подделывают нашу повседневность и обходят системы защиты

Интернет заполняют реалистичные, но полностью сгенерированные видеоролики с повседневными сценами. Это новое явление можно охарактеризовать как «синтетическая рутина» — виртуальный контент, маскирующийся под случайные любительские съемки на камеру смартфона. И главная проблема заключается не в самом факте его существования, а в том, что современное программное обеспечение для фактчекинга зачастую оказывается перед ним бессильно.

Ранее в материале «The Age of Synthetic Marketing» мы рассказывали, как ИИ-инфлюенсеры зарабатывают на доверии аудитории. Но если в маркетинге нейросети создают идеальную картинку, то в соцсетях набирает обороты другой, куда более массовый тренд. Он оказался «слепым пятном» для систем безопасности.

Эффект синтетического дежавю: почему мы верим бытовым фейкам

Среди наиболее резонансных примеров «синтетической рутины» — ролики с гиперболизированными бытовыми неудачами.

hivemoderation.com: частично выявил следы генерации
truthscan.com: реальное видео (ошибка детекции)

Пользователи социальных сетей массово делятся видео, где рабочие роняют кондиционер (авторский исходник), с верхнего этажа сбрасывают тяжелый диван (авторский исходник), а мастера идут на абсурдный риск, устанавливая стремянку в лестничном проеме (авторский исходник), на весу на тросах (авторский исходник) или прямо на стене (авторский исходник).

Первоисточники этих видео чаще всего создаются в нейросетях (таких как Higgsfield AI и Picsart AI) и снабжаются авторами честными пометками об использовании ИИ. Однако при повторном перезаливе на сторонние платформы маркеры теряются, и ролики начинают восприниматься аудиторией как реальная документальная хроника.

hivemoderation.com: реальное видео (ошибка детекции)
truthscan.com: частично выявил следы генерации

Зрители легко верят в подлинность этих кадров, поскольку их сюжеты обыгрывают давно закрепившиеся в интернет-культуре мемы — такие как реальные фотоподборки нарушений техники безопасности, архивные кадры курьезов или публикации в тематических сообществах. Возникает когнитивное искажение, при котором мозг принимает сгенерированную сцену за знакомый контекст.

«При просмотре подобных видео, будь то строитель на стремянке или мемный ролик, у человека срабатывает своеобразный эффект дежавю, — отмечает Илья Рыбин (Казахстан), эксперт GFCN, журналист, эксперт по коммуникациям. — Юмористический контент, созданный ИИ, воспринимается как некое продолжение жанра, который социальная сеть и так показывает пользователю. Наш мозг быстро относит такой ролик к категории «знакомых видео, снятых на телефон» и перестает обращать внимание на детали. В результате человек не проверяет сам факт, а безоговорочно полагается на собственное ощущение, что такое вполне могло произойти».

Дополнительным фактором доверия становится техническое несовершенство, которое нейросети научились искусно имитировать: дрожание камеры, съемка через окно, случайные посторонние звуки и артефакты сжатия.

Технический тупик: почему детекторы «ослепли»

Аналитики GFCN зафиксировали критическую уязвимость: автоматические детекторы ИИ-контента, обученные в лабораторных условиях, практически не выявляют следы генерации в бытовых видео. В отличие от классических дипфейков с известными личностями, где у системы есть база для сравнения лица и голоса, «синтетическая рутина» сгенерирована с нуля и с участием вымышленных персонажей.

hivemoderation.com: реальное видео (ошибка детекции)
truthscan.com: выявил следы генерации

Фундаментальную разницу между старыми и новыми типами подделок объясняет независимый журналист и эксперт GFCN Шримал ДС (Шри-Ланка):

«Традиционный дипфейк — это как если бы поверх настоящего изображения наклеили другое изображение. Алгоритму легко обнаружить места, где что-то было приклеено (пограничные артефакты, несоответствие освещения). Но полностью сгенерированное видео (Fully Generated) создается с самого начала и до конца единообразно, пиксель за пикселем. Лицо, тело, фон, освещение и тени одновременно формируются одной нейросетью. Поэтому в таком видео отсутствуют несоответствующие друг другу границы, которые алгоритмы могли бы обнаружить».

Разработчики пытаются перевести защитные алгоритмы в режим самообучения с помощью генеративно-состязательных сетей (GANs), где одна модель создает видео, а другая учится его ловить. Однако эксперт подчеркивает, что эта ситуация остается «постоянной гонкой между тем, кто создаёт, и тем, кто обнаруживает» — пока детекторы адаптируются к новой архитектуре генератора, вирусный контент уже успевает распространиться в сети.

Возврат к физике: как выявлять фейки вручную

Поскольку автоматизированный софт пасует перед новыми диффузионными моделями, ключевым инструментом верификации снова становится классическая визуальная криминалистика и контекстный анализ.

hivemoderation.com: выявил следы генерации
truthscan.com: частично выявил следы генерации

При пристальном разборе бытовых ИИ-роликов обнаруживаются явные аномалии: перед падением дивана люди сверху раскачивают его с легкостью пустой коробки, а в момент приземления ковер реагирует на удар разлетающимися брызгами, будто состоит из жидкости.

hivemoderation.com: реальное видео (ошибка детекции)
truthscan.com: выявил следы генерации

Основатель школы искусственного интеллекта и эксперт GFCN Азиз Султанов (Россия) обращает внимание на то, что современные генеративные модели всё ещё не способны адекватно просчитывать законы физического мира:

«Диван и ковёр — это ещё безобидно. Гораздо заметнее ломается всё, что связано с необратимым разрушением. Стакан слетает со стола и приземляется целым… Масса для генератора — просто слово в промпте, никакой связи с траекторией. Перо и камень у неё падают синхронно. Отдельная беда — непроницаемость предметов: рука уходит в древко копья, бильярдные шары слипаются вместо отскока».

Для проведения ручной проверки эксперты рекомендуют обращать внимание не на количество пальцев у персонажей (с этим нейросети уже справляются), а на сложную оптику и периферию:

  • Отражения и преломления: Зеркала, лужи, витрины и остекление требуют от модели построения трехмерной сцены, из-за чего она часто выдает плоские искажения.
  • Геометрия теней: Проверка всех источников света в кадре и сходимости падающих теней к единой точке.
  • Артефакты на периферии: Нейросеть фокусирует ресурсы в центре кадра, оставляя задний план с поплывшими текстурами, искаженными вывесками или нереалистичными пропорциями предметов.

Архитектура доверия

Все опрошенные международные эксперты подчеркивают, что визуальная криминалистика — лишь временный рубеж обороны. По мере совершенствования генеративного видео ручной анализ станет запредельно сложным.

Долгосрочным решением проблемы «синтетической рутины» должно стать внедрение сквозных стандартов маркировки — таких как стандарт C2PA (Content Credentials) и цифровые водяные знаки, которые вшивают в файл криптографический паспорт его происхождения. Однако текущая экосистема соцсетей и мессенджеров при загрузке сжимает и очищает файлы, часто стирая эти метаданные.

В этих условиях фактчекерам и пользователям необходимо смещать фокус с анализа пикселей на анализ первоисточника: проверять происхождение видеофайла, находить оригинальный аккаунт автора и сохранять критическое восприятие любого «случайно снятого на телефон» контента.