Продолжая использовать наш сайт, вы даете согласие на обработку файлов cookie, которые обеспечивают правильную работу сайта. Благодаря им мы улучшаем сайт!
Принять и закрыть

Читать, слущать книги онлайн бесплатно!

Электронная Литература.

Бесплатная онлайн библиотека.



Главная
Все книги
Назад
Читать: ИИ-2041. Десять образов нашего будущего - Кай-фу Ли на бесплатной онлайн библиотеке Э-Лит


Помоги проекту - поделись книгой:

Амака много раз бывал в Afrika Shrine. Как и любой молодой человек в Лагосе, любящий хорошо провести время, он видел в нем не только подходящее для вечеринки место с едой и выпивкой, но и храм, место паломничества — тут можно соприкоснуться с мятежным и свободным духом живших полвека назад таких же молодых. В этом особенном месте люди волшебным образом забывали обо всех этнических и классовых конфликтах и радовались жизни, пусть бы и под парами алкоголя.

Но сегодня Амака пришел со всем этим проститься.

В Afrika Shrine — и в старом, который он не застал, и в новом — свято хранили память и превозносили черных богов и богинь: Кваме Нкруму, Мартина Лютера Кинга — младшего, Малкольма Икса, Тома Санкару, Нельсона Манделу, Эстер Ибанга, Чинуа Ачебе, Воле Шойинка, Флоренс Озор… — великие души, посвятившие свою жизнь свободе, демократии и равенству[28]. Артисты в этом клубе часто прерывают выступления, чтобы отдать дань уважения своим культурным предкам.

Амака смотрел во все глаза — он молчал и старался получше запомнить все лица. Он молился, чтобы эти боги и духи оберегали его и впредь.

Он уедет из Лагоса, вернется домой и все расскажет отцу. Амака еще не решил, что будет делать дальше. Возможно, его умение работать с GAN поможет ему найти хорошую работу, и ему больше не придется делать дипфейки, а он станет помогать людям. Или ему удастся устроиться в сфере здравоохранения, скажем, заниматься переносом лиц в медицинских датасетах для обучения ИИ?

А ведь он еще отлично умеет раскрашивать старые черно-белые фильмы и улучшать изображение! А вдруг он сможет еще сильнее расправить крылья и сделать то, о чем лишь изредка осмеливался мечтать: снять настоящий нолливудский фильм? У Амаки уже появилась отличная идея для сюжета.

В смартстриме зазвенели монеты — пришли деньги, обещанные Чи. Это означало, что его фейковое видео настолько реально, насколько это вообще возможно — оно разлетелось по интернету, и его влияние можно было сравнить по мощи с ядерным взрывом.

В последние годы видео, созданные с помощью ИИ, спровоцировали мятеж в Габоне и серьезные политические беспорядки в Малайзии. И Амаке была невыносима мысль, что его видео может сыграть такую же скверную роль в истории его родной Нигерии.

Но выбор уже был сделан.

Амака поднялся на сцену и встал в самом центре, прямо под висящим высоко над ней черно-белым портретом Фелы Кути, сначала воздел руки, а потом вытянул их вперед — как бы стараясь соединиться с силой богов и духов.

«Я стану хозяином своей судьбы и сам буду решать, когда смерть придет забрать меня», — серьезно прошептал парень, словно какое-то магическое заклинание. Это были слова самого Фелы Кути, объяснявшие его второе имя Аникулапо — на языке йоруба оно означает «тот, кто несет в суме смерть».

Амака ввел что-то в смартстрим и запустил его в ближайший мусорный бак. Вынул из кармана и надел свою верную грубую маску, напечатанную на 3D-принтере. Амака молился и мечтал убраться отсюда как можно дальше, прежде чем спохватится Чи. Он уедет из Лагоса, из огромного города, исписанного слоганами Eko o ni baje — «Лагос не испортит», и вернется домой, к запахам свежей земли.

Он уничтожит ложь, создав еще одну ложь.

Второе видео, снятое им с помощью софта DeepMask, он уже выложил в интернет — оно готово спровоцировать еще один взрыв. И в первом, и во втором ролике АФАК снимал цифровую маску, под которой оказывалось лицо Репо — идеальный дипфейк, легко преодолевший все антифейковые фильтры. Но второй ролик на этом не заканчивался — аватар продолжал снимать маски: за АФАКом следует маска Репо, затем — другая маска под этой маской, потом еще… Слой за слоем, до бесконечности.

Нигерийцы изумятся: за АФАКом — все боги и богини, почитаемые завсегдатаями клуба New Afrika Shrine.

Анализ. Компьютерное зрение, сверточные нейронные сети; дипфейки; генеративно-состязательные сети (GAN); биометрия; безопасность ИИ

«Боги под масками» — история о визуальном обмане, об обмане зрения. Научившись видеть, распознавать, понимать и синтезировать объекты, ИИ может также манипулировать ими, создавая изображения и видео, неотличимые от реальных. В рассказе описывается будущее, в котором люди больше не смогут полагаться на невооруженный глаз, если наверняка пожелают отличить подлинное видео от тонкого монтажа.

Сайтам и компьютерным приложениям придется (их обяжут законом) использовать антидипфейковый софт (как сегодня используются антивирусные программы), чтобы защитить пользователей от поддельных видео. В нашей истории перетягивание каната между создателями дипфейков и детекторов для их выявления уже переросло в гонку вооружений, и с переменным успехом побеждает тот, у кого больше вычислительных мощностей.

Действие рассказа происходит в 2041 году, но, вполне вероятно, подобная ситуация сложится и раньше — как только развитый мир сможет позволить себе огромные расходы на супердорогие компьютеры, программное обеспечение и ИИ-экспертов, необходимых для создания и обнаружения дипфейков и прочих манипуляций ИИ. И регулирующие эту сферу законы, скорее всего, будут приняты прежде всего в развитых странах. Наша история происходит в стране развивающейся — в ней негативные внешние эффекты дипфейков, по всей вероятности, проявятся несколько позже.

Итак, как же ИИ научается видеть — и через камеры, и через записанные видео? Как используются способности ИИ? Как работает создатель дипфейков, применяющий ИИ? Способны ли люди или ИИ обнаруживать дипфейки? Наполнят ли наши соцсети фейковые видео? Как остановить поток дипфейков? Какими еще дырами в безопасности может быть чреват ИИ? И есть ли что-нибудь полезное в технологии, позволяющей создавать дипфейки?

ЧТО ТАКОЕ КОМПЬЮТЕРНОЕ ЗРЕНИЕ?

В рассказе «Золотой слон» мы увидели потенциальные возможности глубокого обучения при работе с большими данными, в частности в интернете и финансах. Вряд ли вы удивляетесь тому, что ИИ опережает людей по эффективности обработки больших массивов данных. Но вот как насчет способностей, уникальных для человека или прочих живых существ, например восприятия?

Зрение — самый важный из органов чувств человека. Компьютерное (машинное) зрение — это отрасль ИИ, которая обучает компьютеры видеть. Это слово означает здесь не только оцифровку видео или изображения, но и осмысление того, что при этом «видит» компьютер. Алгоритмы компьютерного зрения позволяют реализовать следующие возможности (перечислены в порядке возрастания сложности):

• Получение изображений и их обработка — для реальных 3D-сцен в видео используются камеры и другие приборы-датчики. Каждое видео состоит из последовательности изображений, каждое изображение представляет собой двумерный массив чисел, представляющих конкретный цвет, где каждое число соответствует пикселю.

• Обнаружение объектов и сегментация изображения — изображение разбивается на области и определяется место расположения объектов.

• Распознавание объекта — распознается объект (например, собака) и, возможно, детальная информация (немецкая овчарка, темно-коричневый окрас, и так далее).

• Трекинг объекта — отслеживание движущихся объектов в последовательных изображениях или видео.

• Распознавание жестов и движений — движения идентифицируются, как, например, танцевальные па в игре для Xbox.

• Интерпретация сцены — обеспечивается понимание сцены в целом, включая неявные взаимоотношения и нюансы, например голодная собака, жадно глядящая на кость.

Инструменты для создания дипфейков, использованные Амакой в рассказе, содержат все эти компоненты. Чтобы отредактировать видео с АФАКом, Амаке сначала нужно было разбить его на фрагменты — 60 кадров в секунду, каждый из которых состоит из десятков миллионов пикселей. ИИ считывает эти пиксели и автоматически сегментирует тело АФАКа (или рисует вокруг него границу), которое далее сегментируется на лицо в маске, рот, руки и так далее. И так для каждого видеокадра.

Если видео длится 50 секунд, у нас будет три тысячи кадров (изображений). Кроме того, сопоставляется движение между кадрами, что позволяет выделить связи между объектами. Все это, заметьте, делается до того, как начнется редактирование видео.

Процесс представляется жутко трудоемким, но мы, люди, в своей жизни делаем это на раз-два. Нам достаточно лишь бросить взгляд, и все перечисленное уже проделано — тратится меньше секунды. Кроме того, люди обладают способностью к абстрактной и обобщающей интерпретации, причем даже если один и тот же объект выглядит по-разному под разными углами, при разном освещении, с разных расстояний или даже почти скрыт другими объектами.

Например, увидев человека, сидящего за столом в определенной позе, мы можем сделать вывод, что он держит ручку, нацелившись на лист бумаги, хотя на самом деле не видим ни того, ни другого.

Когда мы что-то «видим», мы, по сути, каждый раз задействуем все накопленные ранее знания о мире — все, что узнали за свою жизнь о перспективе, геометрии, здравом смысле и обо всем том, что видели до этого. У человека это происходит просто и естественно, но научить тому же самому компьютер крайне сложно.

Компьютерное зрение — область исследований, которая пытается преодолеть трудности и сделать так, чтобы компьютеры умели видеть и понимать то, что они видят.

СПОСОБЫ ПРИМЕНЕНИЯ КОМПЬЮТЕРНОГО ЗРЕНИЯ

Уже сегодня мы практически ежедневно соприкасаемся с технологиями компьютерного зрения.

Их можно использовать в режиме реального времени в разнообразных областях — от транспорта до сферы безопасности. Приведу примеры.

• В автомобилях устанавливаются системы помощи водителю «Антисон», не дающие уснуть за рулем.

• Магазины без касс и очередей — типа Amazon Go: установленные в них камеры сами распознают товар, который вы кладете в корзину или возвращаете на полку.

• Охрана аэропортов (подсчет количества людей, распознавание террористов).

• Распознавание жестов (баллы за движения в танцевальных играх для Xbox).

• Распознавание лиц (использование лица пользователя для разблокировки мобильного телефона).

• Смарт-камеры (портретный режим вашего iPhone распознает и выделяет людей на переднем плане, а затем красиво размывает фон для создания эффекта фото, сделанного зеркальным фотоаппаратом).

• Военное дело (определение, кто напротив — солдат противника или мирный житель).

• Автономные системы навигации дронов и автомобилей.

В самом начале рассказа «Боги под масками» мы видели, как системы распознавания лиц используются в реальном времени для автоматической оплаты проезда — путем идентификации пассажиров, проходящих через турникет вокзала. И узнаем, что пешеходы, используя жестикуляцию, могут взаимодействовать с мультяшными животными в уличной рекламе. А смартстрим Амаки использует компьютерное зрение для распознавания городских улиц и указания маршрута, помогает ему добраться до незнакомого пункта назначения.

Кроме того, компьютерное зрение можно применять к изображениям и видео — не такими прямолинейными способами, но не менее полезными и важными. Приведу примеры:

• Интеллектуальное редактирование фотографий и видео (такие инструменты, как Photoshop, широко используют компьютерное зрение для удаления эффекта красных глаз и улучшения качества селфи).

• Анализ медицинских снимков (для определения наличия злокачественной опухоли на КТ-снимке легких).

• Модерирование (цензурирование) контента (обнаружение порнографического и насильственного контента в социальных сетях).

• Подбор сопутствующей рекламы, основанный на содержании конкретного видео.

• Интеллектуальный поиск изображений (находит нужное по ключевым словам или другим изображениям).

• И, конечно же, создание дипфейков (подмена лиц в видео).

В «Богах под масками» рассказывается об инструменте для создания дипфейков, который, по сути, является ничем иным, как автоматическим инструментом для редактирования видео; он по частям подменяет одного человека другим, начиная с черт лица, пальцев, ладоней и голоса и заканчивая жестами, походкой и мимикой. Поговорим об этом подробнее.

СВЕРТОЧНЫЕ НЕЙРОННЫЕ СЕТИ (CNN) ДЛЯ КОМПЬЮТЕРНОГО ЗРЕНИЯ

Заставить компьютерное зрение работать на основе стандартной нейронной сети оказалось очень непростой задачей — ведь любое изображение состоит из десятков миллионов пикселей, и научить систему глубокого обучения находить тончайшие подсказки и признаки в огромном количестве изображений — это, согласитесь, даже звучит устрашающе. В поисках вдохновения в деле усовершенствования этой технологии исследователи обратились к человеческому мозгу.

Зрительная зона коры головного мозга задействует нейроны, соответствующие множеству ограниченных областей (известных как рецептивные поля, или поля восприятия), в рамках которых наши глаза фиксируют изображение в любой конкретный момент времени. Рецептивные поля идентифицируют основные признаки видимых объектов: формы, линии, цвета или углы. Эти детекторы соединены с неокортексом, верхним слоем коры головного мозга (новой корой).

Неокортекс хранит информацию иерархически и обрабатывает выходы полей восприятия, преобразуя их в более сложную интерпретацию сцены.

Наблюдения за тем, как «видят» люди, и вдохновили разработчиков на изобретение так называемых сверточных нейронных сетей (CNN — convolutional neural networks). Самый низкий слой CNN состоит из большого числа фильтров, которые многократно применяются к изображению. Каждый из этих фильтров, как и рецептивные поля, может видеть только небольшие смежные участки изображения.

Глубокое обучение за счет оптимизации параметров на множестве изображений решает, что «замечает» каждый фильтр. Каждый фильтр выдает на выходе уверенность, что видел конкретный признак, им представляемый (например, черную линию). Более высокие слои CNN организованы иерархически, как и неокортекс. Они принимают выход уверенности от более низких слоев и обнаруживают более сложные признаки.

Например, если в CNN загружается изображение зебры, фильтры нижнего слоя могут искать в каждой области изображения только черные и белые линии, а более высокие слои будут видеть полоски, уши и ноги в больших зонах. Следующие слои могут увидеть множество полос, два уха и четыре ноги. На самом высоком слое части CNN могут целенаправленно пытаться отличить зебру от лошади или тигра.

Обратите внимание: все эти примеры иллюстрируют, что CNN может делать, но в реальной работе сеть сама решает, какие признаки (полосы, уши или вообще нечто лежащее за рамками человеческого понимания) будут использованы для максимизации целевой функции.

CNN — это специфическая и улучшенная архитектура глубокого обучения, разработанная для компьютерного зрения, с различными вариантами для изображений и видео. Идея таких сетей возникла в 1980-х годах, у ученых тогда не было ни достаточного объема данных, ни вычислительных мощностей, чтобы продемонстрировать, на что эти сети способны.

Только в 2012 году стало ясно, что данная технология превосходит все предыдущие подходы к компьютерному зрению. По счастливому совпадению, примерно в это же время пользователи сняли на сильно подешевевшие и из-за этого массово распространившиеся смартфоны огромное количество фото и видео и выложили их в социальные сети. Примерно тогда же стали более доступными быстродействующие компьютеры и хранилища данных большого объема. Все эти факторы в совокупности способствовали рывку в развитии и распространении этой замечательной технологии.

ДИПФЕЙКИ

«Президент Трамп — полный и абсолютный ушлепок», — заявил однажды на камеру президент Обама… Ну или это был человек, который выглядел и говорил совсем как Барак Обама. В конце 2018 года видео стало вирусным, но это был дипфейк — поддельный ролик, смонтированный с помощью технологии глубокого обучения. Известны даже авторы — режиссер Джордан Пил и новостная интернет-медиакомпания BuzzFeed.

Пил записал фразу, ИИ преобразовал голос режиссера в голос Обамы. Затем ИИ взял реальное видео Обамы и отредактировал так, чтобы оно максимально соответствовало словам, включая артикуляцию, соответствующую мимику и выражение лица.

Джордан Пил сделал это с конкретной целью — так он хотел предупредить людей о скором наступлении дипфейков, что, собственно, и произошло. Уже в том же году в интернет оказались загружены несколько дипфейковых порнороликов со знаменитостями, это привело к скандалу и в конечном счете к новому закону, призванному решить эту проблему. Но появление дипфейков это уже не остановило.

В Китае в 2019 году было создано приложение, способное за считаные минуты превратить ваше селфи в главного героя какого-нибудь известного фильма. Оно сохраняет оригинальный саундтрек, что существенно снижает технологические требования к процессу.

Программа Avatarify возглавила в 2021 году рейтинг Apple App Store. Она «оживляет» любую фотографию, заставляя человека на ней петь или смеяться.

Короче говоря, дипфейки вдруг стали мейнстримом, и уже любой юзер без особого труда может сам изготовить фейковое видео (пусть и дилетантское, и видимое для детекторов, а зачастую и для человеческого глаза).

Сказанное означает, что в будущем возможна подделка любого цифрового материала, будь то онлайн-видео, заранее записанная речь, кадры с камеры видеонаблюдения или видео с уликами из зала суда. В нашей истории Амака использует инструменты, гораздо более продвинутые, чем имелись в распоряжении Пила, создает сложное, высококачественное видео, подделку, которую не распознает ни человеческий глаз, ни обычное программное обеспечение для обнаружения дипфейков.

Сначала он использует инструмент для преобразования любого текста в звукоряд, который станет неотличим от голоса Репо. Затем он синхронизирует эту речь с лицом Репо с соответствующей мимикой и эмоциями. Далее это лицо накладывается на изображение АФАКа из ранее снятого видео с соответствующими руками, шеей, ступнями и даже его уникальными паттернами пульса и дыхания. А продвинутый ИИ образца 2041 года обеспечивает совершенно бесшовное соединение всех частей тела в нужных местах.

Помимо этого подхода к созданию «фейковых людей», основанного на видео, существует еще 3D-подход, включающий в себя построение трехмерной модели человека исключительно с помощью вычислений. Именно так, например, снимаются полнометражные анимационные картины вроде «Истории игрушек»[29].

Данный подход базируется на другой области информатики — на компьютерной графике. В ней все моделируется математически, и для волос, ветра, света, теней и проч. нужно разрабатывать реалистичные математические модели. Этот трехмерный подход обеспечивает «продюсера» гораздо большей свободой действий, позволяя ему манипулировать каждым персонажем, как только заблагорассудится, однако и сложность, и требования к вычислительным мощностям тут намного выше.

Компьютеры в 2021 году еще не умеют снимать полнометражные фильмы с использованием 3D-видео, способного обмануть человеческий глаз (вот почему люди в анимационных фильмах выглядят не вполне реалистично), не говоря уже о программах-детекторах. Но к 2041 году наверняка появятся фотореалистичные 3D-модели, о которых мы подробнее поговорим в других главах этой книги — «Воробьи-близнецы» и «Мой призрачный кумир».

Джордан Пил создал дипфейк ради развлечения и в назидание, а в нашем рассказе агент Чи вербует Амаку для изготовления дипфейка с конкретным злым умыслом. Помимо распространения сплетен дипфейки могут быть использованы для шантажа, преследования, клеветы, манипуляций на выборах.

Как делаются дипфейки? Как научить ИИ выявлять их? Кто победит — софт для создания дипфейков или программы для их обнаружения? Чтобы ответить на эти вопросы, необходимо разобраться в механизме, который генерирует дипфейки, — в генеративно-состязательных сетях (GAN — generative adversarial networks).

ГЕНЕРАТИВНО-СОСТЯЗАТЕЛЬНЫЕ СЕТИ (GAN)

Дипфейки базируются на технологии, называемой генеративными состязательными сетями. Как следует из названия, GAN — это пара «состязательных» нейронных сетей глубокого обучения. Первая сеть, генератор, пытается создать что-то, что выглядит реалистично (скажем, синтезированное изображение собаки), основываясь на миллионах изображений собак.

Вторая сеть, дискриминатор (сеть-детектив), сравнивает синтезированное изображение собаки из первой сети с подлинными изображениями собаки и определяет, является ли выход генератора подлинным или фальшивым.

Основываясь на обратной связи от дискриминатора, генератор переобучается так, чтобы в следующий раз обмануть дискриминатор. Он самокорректируется, минимизируя «функцию потерь», то есть различия между сгенерированным и реальным изображением. Затем переобучается и дискриминатор, и ему становится легче распознавать фейки — «функция потерь» максимизируется. Эти два процесса повторяются миллионы раз; обе сети совершенствуют свои навыки до тех пор, пока не возникает устойчивое равновесие.

Первая статья о GAN была опубликована в 2014 году. Ее автор Ян Гудфеллоу показал, как генератор сначала создал симпатичную, но явно фейковую «собаку-мячик», которую дискриминатор мгновенно обнаружил, и как первая сеть постепенно научилась создавать фейковые изображения собак, неотличимые от реальных. С тех пор эту технологию применили к видео, речи и многим другим типам контента, в том числе и для создания печально знаменитого видео Обамы, о котором я упомянул ранее.

Можно ли обнаружить дипфейки, созданные GAN? Из-за их относительно рудиментарной природы и ограничений современных вычислительных мощностей большинство дипфейков сегодня обнаруживаются алгоритмами, а иногда и видны невооруженным человеческим глазом.

Facebook и Google уже вступили в состязание по разработке софта для обнаружения дипфейков. Эффективные детекторы дипфейков можно создать и сегодня, но это требует огромных вычислительных мощностей, что является весьма серьезной проблемой, если на ваш веб-сайт ежедневно загружаются миллионы видео и фото.

Однако в долгосрочной перспективе наибольшая сложность состоит в том, что GAN оснащена встроенным механизмом для апгрейда сети-генератора. Допустим, вы обучили генератор GAN, а кто-то другой придумал новый алгоритм для обнаружения вашего дипфейка. Вы можете просто переобучить генератор GAN, чтобы обмануть этот алгоритм-дискриминатор. Так начинается что-то вроде гонки вооружений — каждая из сторон старается переобучить лучшую модель на еще более мощном компьютере.

В нашем рассказе более ранний ролик (про мальчика-вампира) Амака изготовил с помощью относительно простых инструментов в интернет-кафе, на минимальных вычислительных мощностях. Видео получилось достаточно хорошим, чтобы обмануть людей; в 2041 году фейковые видео были уже вполне убедительными, чтобы люди не отличали их от реальных.

Однако видео не смогло обмануть GAN-детектор сайта, на котором его разместили (его обучали с использованием гораздо больших вычислительных мощностей), поэтому оно впоследствии было удалено с сайта и заблокировано.

А позже Чи предоставил Амаке мощный компьютер для обучения сложной GAN, умеющей генерировать не только лицо, но и кисти рук, пальцы, походку, жесты, голос и мимику. Кроме того, эта GAN обучалась на огромном количестве данных, доступных в сети по такой знаменитости, как Репо — мишень Амаки. В результате Амака сумел обмануть все обычные детекторы дипфейков.

Представьте себе ювелирный магазин с пуленепробиваемыми витринами, способными защитить от любых видов стрелкового оружия. Но если у преступника будет ручной противотанковый гранатомет (РПГ), никакое пуленепробиваемое стекло перед ним не устоит. Так что все дело в мощности компьютера.

К 2041 году антидипфейковые программы станут похожими на сегодняшний антивирусный софт. Правительственные, новостные и другие сайты, для которых достоверность информации критически важна, не потерпят фальшивого контента и потому будут устанавливать высококачественные детекторы дипфейков, предназначенные для выявления подделок с высоким разрешением, которые, в свою очередь, создадут крупные сети GAN, обученные на мощнейших компьютерах.

Сайты со слишком большими объемами видео- и фотоматериала (например, Facebook и YouTube) столкнутся с проблемой высокой стоимости сканирования всего загружаемого контента с помощью высококачественных детекторов дипфейков, поэтому они, скорее всего, начнут использовать для всего медиаконтента детекторы низкого качества, а более качественный софт применять, только когда популярность видео или изображения покажет экспоненциальный рост.

Поскольку фейковое видео Амаки должно было стать вирусным, его нужно было обучить на самом мощном компьютере с наибольшим объемом данных, чтобы его не могли обнаружить самые качественные антидипфейковые детекторы.



Поделиться книгой:



Регистрация