Сижу вечером, листаю ленту — и натыкаюсь на видео, где Илон Маск якобы объявляет новую криптобиржу с доходностью 300% в месяц. Лицо двигается, голос тот, интонации узнаваемые. Две секунды — и веришь. Ещё две — и понимаешь, что это подделка. Но вот вопрос: а если бы это видео пришло не в ленту, а в личные сообщения? От «начальника» в WhatsApp? От «сына», который попал в беду?
Мне 47 секунд понадобилось, чтобы сгенерировать более-менее убедительную аудиоподделку голоса через бесплатный сервис. Я не хакер, не программист — просто потратил время на разбор интерфейса. Это и пугает, и одновременно показывает, насколько доступной стала технология.
Что такое deepfake-аудио и почему это теперь не фантастика
Классический дипфейк — это видео, где одно лицо подменяют другим. Технологии утекли в открытый доступ, и сейчас даже в телеграм-ботах за минуту можно наложить лицо знаменитости на чужое тело. Но ещё опаснее — голосовой дипфейк.
Достаточно 10–30 секунд чистой речи человека, чтобы обучить модель его голосу. Берётся с YouTube-интервью, подкаста, видео в соцсетях — и на выходе получается инструмент, который говорит твоим голосом что угодно. Одна компания из ОАЭ потеряла 35 миллионов долларов после звонка «генерального директора» — и это не анекдот из 2019 года, а событие 2024 года.
Голосовой фишинг — vishing — использует ту же механику: психологическое давление, срочность, авторитет. Только теперь вместо записей из кино и фразы «вы выиграли в лотерею» приходит ваш начальник, который просит срочно перевести деньги на новый счёт. И голос — ваш начальник.
Как это работает на практике
Всё начинается со сбора материала. Аудио из соцсетей, короткие видео, рабочие созвоны в Zoom — всё это источники. Для CEO крупной компании достаточно выступления на конференции. Для вашей мамы — видео из семейного чата.
Дальше либо fine-tuning готовой модели, либо использование API. Рынок сервисов для клонирования голоса растёт лавинообразно — и далеко не все ограничивают доступ. ElevenLabs, Resemble.ai, OpenAI Voice Engine — легитимные инструменты. Но рядом сотни клонов с менее строгими правилами.
Атака почти всегда следует одному сценарию. Первое — авторитет. Звонящий представляется кем-то, кому вы доверяете: босс, IT-отдел, служба безопасности банка, сын или дочь. Второе — срочность. Нет времени проверить, всё должно случиться прямо сейчас. «Срочно, счёт заблокируют», «нужно подтвердить вход», «пропустим сделку». Третье — изоляция. Вас стараются убрать из зоны, где можно посоветоваться. «Ни с кем не обсуждай, это конфиденциально».
Это не ново — социальная инженерия так работала и раньше. Но когда голос звучит идеально, защитные рефлексы притупляются. Мозг слышит знакомый тембр и выключает критику.
Реальные случаи, которые заставляют задуматься
Первый громкий случай — звонок «CEO» в немецкую энергетическую компанию. Менеджер услышал голос начальника, приказавшего перевести деньги венгерскому поставщику. Перевёл. Деньги ушли на мексиканский счёт и растворились. Полиция отследила всё, включая следы аудиомодификации. Но деньги не вернули.
В 2024 году несколько крупных юридических фирм получили аудиосообщения «от партнёра» с просьбой срочно подготовить документы. Юристы — люди, казалось бы, подготовленные к фроду — сначала поверили.
Менее крупный, но не менее показательный случай: мошенники позвонили пожилой женщине, имитируя голос её внука. «Бабушка, я попал в аварию, нужны деньги на лечение». Схема стара как мир, но раньше работал русский след, незнакомый голос. Теперь — родной голос.
Как распознать подделку
Голосовые дипфейки пока не идеальны. При внимательном прослушивании можно поймать несколько индикаторов.
Роботизированность в отдельных слогах — модель иногда «глотает» звуки или произносит их с неестественной чёткостью. Живой человек话音连得更自然нее.
Проблемы с эмоциональным фоном. Дипфейки хорошо передают тембр и интонацию, но сложная эмоциональная окраска — сарказм, тревога, неуверенность — часто звучит фальшиво или нестабильно. Спросите что-то личное — как прошёл день рождения у тёщи — и послушайте, как модель выкрутится.
Неестественные паузы. Живой человек делает паузы иначе, чем нейросеть.
Впрочем, технологии быстро догоняют. OpenAI Voice Engine уже умеет передавать эмоции значительно лучше, чем год назад. Поэтому полагаться только на «на слух» — наивно.
Главный метод — встречный запрос. Попросите назвать что-то, что знает только этот человек и вы. Maiden имя, девичья фамилия матери, кодовое слово из банка, детали недавнего разговора. Настоящий человек ответит. Дипфейк — нет, по крайней мере пока.
Второй метод — обратный звонок. Если «начальник» просит срочно перевести деньги — положите трубку и перезвоните ему сами, на тот номер, который знаете, а не тот, с которого он позвонил.
Третий — задержка. Вам говорят «срочно прямо сейчас»? Срочность — красный флаг. Легитимные запросы терпят пять минут проверки.
Что делают компании
Крупные организации начинают внедрять протоколы. Один из подходов — кодовые слова для подтверждения критических действий. Другой — политика нулевого доверия: любая финансовая транзакция требует независимой верификации через другой канал.
Банки и телекомы постепенно внедряют детекторы синтезированной речи. Не стопроцентные, но работающие на вероятность. Идея простая: синтезированный голос имеет статистические артефакты, которые человек не слышит, но модель ловит.
Пока же главная линия обороны — это люди. Сотрудники, которые знают, что звонок от «босса» с просьбой срочно перевести деньги — это подозрительно. Родители, которые знают, что «внук в беде» требует сначала перезвонить внуку. И базовое правило: технологии меняются, а принципы остаются. Перепроверяйте. Сомневайтесь. Не давайте срочности себя запутать.
Вместо вывода
Я недавно показал своей маме дипфейк её голоса. Она не поверила, что это подделка — пока я не признался. Первая её реакция: «Ну и что теперь, вообще никому не верить?». Хороший вопрос.
Ответ, который кажется мне честным: верить — можно, но с маленькой деталью — сначала проверять. Особенно когда дело касается денег, доступа к системам, срочных просьб. Голос любимого человека в трубке — ещё не доказательство. К сожалению.
