Утро понедельника. Задача: за два часа найти всё, что можно найти о малоизвестной компании из Тбилиси — кто учредители, что за проекты, есть ли связи с другими игроками рынка. Ещё год назад я бы открыл браузер и пошёл вручную собирать крупицы с LinkedIn, грузинского реестра и нескольких форумов. Сейчас часть этой работы за меня делает ИИ — и это одновременно ускоряет процесс в разы и создаёт новые грабли, о которые я регулярно спотыкаюсь.
Этот пост — попытка честно разобраться, что ИИ реально умеет в OSINT, а где он врёт, тормозит или создаёт ложное чувство безопасности.
Что вообще такое OSINT в контексте ИИ
Когда говорят "OSINT с ИИ", обычно имеют в виду две разные штуки. Первая — языковые модели, которые помогают анализировать уже собранные данные: найти имена в тексте, определить связи между компаниями, выделить ключевые тезисы из сотни документов за минуты. Вторая — инструменты на основе ИИ, которые автоматически собирают данные: парсят сайты, мониторят соцсети, агрегируют утечки.
Я использую и то, и другое, но в разных ситуациях. Для быстрой разведки по компании — удобно. Для глубокого расследования — есть нюансы.
Что ИИ реально умеет
Начну с того, что у меня действительно ускорилось.
Суммаризация и анализ текстов. Была задача: за два дня изучить публикации местных СМИ за три года, чтобы найти упоминания конкретного бизнесмена. Если делать вручную — нереально. Я прогнал тексты через модель с хорошим контекстом — нашла ссылки, которые вручную искал бы неделю. Не идеально, но как отправная точка — значительно быстрее.
Геолокация по фото. GPT-4V и аналогичные мультимодальные модели научились неплохо определять место по снимку, если на нём видны вывески, номера телефонов, дорожные знаки, архитектура. Не всегда точно, но часто enough, чтобы сузить район.
Профилирование в соцсетях. Инструменты типа Gravity AI или Social Links умеют собирать данные из открытых профилей, находить пересечения по фото, геолокации, связям. Для журналистских расследований — мощная штука.
Мониторинг упоминаний. Если нужно отслеживать, что конкретный человек или компания появляются в сети в реальном времени — ИИ-боты с этой задачей справляются лучше, чем ручной поиск по Google Alerts.
Где ИИ облажался — и это важно
Теперь то, о чём редко пишут: границы.
Факты ИИ выдумывает. Это главная проблема. Особенно GPT-подобные модели склонны к галлюцинациям — они уверенно выдают несуществующие статьи, выдуманные имена, фальшивые связи. Я проверял: попросил найти упоминания одного человека в открытых источниках. Модель выдала три публикации с конкретными датами. Две из трёх не существовали. Хорошо, что я не отправил отчёт заказчику до проверки.
Для OSINT это критично. Если ты расследуешь что-то серьёзное, выводы модели — не доказательство. Это затравочный материал, который нужно верифицировать вручную.
Даты и цифры — слабое место. Если модель находит "в 2019 году компания получила грант X" — лучше перепроверить. Даже если звучит убедительно. Анализ новостных текстов и извлечение цифр — не сильная сторона текущих моделей.
Контекстная слепота. ИИ не понимает культурный контекст так, как живой человек. Сарказм, местные реалии, специфика отрасли — всё это может быть потеряно. Модель прочитает пост на грузинском и не поймёт, что это шутка про коррупцию в мэрии.
Приватность и этика. Тут есть серьёзный вопрос. Собрать досье на человека за минуты — технически возможно. Но это этически сомнительно, а в ряде юрисдикций незаконно. Я для себя выработал правило: если задача касается обычного человека, а не публичной фигуры или компании — беру паузу и думаю, зачем мне эти данные.
Что я делаю на практике
Несколько приёмов, которые снижают риск ошибок.
Пользуюсь ИИ как первичным фильтром, а не аналитиком. Он генерирует гипотезы, я их проверяю. Если нашёл связь между двумя компаниями через ИИ — иду проверять через официальные реестры.
Перепроверяю ключевые факты минимум двумя независимыми источниками. Если ИИ сказал, что человек владеет компанией X — смотрю в реестре, действительно ли это так.
Использую разные инструменты. Результаты одной модели — не истина. Но если три разных инструмента дают одно и то же — это уже сигнал.
Практические инструменты, которые я пробовал
Некоторые штуки, которые оказались полезны.
Сбор данных из соцсетей — Maltego, Social Links, Gravity. Стоят денег, но для серьёзной работы окупаются
