Коллега скинул скриншот: менеджер из соседнего отдела скопировал в ChatGPT таблицу с контактами клиентов — "чтобы бот помог составить письма". Таблица улетела на сервера OpenAI. Клиенты не изменились, но факт остался фактом: личные данные ушли куда-то вовне.
Меня это зацепило. Я и сам грешил: скармливал боту куски договоров, исходный код с названиями переменных, где проскакивали реальные имена. Потом задумался — а что вообще происходит с этими данными?
Разбирался неделю. Вот что узнал.
Какие данные точно нельзя отправлять
С ходу определил три категории, где всё плохо.
Персональные данные — ФИО, адреса, паспорта, номера телефонов. Попадают под 152-ФЗ. Компания, которая отправляет такое в публичный API без согласия клиента, формально нарушает закон. Не то чтобы кого-то за это массово штрафовали, но юристы уже нервничают.
Коммерческая тайна — стратегии продаж, ценовая политика, переписки с подрядчиками. Патенты и ноу-хау тем более. Если ваш конкурент случайно получит ваши данные через утечку у OpenAI — это, мягко говоря, неприятно.
Код с реальными credentials — API-ключи, токены авторизации, пароли от баз данных. В профессиональных чатах попадались истории, где разработчики загружали кусок кода, а потом обнаруживали в коммитах случайно оставленный ключ от AWS.
Работает простой принцип: если данные не хочешь публиковать на главной странице «Периодики» — не отправляй боту.
Что происходит с данными на самом деле
Многие думают: «Я же не вводил ничего секретного, только спросил про отчёт». Но вот нюанс — LLM-системы обучаются на данных. Даже если конкретный запрос не попадает в обучающую выборку, история переписки может использоваться для улучшения моделей. Зависит от настроек аккаунта и политики конкретного сервиса.
У OpenAI по умолчанию данные могут использоваться для обучения, пока не отключишь. У Anthropic политика жёстче — данные не идут в обучение без прямого согласия. Но даже это не гарантия на сто процентов.
А ещё бывают инциденты. Утечки случаются у всех, даже у больших.三星 запретили сотрудникам использовать ChatGPT после того, как инженер случайно отправил конфиденциальный код. Реальный кейс, не байка.
Что я стал делать — практические инструменты
Перестать пользоваться чат-ботами — не вариант, они реально экономят время. Стал разбираться, как готовить данные.
Отключил обучение на моих данных. В настройках ChatGPT (Settings → Data Controls → Improve model for everyone) убрал галочку. У Claude это выключено по умолчанию, но проверил. Мелочь, но спокойнее.
Использую локальные модели для чувствительных задач. Для работы с кодом и документами поставил Llama 3 через Ollama на своём ноутбуке. Никуда ничего не уходит. Минус — качество ниже, но для черновиков и рефакторинга кода хватает.
Шифрую и обезличиваю данные перед отправкой. Если нужно, чтобы бот понял контекст задачи, заменяю реальные имена на «Клиент А», «Проект Б». Компании и адреса — на заглушки. Бот всё равно решает задачу, а данные остаются внутри.
Корпоративные аккаунты вместо личных. В enterprise-тарифах (ChatGPT Team, Claude for Work) обещают изолированную обработку данных и отсутствие обучения. Дорого для маленькой команды, но если работаете с клиентскими данными постоянно — считайте это страховкой.
Проверяю, что отправляю, перед отправкой. Звучит очевидно, но привычка «быстро спросить» отключает критическое мышление. Три секунды на взгляд перед тем как нажать Enter — не так уж много.
А если всё-таки отправил?
Бывает. Сам пару раз отправлял и потом хватался за голову. Порядок действий такой.
Удалил переписку сразу — в интерфейсе чата. У ChatGPT есть опция удаления конкретных диалогов. Работает, но это не гарантирует, что данные не были уже обработаны.
Если отправил ключ или пароль — ротируйте их немедленно. Сменили пароль, сгенерировали новый API-ключ, отозвали старый токен. Это важнее, чем паниковать по поводу утечки.
Корпоративные клиенты могут запросить подтверждение удаления данных через официальный канал поддержки. У обоих сервисов есть процедуры для enterprise-клиентов.
Что в итоге
Ничего революционного не скажу: проблема не в том, что чат-боты злые. Они просто не созданы для работы с секретными данными — это инструмент общего назначения. Обращаться с ними нужно соответственно.
Самый рабочий подход, который я для себя вывел: отправляй боту только то, что готов увидеть в открытом доступе. Всё остальное — локальные модели, корпоративные решения, ручная обработка.
Коллега из соседнего отдела, кстати, теперь использует для таких задач внутренний чат на базе API — данные никуда не уходят, а результат тот же. Говорит, что три дня привыкал, а потом забыл про проблему.
Мораль простая: инструмент — отличный, но у него есть границы. Знать их не стыдно. Стыдно — не знать и потом разбираться с последствиями.
