Три месяца назад я скопировал в ChatGPT фрагмент внутреннего меморандума. Просто попросил переформулировать абзац. Через два дня этот же текст всплыл в чужом ответе на форуме — оказалось, бесплатные версии используют твои запросы для дообучения, если не отключить это явно. Мне повезло: содержание было обезличенным, никто не связал его с нами. Но осадочек остался.
С тех пор я разобрался, где утекают данные, а где нет. И там есть нюансы, которые разработчики не всегда озвучивают.
Бесплатные версии — зона риска
Когда я только начинал, мне казалось: ну что такого, отправлю текст, получу ответ. А потом узнал, что бесплатные версии ChatGPT (GPT-3.5) и Claude без подписки по умолчанию используют твои запросы для обучения модели. Это не теоретическая угроза — это написано в политиках использования, просто читать их лень.
С GPT-4o и Claude Pro картина другая: обе модели при подписке позволяют отключить обучение на твоих данных. Но делать это нужно вручную, потому что по умолчанию галка может стоять как раз на «использовать для улучшения».
Что проверить прямо сейчас:
В ChatGPT — Settings → Data controls → Improve model for everyone (отключить). В Claude — Settings → Privacy → отказаться от обучения.
Звучит просто, но я знаю людей, которые год сидели на платной версии и не знали про эту галку.
Корпоративные версии решают не всё
Долгое время я думал: перейду на ChatGPT Team или Enterprise — и проблема закрыта. Там действительно есть изоляция данных, твои запросы не летят в общий пул обучения. Но это не значит, что данные не видит сам OpenAI.
В корпоративных планах есть дополнительные механизмы: SOC 2 compliance, гарантии о неиспользовании для обучения, возможность развернуть модель в своей инфраструктуре через Azure OpenAI. Для большинства задач это избыточно, а вот для чувствительных данных — необходимо.
У Claude Business и Enterprise аналогичные оговорки. При этом Anthropic честнее в документации: они открыто пишут, что при определённых условиях данные проходят модерацию людьми. Мне это не мешает, но знать полезно.
Промпты — это тоже данные
Столкнулся с интересным случаем: коллега загрузил в Claude кусок кода с базой данных, замаскировав реальные имена таблиц. Решил, что данные в безопасности. А потом попросил «объясни структуру» — и модель по именам полей восстановила контекст, какой именно бизнес-процесс за этим стоит.
Промпты несут контекст. Имя клиента, внутренний термин, описание проблемы — всё это метаданные. Даже если сами данные не передаются, по сопроводительному тексту часто можно восстановить картину.
Поэтому я для себя выработал правило: если контекст можно описать абстрактно — описываю абстрактно. Вместо «нужна формула для расчёта NPS по нашей CRM» пишу «нужна формула индекса повторных покупок».
Что реально безопасно
Полностью изолированный от интернета LLM — это когда модель работает локально. Я пробовал Llama 3 через Ollama на своём ноутбуке: никаких запросов наружу, всё обрабатывается на месте. Качество ответов ниже, чем у GPT-4o, но для черновиков и черновой аналитики — более чем достаточно.
Ещё вариант — API с нулевым хранением. Многие сервисы дают гарантии, что запросы не сохраняются и не идут на обучение. Но здесь важно читать мелкий шрифт: формулировки бывают разного уровня формальности.
Приватный режим — не волшебная кнопка
В обоих интерфейсах есть приватный режим. В ChatGPT это Data controls в настройках, в Claude — отдельный режим без истории. Но приватный режим не означает, что данные не уходят на сервер. Они просто не сохраняются в истории. Это важное различие, которое многие пропускают.
Для меня лично это значит: приватный режим плюс отключённое обучение плюс отсутствие чувствительных данных в запросе. Три слоя, не один.
Коротко: чеклист, который я себе написал
Бесплатная версия — только для задач без малейшего следа рабочих процессов. Копирайтинг, переводы, общие вопросы по программированию.
Платная версия — проверить и отключить обучение руками. Зайти в настройки и сделать это, а не надеяться на умолчания.
Чувствительные данные — копировать через API с нулевым хранением или ставить локальную модель.
Промпт вставлять без привязки к контексту, который не хочется светить. Абстрактная формулировка вместо конкретной.
Никогда не загружать файлы с реальными именами людей, адресами, внутренними кодами.
Звучит как паранойя, но после того меморандума я стал внимательнее. Цифровая гигиена — это не один раз настроить и забыть. Это привычка, которую проще встроить сразу, чем потом разбираться с последствиями.
