Персональные данные на выходе из генеративных моделей: что остаётся на серверах
Опубликовано: 27.08.2026
Когда пользователь вводит текстовый запрос в диалоговое окно генеративной языковой модели, он редко задумывается о том, куда именно улетает эта строчка. Тем более когда запрос касается создания изображений специфического характера — скажем, аниме-стилистики с откровенным содержанием. Между тем цепочка «промпт → сервер → сгенерированное изображение → экран» оставляет заметный цифровой след. И вопрос не в моральной стороне запроса, а в том, какие персональные данные оказываются на чужих жёстких дисках и что с ними потом делают.
Как именно генеративные системы получают доступ к личной информации
Языковая модель сама по себе не «хочет» собрать чьи-то данные. Механика проще и одновременно хитрее. Пользователь добровольно передаёт информацию через несколько каналов:
- Текст промпта. Люди часто пишут подробно: «нарисуй девушку, похожую на мою коллегу Машу из бухгалтерии, с такими же очками и рыжими волосами». Имя, должность, внешние особенности — всё это уже персональные данные в понимании 152-ФЗ.
- Загруженные референсы. Многие сервисы позволяют приложить фотографию для стилизации. Если на фото реальный человек — данные уходят на обработку третьей стороне.
- Метаданные и сессии. IP-адрес, идентификатор устройства, браузерная цифровой отпечаток, время запроса, язык интерфейса — стандартный набор, который собирает любая веб-платформа.
- История диалогов. Некоторые системы хранят контекст предыдущих запросов внутри одной сессии, а иногда и между сессиями, если пользователь авторизован.
Отдельный нюанс касается сервисов, специализирующихся на генерации контента для взрослых в аниме-эстетике. Их аудитория особенно уязвима именно из-за специфики запросов: пользователь расслаблен, чувствует анонимность и потому реже фильтрует то, что пишет. Анонимность здесь иллюзорна — технически сервис всегда знает, с какого устройства пришёл запрос.
Что происходит с данными после генерации
Жизненный цикл запроса в типичной генеративной системе выглядит так. Текст попадает на сервер провайдера, проходит через препроцессинг (токенизацию, фильтрацию контента), отправляется в модель, результат возвращается пользователю. На первый взгляд — ничего лишнего не сохраняется. Но на практике всё зависит от политики конкретного сервиса.
Некоторые платформы открыто пишут, что используют пользовательские промпты для дообучения моделей. Другие утверждают обратное, но в условиях юрисдикции, где нет обязывающего законодательства (например, большинство сервисов зарегистрированы в юрисдикциях вне ЕАЭС), проверить это практически невозможно. Третья категория — сервисы с явной опцией «не использовать мои данные для обучения», которая, впрочем, требует доверия к разработчику.
Практический вывод: любой текстовый запрос к облачной генеративной модели следует считать потенциально публичным. Если в промпте есть информация о реальном человеке — это уже риск утечки персональных данных.Специфика генераторов контента для взрослых: почему здесь риски выше
Сервисы, создающие откровенный контент на основе языковых моделей и диффузионных алгоритмов, обладают несколькими особенностями, усиливающими риски:
Низкий уровень доверия к провайдеру. Рынок генерации контента для взрослых — серая зона. Большинство проектов работают без юридического лица, через анонимные домены и облачную инфраструктуру. Привлечь такой сервис к ответственности за утечку данных практически нереально.
Отсутствие модерации запросов. В отличие от крупных платформ типа Midjourney или DALL-E, где стоят жёсткие фильтры на контент для взрослых, узкоспециализированные сервисы намеренно их отключают. Но вместе с фильтрами часто отключают и аудит логов.
Монетизация через данные. Бесплатные генераторы такого профиля редко существуют из альтруизма. Если сервис не берёт деньги напрямую, высока вероятность, что монетизация построена на сборе и продаже агрегированных данных о предпочтениях пользователей — включая тексты запросов.

Техническая уязвимость. Небольшие проекты не могут позволить себе серьёзную инфраструктурную защиту. Базы данных с промптами и сгенерированными изображениями периодически утекают в сеть — это вопрос времени, а не теории.
Реальный сценарий утечки
Представим типичную ситуацию. Пользователь загружает на сервис своё фото с просьбой стилизовать его в формате хентай-аниме. Фото проходит через распознавание лица, извлекаются ключевые точки лица, на их основе генерируется новое изображение. Оригинальное фото при этом может оставаться на сервере — в логах, в кэше, в резервной копии базы. Через полгода проект закрывается, сервер продаётся на аукционе или просто попадает в руки недобросовестного администратора. Связка «реальное лицо + откровенный контекст запроса» оказывается у третьих лиц.
Что можно сделать на практике
Полной защиты не существует — если данные ушли на чужой сервер, контроль над ними утрачен. Но можно существенно снизить риски:
- Не упоминать реальных людей в промптах. Вместо «похожая на Машу из отдела продаж» — описать внешние параметры абстрактно: «девушка 25 лет, рыжие волосы, очки в тонкой оправе». Это убирает прямую привязку к конкретному лицу.
- Не загружать реальные фотографии. Для стилизации использовать сгенерированные ранее изображения или стоковые лица, не связанные с реальными людьми.
- Использовать VPN или Tor. Это не спасёт от сбора данных самим сервисом, но усложнит привязку запроса к реальной личности через IP-адрес и геолокацию.
- Отдельный браузерный профиль. Изоляция сессии в отдельном профиле без авторизации в других сервисах снижает риск корреляции данных.
- Предпочитать локальные модели. Если технические возможности позволяют, имеет смысл запускать генеративные модели на собственном оборудовании. В этом случае данные не покидают компьютер пользователя. Существуют открытые диффузионные модели, которые работают на бытовых видеокартах и поддерживают соответствующие LoRA-модули для стилизации.
- Минимум авторизаций. Сервисы, требующие регистрацию через Google, Discord или электронную почту, автоматически создают связку между вашим основным цифровым следом и запросами на платформе. Анонимный доступ предпочтительнее.
Юридическая сторона вопроса
Российское законодательство (152-ФЗ «О персональных данных») распространяется на операторов, зарегистрированных в России или обрабатывающих данные российских граждан. Большинство сервисов генерации контента для взрослых находятся вне этой юрисдикции, что делает правовую защиту пользователя формально невозможной. Обратиться в Роскомнадзор с жалобой на сервис, зарегистрированный на Каймановых островах и работающий через Cloudflare — упражнение без практического результата.
Ситуация меняется, если речь идёт о российских платформах, интегрирующих генеративные возможности. Здесь оператор обязан получить согласие на обработку данных, опубликовать политику конфиденциальности и обеспечить уровень безопасности, соответствующий характеру обрабатываемых данных. Но на практике контролировать соблюдение этих требований в отношении текстовых промптов крайне сложно — регулятор просто не имеет технической возможности аудита того, что именно происходит с пользовательскими запросами внутри модели.
Баланс между удобством и приватностью
Генеративные системы продолжают снижать порог входа: то, что ещё год назад требовало навыков работы с Python и локальным развертыванием весов модели, теперь доступно через браузер за пару кликов. Удобство тянет за собой компромиссы в приватности, и для многих пользователей этот обмен кажется приемлемым — до первого момента осознания того, что их запросы могли сохранить.
Разумная позиция заключается не в полном отказе от облачных генеративных инструментов, а в осознанном отношении к тому, что именно передаётся на обработку. Текст без привязки к реальным лицам, без имён, без загруженных фотографий — это уже существенно меньший риск, чем детальный промпт с идентифицирующими признаками. Граница проходит не между «безопасно» и «опасно», а между «минимальный след» и «полный цифровой отпечаток».