Внедрение LLM в бизнес-процессы часто упирается в вопрос: как обрабатывать данные клиентов, не нарушая закон о персональных данных. Авторы материала из Habr, которые занимаются внедрением LLM и агентов, делятся практическим опытом. Они сразу оговариваются: это разбор для инженеров и продактов, а не юридическая консультация. Тема быстро меняется, и два изменения произошли этим летом, поэтому важно учитывать актуальность информации.

Что такое персональные данные? Согласно п. 1 ст. 3 152-ФЗ, это любая информация, относящаяся к прямо или косвенно определенному или определяемому физическому лицу. Критерий — определяемость субъекта. На практике формулировка широкая, и даже госорганы спорят: Минкомсвязь считает ИНН персональными данными, а Минфин — нет. Суды тоже трактуют по-разному. Поэтому безопасный подход — считать ПД всё: имена, идентификаторы, email и т.д. Это снижает риски из-за неоднозначности трактовок.

Вариант использования LLMЗаконность обработки ПДКомментарий
Зарубежные модели (Claude, OpenAI, DeepSeek)Нет законного способаНельзя оформить поручение обработки
Российские модели (YandexGPT)РазрешеноЯндекс позволяет обрабатывать ПД
Российские модели (GigaChat)ЗапрещеноСбер: сервис не предназначен для ПД
Open-source в российском облаке (DeepSeek у Яндекса)РазрешеноДороже оригинала, но можно обрабатывать ПД
Open-source на своём железе в РФРазрешеноПолный контроль над данными

Чтобы легально обрабатывать ПД, нужно: уведомить РКН, иметь основание (согласие, договор) и локализовать данные в России. Если вы хотите передавать данные LLM, это считается обработкой по поручению оператора — нужно оформить поручение. Во многих российских сервисах оно есть, например у Битрикса. Если серверы LLM за границей, вступает в силу трансграничная передача: нужно отдельно уведомить РКН. РКН делит страны на «адекватные» и нет: по адекватным можно передавать сразу, по остальным — только через 10 дней, если РКН не запретит.

Какие есть варианты использования LLM? Зарубежные модели (Claude, OpenAI, DeepSeek) — законного способа обрабатывать ПД нет, даже если сервер в «адекватной» стране, из-за невозможности оформить поручение. Российские модели: политика разная. Яндекс разрешает обработку ПД, а GigaChat от Сбера — нет, согласно политике сервиса. Open-source модели в российском облаке: у Яндекса по API доступен DeepSeek (дороже оригинала), там можно обрабатывать ПД. Open-source на своём железе в РФ — всё ок. В любом случае нужно отключать логирование и запрещать обучение на ваших данных.

Главный приём — обезличивание. Идея: убирать ПД перед отправкой в модель. Пример: при корректировке договора заменяйте ФИО, ИНН, паспорт на плейсхолдеры NAME, INN, а после ответа восстанавливайте. Для таблиц с обратной связью удаляйте колонки с ПД, оставляя user_id. Но система не может работать на 100% точно — вы снижаете вероятность, но не до нуля. Как обезличивать? Вариант первый — написать своё решение на основе регулярных выражений или NER-моделей. Вариант второй — использовать готовые библиотеки. Важно помнить, что обезличивание — это не панацея, а способ минимизировать риски.