Nvidia, один из крупнейших инвесторов Anthropic и поставщик оборудования для её моделей, не доверяет компании выполнение чувствительных задач. По данным The Information, для внутренних процессов вроде мониторинга цепочек поставок с помощью ИИ Nvidia разворачивает собственные модели Nemotron, а Fable использует только для менее критичных проектов, таких как open-source разработка. Вице-президент Nvidia по корпоративному ИИ Джастин Бойтано заявил: «Как компания, мы считаем, что ZDR [нулевое хранение данных] должно быть включено по умолчанию».
Проблема выходит за рамки одного вендора. Booz Allen Hamilton, один из первых пользователей модели Mythos от Anthropic, запретила сотрудникам применять Fable для работы над проприетарным ПО в сфере кибербезопасности. Технический директор Билл Васс объяснил: «Мы немного беспокоимся, что [Fable] может учиться на нашем коде». Palantir пошла дальше — компания блокирует развёртывание Fable через своё ПО для клиентов до тех пор, пока Anthropic не предоставит безотзывные гарантии нулевого хранения данных. Генеральный директор Palantir Алекс Карп на мероприятии для клиентов заявил, что компании устали от того, что их «эксплуатируют» ИИ-лаборатории. Позиция Palantir отчасти корыстна: компания заинтересована в том, чтобы клиенты запускали модели через её платформу, а не обращались напрямую к провайдерам.
| Компания | Действие | Причина |
|---|---|---|
| Nvidia | Использует Fable только для open-source, для внутренних задач — Nemotron | Не доверяет чувствительные данные |
| Booz Allen Hamilton | Запретила Fable для проприетарного ПО | Опасения обучения на коде |
| Palantir | Блокирует развёртывание Fable у клиентов | Требует безотзывных гарантий ZDR |
После давления клиентов и августовского шага OpenAI, разрешившей клиентам GPT-5.6 Cyber хранить логи безопасности на собственных серверах, Anthropic представила аналогичную программу для избранных клиентов, которая разворачивается этой осенью. Однако даже нулевое хранение данных не закрывает все вопросы. Как сообщает The Information, и OpenAI, и Anthropic собирают метаданные и технические данные об использовании от корпоративных клиентов. OpenAI называет такие данные «деидентифицированными» — очищенными от информации, позволяющей отследить их до конкретных клиентов. На своём сайте компания указывает, что прогоняет бизнес-данные через автоматические классификаторы и инструменты безопасности, «чтобы лучше понимать, как используются наши сервисы». Полученные классификации представляют собой метаданные о бизнес-данных, «но не содержат самих бизнес-данных». Некоторые клиенты не уверены, что именно охватывают эти метаданные, и считают текущий уровень прозрачности недостаточным.
Booz Allen Hamilton запретила сотрудникам использовать Fable для работы над проприетарным ПО из-за опасений обучения на коде.

Джон Шульман, сооснователь OpenAI, недолго работавший в Anthropic, а ныне сотрудник Thinking Machines, описал спектр способов обучения на пользовательских данных. Он варьируется от прямого предобучения на данных пользователей с высоким риском воспроизведения контента до дистилляции больших моделей в меньшие и создания задач обучения с подкреплением на основе «следов пользователей». Последний подход несёт низкий риск воспроизведения контента, но всё ещё может извлекать интеллектуальную собственность клиента. Спектр простирается от безобидного («использование явной обратной связи пользователей при обучении модели вознаграждения») до инвазивного («загрузка среды разработки и истории коммитов пользователя для превращения в среды обучения с подкреплением»). «Деидентификация слаба, — добавляет Шульман, — пользователей можно отследить по небольшому числу бит», и это не защищает от утечки ИС. В последующем посте он смягчил формулировки: обучение на пользовательских данных «крайне маловероятно» даст значительный прирост возможностей передовых моделей, которые в основном растут за счёт масштабирования предобучения и обучения с подкреплением. Пользовательские данные полезнее для поиска режимов отказа или ситуаций, которые сложно воспроизвести с платными аннотаторами. Однако, отметил он, «компании-разработчики моделей различаются в том, насколько агрессивно они обучаются на пользовательских данных (и загрузка репозиториев — не гипотетическая ситуация)». Это вероятный намёк на инструменты для программирования вроде Codex или Cursor, где пользователи подключают свои репозитории напрямую к сервисам. Шульман призвал к «более строгим нормам раскрытия информации о том, как компании обучаются на пользовательских данных».
Исследователь ИИ Сара Хукер, ранее работавшая в Cohere и Google DeepMind, описывает аналогичную лазейку. Существуют «хитроумные методы синтетических данных, позволяющие генерировать распределённо эквивалентные данные с сохранением приватности». Иными словами, даже если ИИ-лаборатория не использует исходные данные напрямую, она может извлечь статистические закономерности, которые выполнят ту же работу. Хукер предупреждает компании: «Если вы компания с интеллектуальной собственностью, у вас ограниченное окно, чтобы построить собственный интеллект, использующий вашу ИС. Иначе вы питаете передовую лабораторию, которая рано или поздно вторгнется в вашу вертикаль». Шульман высказался после того, как математик Тристан Бакмастер выдвинул серьёзные обвинения против OpenAI. Бакмастер и его соавтор Левент Алпёге использовали модели ИИ для продвижения в решении уравнений Навье — Стокса, загрузив свои черновики через Codex от OpenAI. Вскоре после этого OpenAI представила...
Этот случай сделал проблему доверия осязаемой. Корпоративные клиенты оказываются перед выбором: либо полагаться на заверения лабораторий о защите данных, либо строить собственные модели, как поступила Nvidia. Пока ни один из подходов не даёт полной гарантии.



