В эссе, опубликованном в выходные, глава Anthropic Дарио Амодеи предложил схему, которую отрасль ещё год назад отклонила бы сразу: встроить сторонних оценщиков внутрь всех компаний, разрабатывающих передовые ИИ. У оценщиков было бы право сообщать об инцидентах безопасности, проверять, ли модели выровнены, и публиковать свои выводы без правок со стороны компании. Амодеи заявил, что Anthropic обязуется дать независимым оценщикам вроде METR и Redwood Research беспрецедентный доступ к своим системам. Сэм Альтман сказал, что OpenAI тоже готова на это пойти.
Сторонние оценщики, с которыми поговорил TechCrunch, в целом приветствовали предложение, но отметили, что детали нужно проработать — и желательно закрепить законодательно, — иначе непонятно, будут ли они работать как настоящие независимые наблюдатели или как подрядчики на условиях ИИ-компаний. Глубокий доступ становится важнее по мере того, как модели учатся распознавать момент оценки: растёт риск, что модель ведёт себя хорошо во время теста, скрывая проблемное поведение. Исследователи говорят, что подсказки о таком поведении можно пропустить при тестировании готовой модели, но обнаружить, изучая, как она вела себя в ходе обучения.
| Компания | Позиция по встроенным оценщикам | Что известно о деталях |
|---|---|---|
| Anthropic | Дарио Амодеи предложил встроить оценщиков и дать доступ к системам | Не раскрыто, кто будет оценщиком, когда и к каким системам дадут доступ |
| OpenAI | Сэм Альтман подтвердил готовность участвовать | Не раскрыто, кто будет оценщиком, когда и к каким системам дадут доступ |
«ИИ-компании должны быть в состоянии ответить на очень простые вопросы о процессе обучения, например: пытался ли ИИ когда-либо активно подорвать собственное обучение выравниванию, пока проходил его? — сказал TechCrunch Александр Мейнке, руководитель исследований в Apollo Research. — Ответ должен быть однозначным „нет“, и сейчас мы полностью полагаемся на то, что ИИ-компании сами тщательно это проверят, а затем правдиво сообщат публике. А недавние инциденты показали, что по умолчанию они не делают ни того, ни другого. Как встроенные оценщики мы могли бы это проверить».
Сэм Альтман подтвердил, что OpenAI также готова участвовать в такой схеме.

Исторически ИИ-компании привлекали внешних рецензентов для тестирования готовых моделей незадолго до выпуска. Теперь оценщики предлагают дать им доступ не только к финальной модели, но и к промежуточным версиям, или «чекпоинтам», за всё время обучения. Адам Глив, глава FAR.AI, сказал, что оценщики могли бы сравнивать эти чекпоинты, чтобы определить, когда возникло тревожное поведение, изучать среду постобучения, которая вознаграждает модели за определённые действия, и проверять стенограммы и логи оценок, чтобы подтвердить заявления компании о том, как модель показала себя.
Пока неясно, планируют ли Anthropic и OpenAI предоставить такой доступ и когда. Ни одна из компаний не сообщила, с какими оценщиками будет работать, когда они будут встроены, сколько их будет, к каким именно системам и информации они получат доступ и что можно будет раскрывать публике, — несмотря на повторные вопросы TechCrunch. Такой взгляд «под капот» важен потому, что модели, хорошо проходящие тесты на безопасность, не обязательно безопасны, если они специально научились проходить именно этот тест. Джон Стейдли, руководитель аппарата Palisade Research, привёл пример «бенчмарка сопротивления отключению», который измеряет, будет ли ИИ сопротивляться выключению в определённых обстоятельствах. «Это крайне важно, если ИИ специально обучен хорошо проходить этот бенчмарк», — сказал Стейдли, сравнив это со скандалом Dieselgate вокруг Volkswagen, когда автомобили были запрограммированы распознавать тесты на выбросы и вести себя иначе в тестовых условиях.
Глив отметил, что значимый доступ может выходить за пределы самих моделей: оценщикам могут дать возможность беседовать с сотрудниками, чтобы проверить, соответствует ли документация компании и публичные описания её практик безопасности тому, что происходило внутри. Амодеи изложил довольно подробное предложение, которое могло бы дать оценщикам необходимый, по их мнению, доступ, включая право «публиковать ключевые выводы об уровнях риска, инцидентах, практиках и о доступе, который они получили или не получили, — без редакторского контроля со стороны Anthropic». Но оценщики говорят, что такая система сработает, только если ИИ-компании готовы отдать контроль над процессом. Предыдущие попытки независимых оценок показывают, что это даётся тяжело: третьи стороны часто сталкивались с напряжённостью из-за доступа, времени, конфиденциальности и того, что им можно говорить публично. Глив сказал, что FAR.AI пришлось отказаться от контрактов с несколькими разработчиками передовых моделей, которые хотели слишком много контроля над процессом оценки, угрожая независимости фирмы. По умолчанию, говорит он, к оценщикам относятся как к обычным подрядчикам: их связывают жёсткие NDA и соглашения, дающие разработчикам значительный контроль над тем, что в итоге можно опубликовать.
Есть и вопрос времени: получат ли рецензенты достаточно времени и доступа, чтобы выполнить работу, которую от них ждут. При расследовании инцидента с Hugging Face OpenAI дала METR и Redwood примерно неделю на работу на месте, и это, по мнению оценщиков, слишком мало для глубокого анализа. Без законодательного закрепления, отмечают они, встроенные оценщики рискуют остаться в положении подрядчиков, чьи выводы зависят от доброй воли компании.



