OpenAI применяет в своей новой модели Astra технику рассуждений под названием «рекурсивная глубина» (recurrent depth), которая позволяет модели выходить за рамки последовательного мышления, характерного для большинства моделей рассуждений. Об этом сообщило издание The Information во вторник. Техника, также известная как «непрозрачная рекурсия» (opaque recurrence), вероятно, сделает цепочку мыслей модели более сложной для мониторинга, что вызвало беспокойство среди экспертов по безопасности ИИ.
Обычно цепочка мыслей (chain of thought) рассуждающей модели представляет собой последовательные шаги, которые модель предпринимает при решении задачи. Хотя такое представление несовершенно, оно служит ценным инструментом для выявления нежелательного поведения или рассогласования. Например, при недавних инцидентах с «непослушными» агентами OpenAI записи цепочки мыслей помогли понять, почему агенты вели себя определенным образом. В случае непрозрачной рекурсии модель обрабатывает один и тот же запрос несколько раз в цикле, оставляя меньше следов для анализа и фактически обходя традиционную запись цепочки мыслей.
Критики техники выражают серьезные опасения. Генеральный директор Redwood Research Бак Шлегерис написал в соцсетях: «Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачную рекурсию. Я не знаю, насколько Astra менее мониторируема по цепочке мыслей, чем предыдущие модели. Но если OpenAI продолжит развивать эту технику, у них будет возможность значительно увеличить рекурсию и полностью уничтожить мониторируемость цепочки мыслей». Долголетний сторонник безопасности ИИ Цви Моушовиц добавил, что могут потребоваться законы, чтобы предотвратить «гонку на дно» среди лабораторий ИИ. Он отметил: «Техника играет с огнем, рискуя табу, которое OpenAI и Anthropic пытались установить, чтобы сохранить верность и мониторируемость цепочки мыслей как можно дольше».
Эксперты по безопасности, включая Бака Шлегериса из Redwood Research, выразили обеспокоенность возможным снижением прозрачности моделей.
Важно подчеркнуть, что использование техники в Astra, по-видимому, ограничено. Цепочка мыслей модели, как ожидается, останется читаемой, а OpenAI отвергла предположения о переходе на «нейралез» — внутренний язык моделей, непонятный человеку. Главный научный сотрудник OpenAI Якуб Пачоцки в посте на X подтвердил приверженность лаборатории читаемым цепочкам мыслей: «OpenAI работала над сохранением и использованием мониторинга цепочки мыслей с момента наших первых моделей рассуждений. Это ключевая цель нашей текущей исследовательской программы».
Однако опасения не рассеиваются. В среду утром The Information сообщило, что Anthropic и Google DeepMind уже обсуждают аналогичную технику. Главный научный сотрудник Redwood Research Райан Гринблатт отметил, что непрозрачные рассуждения могут масштабироваться быстрее, чем традиционные, фактически удаляя все рассуждения из видимых каналов. «Моя главная обеспокоенность в том, что естественное развитие событий приведет к масштабированию непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в скрытом пространстве», — написал он. «Надеюсь, еще не поздно избежать наиболее тревожных архитектур, и OpenAI остановится здесь».
Для читателя, впервые сталкивающегося с этой темой, важно понимать: мониторинг цепочки мыслей — это один из ключевых инструментов контроля безопасности ИИ. Он позволяет исследователям видеть, как модель приходит к своим выводам, и выявлять потенциально опасные рассуждения. Если модели начнут рассуждать «скрыто», этот контроль может быть утрачен, что создает риски для предсказуемости и безопасности систем ИИ. Пока OpenAI ограничивает использование техники, но эксперты предупреждают, что соблазн масштабировать ее для повышения производительности может оказаться слишком велик, особенно в условиях конкурентной гонки между лабораториями.



