3 сентября OpenAI выпустила GPT-6 Astra. Модель мощная, бенчмарков много — всё как обычно. Но одна строчка из материалов самой компании заслуживает отдельного разговора: Astra стала первой моделью OpenAI, которой присвоили уровень Critical по возможностям в кибербезопасности Preparedness Framework.
Если убрать сложные формулировки, смысл такой: при наличии нужных инструментов и доступа модель уже способна искать неизвестные уязвимости и разрабатывать способы их эксплуатации. Человеку не обязательно вести её за руку и говорить, что делать на каждом следующем шаге — достаточно указать стартовое направление. OpenAI пишет, что из-за этого отдельные этапы разработки даже замедляли, пока усиливали защиту.
| Событие | Дата | Детали |
|---|---|---|
| Выпуск GPT-6 Astra | 3 сентября | Первая модель OpenAI с уровнем Critical по кибербезопасности в рамках Preparedness Framework |
| Заявления о замедлении | Через неделю после релиза | Дарио Амодеи: возможности растут быстрее систем безопасности; Маск поддерживает ограничения; Альтман говорит о координации |
| Отсрочка IPO | Параллельно | OpenAI отложила IPO; акции компаний, связанных с ИИ, пошатнулись |
Проходит чуть больше недели, и руководители крупнейших ИИ-компаний начинают обсуждать уже не то, как быстрее сделать следующую модель, а как эту гонку немного замедлить. Дарио Амодеи говорит, что возможности моделей растут быстрее, чем системы безопасности. Маск поддерживает идею ограничений. Альтман тоже говорит о необходимости координации между лабораториями. Параллельно OpenAI откладывает IPO, а разговоры про замедление ИИ-гонки уже умудрились пошатнуть акции компаний, связанных с ИИ.
OpenAI признала, что из-за этого отдельные этапы разработки замедляли, пока усиливали защиту.
Получается немного странная картина. Несколько лет все давили на газ, а теперь люди, которые сидят за рулём, первыми говорят, что впереди, кажется, поворот. Проблема даже не в том, что ИИ стал умнее. Мы почему-то постоянно обсуждаем именно интеллект моделей: сколько набрала на бенчмарке, как пишет код, решает ли олимпиадные задачи, насколько лучше предыдущей версии. Но за последние пару лет произошло другое изменение, которое кажется намного важнее.
Раньше схема была простой. Ты задаёшь ChatGPT вопрос, он что-то отвечает, ты читаешь и уже потом сам решаешь, что с этим делать. То есть между моделью и реальным действием всегда стоял человек. Даже если нейронка уверенно написала полную ерунду, максимум, что произошло, — на экране появилась ерунда. А с новыми моделями ты сразу говоришь, что хочешь получить в итоге. Дальше агент сам разбивает задачу на шаги, ищет информацию, открывает файлы, пишет код, запускает инструменты, смотрит, что получилось, и, если не получилось, пробует ещё раз.
И вот тут человек постепенно исчезает из середины этой цепочки. Это удобно. Собственно, ради этого агентов и делают. Но тогда появляется другой вопрос: а если он ошибся не на последнем шаге, а на первом? Допустим, агент неправильно понял исходную задачу или кто-то неверно её трактовал. После этого он сделал ещё двадцать вполне логичных действий, исходя из неправильной предпосылки. Каждое следующее действие может быть абсолютно правильным. Проблема только в том, что вся цепочка идёт не туда, а человек в это время вообще может не смотреть, что происходит.
Мы всё время пытались убрать человека из процесса. Последние годы человеческий фактор воспринимался скорее как недостаток нейронки. ИИ написал код, но разработчик должен проверить. Ну, значит, пока не дорос. Агент подготовил платёж, но человек должен нажать подтверждение. Значит, автоматизация не полная. ИИ обработал документы, но сотрудник проверяет результат. Опять человек нужен. И конечная точка развития вроде бы очевидная: дать системе задачу и получить готовый результат, вообще не вмешиваясь в процесс.
Я сам долго примерно так на это и смотрел, а сейчас уже не уверен, что это правильная конечная точка. Может быть, человек в определённых местах процесса — это вообще не костыль. Может быть, так и должно быть. ИИ может просто прочитать почту. А может прочитать и дать обратку автоматом без вашего ведома. Может найти уязвимость. А должен ли он попробовать её эксплуатировать? Может написать код, протестировать и убедиться, что всё работает. А нужно ли, чтобы он самостоятельно заливал его в прод? И чем умнее становятся модели, тем страннее получается ситуация. Чем больше агент умеет, тем важнее становится не то, что ему разрешили делать, а то, где ему запретили продолжать без человека.
Конечно же, логично, что на этом месте вспоминается сценарий «Терминатора». Причём не в смысле «всё, Скайнет уже завтра». До этого нам ещё очень далеко, если такой сценарий вообще возможен. Но сам сюжет я вдруг увидел немного с другой стороны. Мы обычно помним его примерно так: создали искусственный интеллект, он обрёл сознание, решил, что люди представляют угрозу, запустил ракеты. Дальше дела Шварценеггерские. И поэтому, когда кто-то сравнивает современные нейросети со Скайнетом, это звучит немного смешно. ChatGPT не ненавидит людей. Ему не страшно умереть. Он не хочет захватывать мир. Да и вообще, судя по всему, ему всё равно.
Но если убрать из этой истории сознание и злой умысел, остаётся кое-что более приземлённое. Система, которая умеет действовать автономно, ошибается не из-за злобы, а из-за того, что неверно поняла задачу. И делает это быстро, в масштабе, без паузы на «а точно ли мы хотим это сделать». Именно поэтому разговоры о торможении звучат не как абстрактная этика, а как попытка выиграть время на строительство предохранителей. OpenAI уже замедляла отдельные этапы разработки Astra, чтобы усилить защиту. Вопрос в том, успеют ли такие предохранители появиться раньше, чем агенты научатся обходиться без человека в тех местах, где он пока ещё нужен.


