OpenAI 14 мая представила GPT-6 Astra, назвав её самой умной и выровненной моделью в мире. Грег Брокман, сооснователь компании, заявил, что Astra — это скачок, и её можно считать версией AGI. Отдельную волну обсуждений вызвала кибербезопасность: это первая модель, которую сама OpenAI отнесла к порогу Critical в своей рамке готовности. Это означает, что она способна находить неизвестные уязвимости и писать к ним эксплойты без участия человека, который вёл бы её за руку.
Однако, как отмечают аналитики, ключевое изменение не в процентах на бенчмарках и не в киберстрашилках. Впервые в проде изменили сам способ, которым рождается слово. Традиционный трансформер работает так: механизм внимания (attention) определяет, о чём речь в последовательности, а второй механизм извлекает связанное знание. Модель превращает последнее слово в следующее, подмешивая смысл последовательности и вытащенное знание. Блоки в стопке проходятся по очереди снизу вверх, и с каждым словом оно становится точнее. Увеличение числа блоков или их толщины — это и было основным способом улучшения моделей последние годы.
| Параметр | Обычный трансформер | Зацикленный трансформер |
|---|---|---|
| Число проходов | Фиксировано (N слоёв) | Переменно (от 4 до 90, в среднем 32) |
| Память | Зависит от числа слоёв | Не зависит от числа циклов |
| Вычисления | Пропорциональны числу слоёв | Растут с числом циклов |
| Обучение | Градиент по всем слоям | Градиент только по последним 8 циклам |
Теперь, по данным The Information, Astra устроена как looped transformer — зацикленный трансформер. OpenAI не опровергла эту информацию, хотя имела возможность. Суть в том, что стопка блоков доходит до конца и не выпускает слово наружу, а отправляет результат обратно на свой же вход, прогоняя его ещё раз. Слово выходит наружу только после завершения циклов. Это напоминает ситуацию, когда человек обдумывает мысль повторно, прежде чем произнести её вслух.
Astra — первая модель OpenAI, отнесённая к порогу Critical: она способна находить неизвестные уязвимости и писать эксплойты без участия человека.
Экономика такого подхода привлекательна: веса лежат в одном блоке, и многократный прогон не увеличивает их число. Память остаётся той же, но вычисления растут. Фактически получается глубокая модель по цене мелкой — платите не видеопамятью, а временем. Это позволяет достигать большей глубины без увеличения параметров.
Обучение зацикленной модели отличается от стандартного. Обычную модель учат, прогоняя данные через N слоёв и корректируя веса; число слоёв фиксировано. В случае петли, как показано в работе Гайпинга и коллег (открытая модель Huginn на 3,5 млрд параметров), число кругов на каждом шаге обучения выбирается случайно из логнормального распределения Пуассона со средним около тридцати двух. Модель никогда не знает заранее, сколько раз её прогонят: может быть четыре, а может девяносто. Градиент при этом считается только по последним восьми кругам, что напоминает усечённое обратное распространение во времени у рекуррентных сетей, но здесь рекуррентность по глубине, а не по времени.
Такой подход меняет постановку задачи обучения: модель учат не выдавать ответ за фиксированное число слоёв, а сходиться — приходить к вменяемому состоянию за столько кругов, сколько дано. Это фундаментальное отличие, которое может повлиять на дальнейшее развитие ИИ. Пока неясно, насколько эффективно это работает в масштабах GPT-6 Astra, но открытая модель Huginn уже демонстрирует жизнеспособность подхода: при 3,5 млрд параметров и 800 млрд токенов она показывает результаты, сопоставимые с моделями, которым потребовалось бы 50 млрд параметров.

