Для сложных задач пространство поиска может быть огромным. Агенту приходится постоянно решать, какие подходы развивать, какие пробовать параллельно, а какие забросить. Этот процесс, называемый исследованием (exploration), определяет, увенчается ли поиск успехом или вычисления уйдут на тупиковые ветки. Исследовательская группа из Google и DeepMind предложила метод Dream-RSI, который улучшает именно эти решения, не меняя саму ИИ-модель.
Существующие подходы к исследованию делятся на два типа. Фиксированная стратегия поиска не учится на опыте, поэтому агент может раз за разом наступать на одни и те же грабли. Адаптивная стратегия лишена этой жёсткости, но требует множества попыток, чтобы понять, работает ли она. Проверка бесчисленных альтернатив означала бы повторение долгих и дорогих запусков. Dream-RSI предлагает переиспользовать данные завершённого поиска, чтобы тестировать альтернативные стратегии в уже исследованном пространстве. Агент записывает свои попытки и их результаты по ходу поиска, создавая данные для последующего воспроизведения решений. Это похоже на ориентирование на незнакомой местности: в первый визит вы упираетесь в тупики и плутаете, но, имея мысленную карту, можете проложить другой маршрут, не обходя каждую точку заново. Dream-RSI применяет этот принцип к записанным историям поиска. Вместо проверки новой стратегии в реальном запуске агент прогоняет её по сохранённым результатам. Это позволяет увидеть, что было бы, если бы он выбрал другие подходы раньше или отказался от некоторых. Система не изобретает принципиально новые решения во время воспроизведения — она тестирует разные решения внутри записанного дерева поиска. Поскольку все результаты сохранены, тысячи альтернативных стратегий можно проверить без повторного вызова модели или оценщика. Этот процесс исследователи называют «сном». Агент проигрывает тысячи вариаций и выбирает лучшую, прежде чем применить её в реальном поиске. Цикл повторяется: после каждого поиска агент использует записанные результаты для проверки улучшенных стратегий, а затем применяет улучшенную версию в следующем запуске. На протяжении всего цикла меняется только стратегия поиска; модель, генерирующая решения, остаётся нетронутой.
| Метрика | Dream-RSI | SimpleTES |
|---|---|---|
| Число попыток | 317 | 51 200 |
| Среднее время выполнения (мс) | 2 931 | — |
Dream-RSI протестировали с Gemini 3.1 Pro и Gemini 3.7 Flash на восьми задачах в трёх областях. В каждом сравнении использовался базовый вариант с теми же начальными условиями, но фиксированной стратегией поиска. Одна из задач требовала написать максимально быструю программу для статистического расчёта, часто используемого в геномике и финансах. Программа Dream-RSI работала быстрее, чем библиотеки sklearn и glmnet, на всех шести тестовых наборах данных. С
Метод позволяет проверить тысячи вариантов стратегии без повторных вызовов модели и оценщика, что снижает вычислительные затраты.

В дополнительном анализе исследователи проверили другой способ использования историй поиска. Вместо воспроизведения для тестирования стратегий они сжали их в инструкции, указывающие агенту, где искать. На одной из GPU-задач версия с такими инструкциями показала худший результат, чем версия без них. Исследователи предполагают, что чрезмерно конкретные указания могут слишком сузить пространство поиска, мешая агенту исследовать более широкий круг подходов. Тот же анализ показал, как выученная стратегия регулирует усилия. По мере улучшения производительности она сначала сокращала число попыток. Когда прогресс останавливался, она снова увеличивала усилия поиска, что совпадало с дальнейшими улучшениями. Метод Dream-RSI не заменяет базовую модель и не требует её дообучения — он оптимизирует надстройку, управляющую поиском. Это делает его применимым к разным моделям и задачам, где важен баланс между качеством решения и вычислительными затратами.



