Китайская лаборатория AllSpark опубликовала статью с описанием двух поисковых агентов разного размера. Iris-mini насчитывает 35 млрд параметров, Iris-pro — 397 млрд. Обе модели построены на базе серии Qwen (Qwen3.6-35B-A3B и Qwen3.5-397B-A17B), работают с окном контекста 256 тыс. токенов и, по заявлению команды, показывают лучшие результаты среди открытых поисковых агентов в своём размерном классе.

Главная техническая особенность — способ построения обучающих данных. Команда не собирала вопросы вручную и не брала их из готовых наборов. Вместо этого она разворачивает процесс вспять: берёт страницу-источник и её исходящие ссылки, строит граф терминов и связей, а затем генерирует многошаговый вопрос, ответ на который требует пройти по цепочке связанных шагов. Каждый термин, кроме финального ответа, заменяется парафразом, чтобы подсказку нельзя было найти простым текстовым поиском. Агент вынужден рассуждать, а не подставлять ключевые слова в строку запроса. В датасет попадают только те вопросы, которые эталонная модель не может решить без инструментов, но решает при доступе к нужным источникам. Это отсекает и слишком лёгкие, и неразрешимые задачи.

МодельПараметрыБазовая модельКонтекст
Iris-mini35 млрдQwen3.6-35B-A3B256 тыс. токенов
Iris-pro397 млрдQwen3.5-397B-A17B256 тыс. токенов

Дальше более сильная учительская модель генерирует пути решения, состоящие из рассуждений, поисковых запросов и результатов. Эти пути проходят двухступенчатую фильтрацию: сначала проверяется весь путь целиком на корректность, повторы и глубину поиска, затем судья-модель оценивает каждый шаг отдельно. Критерии для судьи выведены из самих данных, а не заданы вручную. После фильтрации модель дообучается с подкреплением на живом веб-поиске. Судья и суммаризация результатов работают внутри обучающего кластера на собственной большой модели Qwen, чтобы не зависеть от внешних сервисов. Обучение с учителем и обучение с подкреплением чередуются в процессе, который авторы называют «SFT-RL climbing»: самые сложные решённые задачи и наиболее эффективные пути из каждого раунда возвращаются в следующий цикл.

Обучающие вопросы генерируются обратным ходом из структуры ссылок веб-страниц: агент должен рассуждать, а не искать ответ прямым запросом.

Iris-mini tops its size class on three of four benchmarks, trailing only XYZ-Aquila-mini on DeepSearchQA. | Image: AllSpark team
Iris-mini tops its size class on three of four benchmarks, trailing only XYZ-Aquila-mini on DeepSearchQA. | Image: AllSpark team · Источник: The Decoder

Тестирование охватило четыре бенчмарка. BrowseComp проверяет умение находить редкие факты по косвенным подсказкам, BrowseComp-ZH — его китайский аналог, DeepSearchQA оценивает полноту собранных доказательств, а Humanity's Last Exam задаёт академические вопросы экспертного уровня. С включённым управлением контекстом Iris-mini набирает 82,2, 84,8, 86,9 и 52,3 балла соответственно. Iris-pro достигает 88,6, 85,1, 92,9 и 56,4. В младшем классе Iris-mini лидирует на трёх бенчмарках из четырёх и обходит следующую модель, XYZ-Aquila-mini, на BrowseComp на 3,4 балла, уступая ей только на DeepSearchQA. Iris-pro лидирует или делит первое место в старшем классе и иногда приближается к системам, требующим значительно больше вычислений.

Отдельный вывод статьи касается управления контекстом. Команда утверждает, что на распространённых бенчмарках этот фактор часто влияет на результат сильнее, чем заявленные различия между системами. Во время длинных исследовательских сессий контекст может заполниться раньше, чем агент закроет все подвопросы. Приёмы вроде отбрасывания истории диалога искусственно продлевают работу, но мало говорят о реальном качестве модели. Чтобы изолировать эффект, команда прогоняет каждый бенчмарк с управлением контекстом и без него, сохраняя инструменты, лимиты и судью неизменными. Результаты, полученные только с включённым управлением, нельзя чисто разделить на то, что даёт модель, и то, что даёт обвязка вокруг неё. Для меньшей модели эффект особенно велик: прирост на BrowseComp достигает 21,2 балла. Причина не в меньшем бюджете токенов, а в более быстром их расходовании — Iris-mini требует больше шагов на те же задачи и чаще упирается в лимит контекста. На Humanity's Last Exam выигрыш скромнее, потому что этот бенчмарк опирается на предметные знания и академические рассуждения, где веб-поиск играет вспомогательную роль. Лучшие результаты даёт комбинация отбрасывания истории со второй попыткой: если первый заход провалился, система сжимает его в короткую заметку о том, что уже проверено и исключено, и добавляет её к задаче для следующего запуска.

Все результаты Iris получены одним агентом, без вспомогательных моделей и дополнительных шагов верификации в конце. В приложении к статье команда описывает случай, когда агент был отмечен как ошибившийся, хотя его ответ подтверждался исходным материалом. Вопрос на BrowseComp-ZH касался сериала «Игра престолов». Агент ответил «Болтон», а эталонный ответ гласил «Ланнистер». Персонаж, о котором шла речь, Санса Старк, во втором браке выходит замуж за Рамси Болтона. Ответ агента был верным. Команда называет такие расхождения между эталоном и источником поводом пересматривать методику оценки поисковых агентов.