Исследователи Google представили WikiSkill — фреймворк, который позволяет ИИ-агентам накапливать знания о прошлых ошибках и успешных стратегиях. В тестах на пяти бенчмарках WikiSkill повысил точность Gemini 3.5 Flash с 49,5% до 68,1%, а Qwen-3.6-27B — с 39,4% до 63,3%. Работа опирается на идею Андрея Карпати об «LLM Wiki» — компиляции опыта в персистентное кумулятивное знание.

Проблема, которую решает WikiSkill, связана с тем, что ИИ-агенты, как правило, не обучаются непрерывно. После каждого запуска они выполняют задачи заново, не сохраняя опыт. WikiSkill предлагает обходной путь: агент пишет для себя улучшенные инструкции после каждого запуска и может использовать их в следующий раз. Это не элегантное решение и, вероятно, более подвержено ошибкам, чем настоящее обучение, но исследование показывает, что это эффективный обходной маневр.

МодельМетодLiveMathSealQASpreadSheetOfficeQAALFWorldAvg.
Qwen-3.5-4BNo skill29.132.514.630.224.426.2
Qwen-3.5-4BWikiSkill49.739.421.128.553.738.5
Qwen-3.5-9BNo skill28.226.324.335.934.729.9
Qwen-3.5-9BWikiSkill56.343.133.640.563.447.4
Qwen-3.6-27BNo skill33.927.540.842.152.839.4
Qwen-3.6-27BWikiSkill61.941.681.753.777.663.3
Gemma-4-31BNo skill33.930.648.343.350.441.3
Gemma-4-31BWikiSkill56.741.268.044.264.454.9
Gemini 3.5 FlashNo skill33.029.450.548.685.949.5
Gemini 3.5 FlashWikiSkill72.641.276.648.685.968.1

Архитектура WikiSkill организована в три уровня. «Raw Layer» хранит полные трассы выполнения — от вызовов инструментов до результатов. Эти данные неизменяемы и служат сырьем. Над ним находится «Wiki Layer», где сырые данные преобразуются в структурированные инсайты: задокументированные паттерны ошибок и успешные стратегии. Этот слой знаний никогда не сбрасывается и растет с каждой итерацией. Верхний уровень — «Skill Layer» — содержит активные процедурные инструкции, которым следует агент при выполнении задач. В отличие от вики, навыки можно откатывать, если обновление ухудшает производительность.

Трехуровневая архитектура: Raw Layer (трассы), Wiki Layer (знания), Skill Layer (навыки).

The WikiSkill cycle in four steps. The inference agent generates execution traces (Raw Layer), the Wiki Maintainer distills patterns into the persistent wiki, the Skill Proposer derives skill updates, and a gating mechanism checks whether t
The WikiSkill cycle in four steps. The inference agent generates execution traces (Raw Layer), the Wiki Maintainer distills patterns into the persistent wiki, the Skill Proposer derives skill updates, and a gating mechanism checks whether t · Источник: The Decoder

Цикл WikiSkill состоит из четырех шагов. Сначала агент-инференс выполняет задачи, используя текущие навыки, и генерирует трассы выполнения. Затем «Wiki Maintainer» анализирует эти трассы, выявляет паттерны ошибок и успешные стратегии и записывает выводы в вики. «Skill Proposer» использует обновленную вики и данные выполнения, чтобы предложить целевые изменения навыков. Наконец, механизм гейтинга проверяет предложенное изменение на отдельном валидационном наборе, чтобы подтвердить, что оно помогает. Если нет — навык откатывается, но вики остается нетронутой. Даже неудачные предложения не теряются: вики документирует, что было испробовано и почему не сработало, так что Skill Proposer может опираться на эти знания в следующих итерациях.

Исследователи протестировали WikiSkill на пяти бенчмарках, покрывающих математические рассуждения, веб-поиск, манипуляции с электронными таблицами, ответы на вопросы по документам и интерактивные задачи в виртуальной среде. Модели включали Qwen (4B, 9B, 27B), Gemma-4-31B и Gemini 3.5 Flash. WikiSkill стабильно превосходил все предыдущие методы эволюции навыков и базовый уровень без навыков. Разрыв с базовым уровнем растет с размером модели, показывая, что более крупные модели выигрывают от эволюционировавших навыков больше.

На отдельных бенчмарках приросты могут быть значительными: Gemini 3.5 Flash поднимается с 33,0% до 72,6% на LiveMath и с 50,5% до 76,6% на SpreadSheet. Однако выигрыш сильно варьируется в зависимости от типа задачи. Математические задачи и работа с электронными таблицами показывают наибольшие улучшения, тогда как задачи с длинными контекстами документов (OfficeQA) дают гораздо меньший прирост. Исследователи отмечают, что меньшие модели, такие как Qwen-3.5-4B, с трудом выполняют эволюционировавшие многошаговые стратегии поиска в длинных контекстах и возвращаются к своему поведению по умолчанию.

Примечательно, что навыки, развитые одной моделью, часто переносятся на другую и иногда работают даже лучше, чем навыки, которые принимающая модель построила сама. Поскольку это не всегда так, переносимость следует проверять в каждом конкретном случае. Это открывает возможности для экономии вычислительных ресурсов: навыки, созданные мощной моделью, могут улучшить работу менее мощных моделей.

WikiSkill (yellow) consistently beats all other skill evolution methods and the no-skill baseline. The gap to the baseline grows with model size, showing that larger models benefit more from evolved skills. | Image: Tang et al., 2026
WikiSkill (yellow) consistently beats all other skill evolution methods and the no-skill baseline. The gap to the baseline grows with model size, showing that larger models benefit more from evolved skills. | Image: Tang et al., 2026 · Источник: The Decoder

Ограничения исследования включают то, что WikiSkill не является настоящим непрерывным обучением, а лишь эвристикой, которая может накапливать ошибки. Тем не менее, подход демонстрирует практический способ улучшения ИИ-агентов без дорогостоящего дообучения. В отрасли параллельно развиваются другие методы, такие как ReAct и Reflexion, но WikiSkill выделяется своей трехуровневой архитектурой и механизмом отката навыков.