Исследователи Google представили WikiSkill — фреймворк, который позволяет ИИ-агентам накапливать знания о прошлых ошибках и успешных стратегиях. В тестах на пяти бенчмарках WikiSkill повысил точность Gemini 3.5 Flash с 49,5% до 68,1%, а Qwen-3.6-27B — с 39,4% до 63,3%. Работа опирается на идею Андрея Карпати об «LLM Wiki» — компиляции опыта в персистентное кумулятивное знание.
Проблема, которую решает WikiSkill, связана с тем, что ИИ-агенты, как правило, не обучаются непрерывно. После каждого запуска они выполняют задачи заново, не сохраняя опыт. WikiSkill предлагает обходной путь: агент пишет для себя улучшенные инструкции после каждого запуска и может использовать их в следующий раз. Это не элегантное решение и, вероятно, более подвержено ошибкам, чем настоящее обучение, но исследование показывает, что это эффективный обходной маневр.
| Модель | Метод | LiveMath | SealQA | SpreadSheet | OfficeQA | ALFWorld | Avg. |
|---|---|---|---|---|---|---|---|
| Qwen-3.5-4B | No skill | 29.1 | 32.5 | 14.6 | 30.2 | 24.4 | 26.2 |
| Qwen-3.5-4B | WikiSkill | 49.7 | 39.4 | 21.1 | 28.5 | 53.7 | 38.5 |
| Qwen-3.5-9B | No skill | 28.2 | 26.3 | 24.3 | 35.9 | 34.7 | 29.9 |
| Qwen-3.5-9B | WikiSkill | 56.3 | 43.1 | 33.6 | 40.5 | 63.4 | 47.4 |
| Qwen-3.6-27B | No skill | 33.9 | 27.5 | 40.8 | 42.1 | 52.8 | 39.4 |
| Qwen-3.6-27B | WikiSkill | 61.9 | 41.6 | 81.7 | 53.7 | 77.6 | 63.3 |
| Gemma-4-31B | No skill | 33.9 | 30.6 | 48.3 | 43.3 | 50.4 | 41.3 |
| Gemma-4-31B | WikiSkill | 56.7 | 41.2 | 68.0 | 44.2 | 64.4 | 54.9 |
| Gemini 3.5 Flash | No skill | 33.0 | 29.4 | 50.5 | 48.6 | 85.9 | 49.5 |
| Gemini 3.5 Flash | WikiSkill | 72.6 | 41.2 | 76.6 | 48.6 | 85.9 | 68.1 |
Архитектура WikiSkill организована в три уровня. «Raw Layer» хранит полные трассы выполнения — от вызовов инструментов до результатов. Эти данные неизменяемы и служат сырьем. Над ним находится «Wiki Layer», где сырые данные преобразуются в структурированные инсайты: задокументированные паттерны ошибок и успешные стратегии. Этот слой знаний никогда не сбрасывается и растет с каждой итерацией. Верхний уровень — «Skill Layer» — содержит активные процедурные инструкции, которым следует агент при выполнении задач. В отличие от вики, навыки можно откатывать, если обновление ухудшает производительность.
Трехуровневая архитектура: Raw Layer (трассы), Wiki Layer (знания), Skill Layer (навыки).

Цикл WikiSkill состоит из четырех шагов. Сначала агент-инференс выполняет задачи, используя текущие навыки, и генерирует трассы выполнения. Затем «Wiki Maintainer» анализирует эти трассы, выявляет паттерны ошибок и успешные стратегии и записывает выводы в вики. «Skill Proposer» использует обновленную вики и данные выполнения, чтобы предложить целевые изменения навыков. Наконец, механизм гейтинга проверяет предложенное изменение на отдельном валидационном наборе, чтобы подтвердить, что оно помогает. Если нет — навык откатывается, но вики остается нетронутой. Даже неудачные предложения не теряются: вики документирует, что было испробовано и почему не сработало, так что Skill Proposer может опираться на эти знания в следующих итерациях.
Исследователи протестировали WikiSkill на пяти бенчмарках, покрывающих математические рассуждения, веб-поиск, манипуляции с электронными таблицами, ответы на вопросы по документам и интерактивные задачи в виртуальной среде. Модели включали Qwen (4B, 9B, 27B), Gemma-4-31B и Gemini 3.5 Flash. WikiSkill стабильно превосходил все предыдущие методы эволюции навыков и базовый уровень без навыков. Разрыв с базовым уровнем растет с размером модели, показывая, что более крупные модели выигрывают от эволюционировавших навыков больше.
На отдельных бенчмарках приросты могут быть значительными: Gemini 3.5 Flash поднимается с 33,0% до 72,6% на LiveMath и с 50,5% до 76,6% на SpreadSheet. Однако выигрыш сильно варьируется в зависимости от типа задачи. Математические задачи и работа с электронными таблицами показывают наибольшие улучшения, тогда как задачи с длинными контекстами документов (OfficeQA) дают гораздо меньший прирост. Исследователи отмечают, что меньшие модели, такие как Qwen-3.5-4B, с трудом выполняют эволюционировавшие многошаговые стратегии поиска в длинных контекстах и возвращаются к своему поведению по умолчанию.
Примечательно, что навыки, развитые одной моделью, часто переносятся на другую и иногда работают даже лучше, чем навыки, которые принимающая модель построила сама. Поскольку это не всегда так, переносимость следует проверять в каждом конкретном случае. Это открывает возможности для экономии вычислительных ресурсов: навыки, созданные мощной моделью, могут улучшить работу менее мощных моделей.

Ограничения исследования включают то, что WikiSkill не является настоящим непрерывным обучением, а лишь эвристикой, которая может накапливать ошибки. Тем не менее, подход демонстрирует практический способ улучшения ИИ-агентов без дорогостоящего дообучения. В отрасли параллельно развиваются другие методы, такие как ReAct и Reflexion, но WikiSkill выделяется своей трехуровневой архитектурой и механизмом отката навыков.



