Стартап Generalist ИИ представил модель GEN-1.5, которая позволяет роботу выполнять новую задачу после просмотра одного демонстрационного видео. Демо-ролик длительностью от 3 до 12 секунд загружается в контекстное окно модели как «физический промпт» — аналог кратковременной памяти. После этого робот выполняет задачу без какого-либо дополнительного обучения.
В тестах, охватывающих десять различных действий — от открывания банки до извлечения денег из кошелька, — средний показатель успеха составил 59%. Однако после десяти шагов дообучения на пяти минутах данных этот показатель вырос до 83%. Модель также способна объединять два промпта в более длинные последовательности, использовать демонстрации из симуляции и частично имитировать движения человеческой руки.
По словам компании, эти способности возникли спонтанно в ходе более чем восьми месяцев предобучения на данных о взаимодействиях. Они не были явно запрограммированы. Подобные результаты — in-context learning для роботов — ранее демонстрировали и другие исследовательские группы, но лишь для ограниченного числа типов задач. Generalist ИИ утверждает, что её модель первой работает с широким спектром задач.
Средний успех на десяти тестах — 59%, после десяти шагов дообучения на пяти минутах данных — 83%.
Однако представленные задачи просты и коротки, а все результаты получены самой компанией и не прошли независимую проверку. Это оставляет открытым вопрос о практической применимости технологии в реальных условиях. Тем не менее, подход, основанный на использовании демонстраций в качестве промптов, может существенно упростить обучение роботов, избавив от необходимости в больших наборах данных и длительном обучении для каждой новой задачи.



