Caltech опубликовали работу, которая отвечает на один вопрос: сколько можно выжать из дешёвой модели, если дать ей проверенный чужой опыт.
На тестах получили 86,7% на ARC-AGI-1 там, где сильнейшая альтернатива даёт 70%, и потратили 76 долларов против 234. На SWE-bench Pro, где задачи - реальные баги в репозиториях, 64% против 54% при 208 долларах против 713.
Агентов при этом не улучшали: они оставались простыми и заменяемыми. Улучшали общую базу знаний, которой они пользуются.
Как устроено.
Агент решает задачу и выкладывает на внутренний форум гипотезу вместе с доказательством. Второй контур проверяет, повторяется ли она на других задачах. В следующее поколение уходит только подтверждённое.
Конкурентов авторы перезапустили сами: одна модель, один бюджет, изоляция сети.
Знание переносится.
Корпус, накопленный на одних задачах, поднимает результат на ранее не виденных с 23,3% до 43,3%.
Провалы хранят наравне с находками. Противоречия между агентами не выбрасывают. Их сохраняют как запись о том, какая гипотеза и в каких условиях не сработала. В разобранном примере это сузило зону поиска и решило задачу на следующем поколении.
Все прогоны сделаны на лёгких моделях: Haiku 4.5 и GPT-5.4-mini. Флагманов в работе нет вообще, а на GPT-5.4-mini метод дал 93,3% за 16 долларов.
Отсюда гипотеза, которую стоит проверить на своём контуре. Если накопленный корпус вытягивает лёгкую модель на такой результат, он может вытянуть и вашу локальную.
Эксперимент: взять участок, где сегодня платите за флагманскую модель, накопить базу проверенных решений на своих задачах и прогнать на модели попроще.
Отправил своих агентов тестировать локальные модели.