norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers50 минут назад

Memento 3: Модельно-ориентированное рекурсивное самоусовершенствование через рефлексивные правила

В статье представлена система Memento 3, позволяющая агентам с фиксированным LLM непрерывно обучаться явным моделям мира через внешнюю память. Агент поддерживает правило в виде естественного языка в качестве постоянной семантической памяти, которое компилируется в исполняемый код для прогнозирования и планирования. Через цикл наблюдения, рефлексии и проверки агент уточняет свою модель и использует проверенные обновления для руководства взаимодействием. На ARC-AGI-3 агент с одним моделью достигает среднего значения Relative Human Action Efficiency 100,0 и использует 44% действий человека. В случае Atari Pong обученный контроллер выигрывает 21:0 в каждом из трех оцененных эпизодов.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
6
голосов источника
Наблюдаем с9 октября 2026 г.6 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано8 октября 2026 г.Haoyu Zhao, Zhengxu Yu, Zhiyuan He
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

6 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот подход позволяет агентам LLM непрерывно уточнять свои модели мира с использованием внешней памяти и правил на естественном языке, повышая эффективность в задачах, таких как игры, без дополнительных вызовов LLM.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема