norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

RetireOPD: Саморетирующееся на-policy дистиллирование для агентного обучения с подкреплением

В статье представлена методика RetireOPD для агентного обучения с подкреплением, которая использует саморетирующееся на-policy дистиллирование. Она оптимизирует учителя, условленного навыками, с помощью вознаграждений среды, а затем обучает ученика без навыков с помощью RL и OPD, позволяя ученику прекратить использование учителя, когда производительность стабилизируется. RetireOPD повышает показатели успешности в задачах ALFWorld и WebShop по сравнению с базовым подходом RL.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
4
голосов источника
Наблюдаем с18 сентября 2026 г.4 голосов источника
Темп интересаНужны повторные замеры
Опубликовано17 сентября 2026 г.Yan Yu, Zhengxi Lu, Yizhou Liu
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

4 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

RetireOPD позволяет агенту-ученику самостоятельно прекратить использование учителя, когда он достигает стабильного уровня производительности, что может снизить зависимость от внешнего надзора в задачах обучения с подкреплением.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема