norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Q-обучение с скалярным сопряжением

Исследование представляет метод Q-обучения с скалярным сопряжением (SQAM), который использует скалярное сопряжение для улучшения тонкой настройки потоковых политик в off-policy RL. Метод показывает значительные улучшения в сложных задачах OGBench.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
14
голосов источника
Наблюдаем с8 октября 2026 г.14 голосов источника
Темп интереса+0,99/hпо замерам за 3,02 h
Опубликовано7 октября 2026 г.Yonghoon Dong, Minsung Yoon, Jaehyuk Kim
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

14 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Метод может быть полезен для улучшения тонкой настройки политик в сложных задачах, где требуется эффективное использование данных.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема