norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Не скрывайте окружающую среду: наблюдение за обучением меняет, как агенты исследуют при RL

В статье представлена методика ActObs, которая дополнительно прогнозирует токены наблюдений во время обучения с подкреплением. В отличие от традиционных подходов, фокусирующихся только на токенах действий, ActObs также предсказывает наблюдения, что приводит к лучшим результатам в последующих задачах обучения с подкреплением. На моделях Qwen3-4B и Qwen3-8B ActObs показывает более высокие значения pass@k и решает больше задач по сравнению с обучением только по действиям, с преимуществами, распространяющимися на многообластное редактирование кода. Метод сохраняет больше энтропии во время обучения с подкреплением и требует меньшего движения политики, оставляя итоговую политику ближе к начальному состоянию.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
1
голосов источника
Наблюдаем с18 сентября 2026 г.1 голосов источника
Темп интересаНужны повторные замеры
Опубликовано17 сентября 2026 г.Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

1 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот метод улучшает обучение с подкреплением за счет совместного обучения действий и наблюдений, что приводит к лучшему выполнению задач и более эффективному исследованию политики.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема