norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Пересмотр обучения критика в PPO: понимание и смягчение плоскостности значений

В статье выявлено явление под названием Value Flattening в критиках Proximal Policy Optimization (PPO), когда оцененные значения состояний резко меняются, в то время как прогнозы критика остаются плоскими. Предложена методика SP^3O, которая применяет функцию потерь значения только к нескольким состояниям на ответ, демонстрируя улучшения в обучении политики.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
33
голосов источника
Наблюдаем с17 сентября 2026 г.33 голосов источника
Темп интересаНужны повторные замеры
Опубликовано16 сентября 2026 г.Yizhuo Li, Jianhao Yan, Yun Luo
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

33 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование решает важную проблему в PPO, которая влияет на точность оценки значений, что критически важно для эффективного обучения с подкреплением в больших языковых моделях.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема