norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Приросты и коллапс в on-policy distillation: Перспектива обучения с подкреплением

Статья изучает на-policy distillation (OPD) в постобучении языковых моделей, объясняя, как это может привести как к улучшению производительности, так и к коллапсу генерации. Она предполагает, что OPD усиливает поведение студентов, любимое неявной обратной связью учителя, и предлагает методы, такие как маскировка нездоровых ответов и инициализация SFT, для смягчения коллапса.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
16
голосов источника
Наблюдаем с8 октября 2026 г.16 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано2 октября 2026 г.Han Cui, Jianhao Yan, Yun Luo
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

16 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает понимание того, почему on-policy distillation может приводить как к улучшению производительности, так и к проблемам генерации, помогая направлять более безопасные и эффективные практики обучения моделей.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема