norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

Когда токены EOS не согласны: понимание увеличения длины в on-policy distillation

В статье изучается увеличение длины в on-policy distillation (OPD), когда студенты генерируют слишком длинные ответы. Авторы выявили несоответствие в токенах окончания между базовыми студентами и пост-обученными учителями как важную причину. Показано, что просто выравнивание наборов остановки декодирования недостаточно, а обработка функционально эквивалентных токенов EOS как общих действий остановки значительно смягчает несоответствие.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
4
голосов источника
Наблюдаем с18 сентября 2026 г.4 голосов источника
Темп интересаНужны повторные замеры
Опубликовано17 сентября 2026 г.Yuxiao Yang, Tianrun Yu, Shangzhe Li
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

4 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает понимание, почему студенты в on-policy distillation могут генерировать ответы слишком большой длины, и предлагает практические корректировки для смягчения этой проблемы путем выравнивания токенов окончания.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема