norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers57 минут назад

Пересмотр кросс-токенизаторного on-policy distillation: От охвата выравнивания до надежности обучения

В статье исследуется на-policy distillation (OPD) в кросс-токенизаторных условиях, с акцентом на охват выравнивания и надежность обучения. Установлено, что строгое выравнивание 1:1 охватывает большинство токенов, сгенерированных студентом, несмотря на несоответствие словарей, и что ограничение обратной KL до топ-16 подмножества общего словаря достигает сравнимой точности с полным общим словарем OPD, в то время как добавление обучения по спанам снижает точность.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
24
голосов источника
Наблюдаем с7 октября 2026 г.24 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано6 октября 2026 г.Bingxi Hou, Guochao Jiang, Guofeng Quan
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

24 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Эта работа предоставляет информацию о повышении эффективности дистилляции за счет фокусировки на надежном обучении в строгих позициях выравнивания вместо широкого охвата, что может помочь избежать противоречивых сигналов обучения в кросс-токенизаторных условиях.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема