norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

Острить без поиска: Он-политико-дистилляция распределения мощности на уровне последовательностей

В этой статье представлена On-policy Power Distillation (OPPD), метод, который острит вероятности вывода языковой модели для улучшения рассуждений без изменения параметров. Обучая модель генерировать ответы за один шаг, OPPD достигает значительных улучшений точности на математических и кодовых тестах по сравнению с традиционными методами выборки и другими техниками, такими как GRPO.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
0
голосов источника
Наблюдаем с6 октября 2026 г.0 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано5 октября 2026 г.Erfan Baghaei Potraghloo, Seyedarmin Azizi, Arya Fayyazi
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

0 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот метод повышает точность рассуждений, остря вероятностные распределения без необходимости дополнительных вычислений во время инференса, что делает его эффективным для реальных приложений.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема