norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Нулевой порядок парадигмы выравнивания предпочтений LLM

В этой статье представлено Comparison-based Preference Optimization (ComPO), нулевого порядка метод выравнивания больших языковых моделей с предпочтениями человека, использующий сравнительные оракулы для извлечения направленной информации из пар предпочтений без прямой оптимизации дифференцируемой функции потерь. Метод включает варианты offline и online с гарантиями сходимости и производительности, показывая улучшения по сравнению с существующими методами выравнивания в экспериментах с различными моделями.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
21
голосов источника
Наблюдаем с17 сентября 2026 г.21 голосов источника
Темп интересаНужны повторные замеры
Опубликовано16 сентября 2026 г.Peter Chen, Xi Chen, Wotao Yin
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

21 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот метод предлагает новый подход к выравниванию языковых моделей с предпочтениями человека без использования прямой оптимизации дифференцируемой функции потерь, что может быть полезно в ситуациях, когда такая оптимизация затруднена или непрактична.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема