norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

Совместная персонализированная согласованность предпочтений для LLM в условиях дефицита данных

В статье представлена Approximate Pareto Optimality (APO) для решения задачи выравнивания больших языковых моделей (LLM) с предпочтениями пользователей при ограниченном количестве данных. APO группирует пользователей с совместимыми обновлениями, сочетает градиентный спуск с контролируемым подъемом для управления противоречивыми целями и итеративно улучшает инициализацию для лучшей персонализации. Эксперименты на Fed-ChatbotPA и UltraFeedback показывают улучшения, используя только 20 локальных примеров.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
1
голосов источника
Наблюдаем с6 октября 2026 г.1 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано5 октября 2026 г.Liyan Yang, Yige Yuan, Zhiqin Yang
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

1 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот подход позволяет более эффективно персонализировать ответы LLM при ограниченных данных пользователей, группируя совместимых пользователей и оптимизируя подразумеваемые предпочтения через совместное обучение.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема