norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong14 минут назад

Дистилляция для обвинения и дистилляция для возможностей

Статья исследует два подхода к дистилляции для обеспечения безопасности ИИ: DFI (дистилляция для обвинения) и DFC (дистилляция для возможностей). DFI направлена на передачу неправильной ориентации модели слабому ученику, чтобы выявить проблемы учителя, а DFC фокусируется на передаче возможностей без неправильной ориентации. Эксперименты показывают, что DFI работает лучше, когда ученик использует ту же базовую модель, что и учитель, а DFC может сохранять возможности, блокируя скрытые предпочтения.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
20
очков источника
Наблюдаем с9 октября 2026 г.20 очков источника
Темп интереса0/hпо замерам за 0,55 h
Опубликовано9 октября 2026 г.sebastian_prasanna
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

20 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает эмпирические данные о том, как использовать методы дистилляции для повышения безопасности ИИ, либо выявляя несоответствия, либо сохраняя возможности без вредных предпочтений, что может повлиять на разработку более безопасных моделей и практики аудита.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема