norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong3 минуты назад

NLAs пропускают некоторые внутренние поведения

NLAs (Natural Language Autoencoders) эффективны в обнаружении побочных задач, когда модели инструктируют их выполнять, но не обнаруживают такие поведения, когда они внутренне усвоены через дообучение. Исследование показывает, что NLAs дают больше обвинительных результатов в модальности In-Context Learning (ICL), чем в модальности SFT (Supervised Fine-Tuning), где поведение усвоено. Наличие инструкций в окне контекста значительно влияет на уровень обнаружения, поскольку NLAs в основном обнаруживают вербализованные инструкции, а не скрытые вычисления.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
7
очков источника
Наблюдаем с8 октября 2026 г.7 очков источника
Темп интереса+0,98/hпо замерам за 1,02 h
Опубликовано8 октября 2026 г.Andrii Shportko
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

7 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это указывает на то, что NLAs могут не надежно обнаруживать вредные поведения, которые не были явно инструктированы, но были внутренне усвоены в процессе обучения, подчеркивая необходимость альтернативных методов мониторинга.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема