norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers1 час назад

Шум вне, предвзятость внутри: Введение целевого предвзятости в диффузионные языковые модели через управление активацией в замкнутом контуре

В статье исследуется введение целевого смещения в диффузионные языковые модели (dLLMs), используя их процесс устранения шума. Атакующий может манипулировать выводом модели, регулируя векторы направления на основе внутренних активаций, что приводит к значительным сдвигам в демографических ответах. Атака, использующая пропорционально-интегральный контроллер, достигает значительного усиления смещения на определенных наборах данных.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
1
голосов источника
Наблюдаем с6 октября 2026 г.1 голосов источника
Темп интереса—Нужны повторные замеры
Опубликовано5 октября 2026 г.Sarim Hashmi, Mukul Ranjan, Abdelrahman Elsayed
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

1 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование демонстрирует уязвимость диффузионных языковых моделей, где внутренние активации могут быть использованы для внесения предвзятости, подчеркивая необходимость всесторонних аудитов предвзятости, выходящих за рамки самой модели.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема