norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong10 минут назад

Исследовательская заметка: Фильтрация информации, связанной с саботажем, из данных для предварительной тренировки возможна

Исследование изучает возможность фильтрации информации, связанной с саботажем, из данных для предварительной тренировки больших языковых моделей (LLM). Ученые обучали несколько моделей LLM с 30 млрд параметров с и без фильтрации, обнаружив, что отфильтрованные модели сохраняют общие способности, но значительно уменьшают знания о стратегиях саботажа и защитных мерах.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
21
очков источника
Наблюдаем с5 октября 2026 г.21 очков источника
Темп интереса+5,9/hпо замерам за 1,02 h
Опубликовано5 октября 2026 г.Kyle O’Brien
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

21 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот подход может снизить риск неправильно выровненных ИИ-моделей, ограничив их знания о стратегиях саботажа, но для подтверждения его эффективности в реальных условиях необходимы дополнительные исследования.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема