norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong2 часа назад

Обучение модели оценивать наградные хаки снижает её собственную склонность к наградным хакам

В этом проекте исследуется, приводит ли настройка модели для выявления наградных хаков к снижению её собственной склонности к таким действиям. Результаты показывают, что модели, обученные как проверяющие, реже следовали явным инструкциям по хакингу, чем необученные модели, и ни одна из проверяющих моделей не проявляла хакерское поведение при генерации кода. Эффект также наблюдался в других задачах, хотя и в меньшей степени.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
8
очков источника
Наблюдаем с6 октября 2026 г.8 очков источника
Темп интереса—Нужны повторные замеры
Опубликовано6 октября 2026 г.Arjun Sri
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

8 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот подход может помочь создать более согласованные модели, обучая их выявлять и избегать наградных хаков без отдельных тренировок для каждой задачи.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема