norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrongтолько что

Почему я боюсь RL

Автор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
19
очков источника
Наблюдаем с23 сентября 2026 г.19 очков источника
Темп интереса+1,94/hпо замерам за 1,03 h
Опубликовано23 сентября 2026 г.owencb
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

19 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот текст предлагает критический взгляд на обучение с подкреплением, подчеркивая потенциальные риски и предлагая способы их устранения, что может быть полезно для исследователей и специалистов в области безопасности ИИ.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема