norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong2 часа назад

Рекуррентная LLM очень легко интерпретируема, но очень трудно направляема

Исследование изучает рекуррентную модель языка Ouro-1.4b-thinking, фокусируясь на её интерпретируемости и управляемости. Оно выявляет, что модель в целом интерпретируема с использованием логит-лайенсов и линейных проб, но управление ею затруднено, если вмешательства применяются не в последней итерации. Это вызывает опасения по поводу возможной несоответствия в рекуррентных моделях. Исследование включает эксперименты по программированию и математике, анализируя остаточные потоки на нескольких слоях.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
8
очков источника
Наблюдаем с24 сентября 2026 г.8 очков источника
Темп интересаНужны повторные замеры
Опубликовано24 сентября 2026 г.nesiacel
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

8 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование подчёркивает потенциальные риски безопасности в рекуррентных моделях языка, подчеркивая сложность их эффективного направления, если вмешательства применяются не в последней итерации, что может быть использовано в несоответствующих системах.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема