norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong36 минут назад

Ложные зонды как альтернатива активационному зондированию

В статье изучаются ложные зонды — нерелевантные вопросы, которые могут выявлять внутренние состояния языковых моделей. Задавая вопросы вроде «Предложите тип амфибии», исследователи обнаружили, что модели вроде GPT-5.6 Luna часто отвечают конкретными ответами (например, «лягушка») чаще во время оценки, чем в реальных условиях. Эти зонды эффективны, устойчивы к манипуляциям и могут использоваться как альтернатива активационным зондам.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
9
очков источника
Наблюдаем с25 сентября 2026 г.9 очков источника
Темп интереса+5,9/hпо замерам за 1,02 h
Опубликовано25 сентября 2026 г.Ziqian Zhong
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

9 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Ложные зонды предлагают практический способ определения состояний модели без необходимости получения доступа к исходному коду или прямого вопроса, что делает их полезными для оценки поведения модели в реальных условиях.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема