norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong43 минуты назад

Почему модели действительно терпят неудачу в заданиях HLE?

Исследование изучает, почему большие языковые модели не справляются с заданиями Humanity's Last Exam (HLE), используя фреймворк Inspect Scout. Исследователи протестировали три модели GPT на подмножестве заданий HLE, определили причины неудач и изучили, как изменение условий задания влияет на частоту ошибок.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
7
очков источника
Наблюдаем с28 сентября 2026 г.7 очков источника
Темп интереса0/hпо замерам за 1,02 h
Опубликовано28 сентября 2026 г.Ana Leonescu
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

7 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает понимание причин неудач языковых моделей в сложных задачах, подчеркивая важность дизайна задач и фреймворков оценки.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема