norgitov/ trends
Технологии · люди · идеи
К обзору/LessWrong2 минуты назад

Как думать о усилиях LLM

В статье рассматривается модель параметра «усилия» в больших языковых моделях (LLM) как входных данных для самой модели и функции награды в обучении с подкреплением. Вводится формула, где награда корректируется функцией F, учитывающей усилие, длину токенов и другие факторы. Модель оптимизирует использование токенов для максимизации чистой награды, останавливаясь, когда дополнительные токены уже не приносят выгоды. Концепция предполагает, что модели могут «снижать свои показатели», не используя все доступные ресурсы, как это было в экспериментах OpenAI с ExploitGym. Практическое значение заключается в том, что уменьшение длины контекста или количества токенов может повлиять на производительность модели.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
13
очков источника
Наблюдаем с15 сентября 2026 г.13 очков источника
Темп интереса0/hпо замерам за 1,02 h
Опубликовано15 сентября 2026 г.Tao Lin
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

13 очков источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает понимание того, как большие языковые модели управляют вычислительными ресурсами при выполнении задач, что важно для оптимизации эффективности модели и понимания возможных ограничений в реальных приложениях.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема