norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

Трансформеры прекращают думать слишком рано, и небольшой LoRA это исправляет

Предобученные трансформеры часто не используют всю свою глубину для отслеживания ссылок в контексте, но задачно-обученный LoRA ранга 8 на раннем слое может значительно расширить их вычислительную способность. Эксперименты показывают, что Qwen3-8B и Ouro-1.4B демонстрируют значительные улучшения в обработке длинных цепочек ссылок с минимальными изменениями модели.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
62
голосов источника
Наблюдаем с2 октября 2026 г.62 голосов источника
Темп интереса0/hпо замерам за 3,03 h
Опубликовано29 сентября 2026 г.Zehao Jin, Ruixuan Deng, Junran Wang
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

62 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование показывает, как небольшая модификация модели трансформера может значительно улучшить её способность обрабатывать длинные цепочки ссылок, что указывает на то, что стандартные выходные данные моделей могут недооценивать вычислительный потенциал, достижимый через целевые изменения.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема