norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

Flash-dLLM: ИО-ориентированное кэширование ключевых значений и параллельное декодирование для быстрых и эффективных по памяти диффузионных моделей языка

В статье представлено Flash-dLLM, фреймворк для ускорения диффузионных больших языковых моделей (dLLM), устраняющий бутылочные горлышки I/O в кэшировании ключевых значений (KV) и обеспечивающий эффективное параллельное декодирование. Предложена I/O-ориентированная сжатая ячейка кэша KV и стратегия декодирования с черновиком и проверкой, где сама dLLM используется для обоих задач, повышая скорость и эффективность памяти.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
3
голосов источника
Наблюдаем с23 сентября 2026 г.3 голосов источника
Темп интересаНужны повторные замеры
Опубликовано22 сентября 2026 г.Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

3 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Flash-dLLM повышает скорость инференса и эффективность памяти для диффузионных моделей языка, оптимизируя I/O в кэшировании ключевых значений и обеспечивая параллельное декодирование без дополнительных моделей.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема