norgitov/ trends
Технологии · люди · идеи
К обзору/Daily Papers2 часа назад

DeepSeek-V4.1-Flash: Пробивая границы сжатия кэша KV

DeepSeek-V4.1-Flash — мультимодельная модель Mixture-of-Experts (MoE) с 552 млрд параметров, разработанная для улучшения сжатия кэша KV и снижения вычислительных затрат для задач с длинными контекстами. Она использует архитектуру Causal Encoder-Decoder и оптимизации, такие как повторное использование кэша KV на уровне слоев и кэширование FP4, чтобы значительно снизить использование памяти и пропускной способности по сравнению с предыдущими версиями.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
13
голосов источника
Наблюдаем с18 сентября 2026 г.13 голосов источника
Темп интересаНужны повторные замеры
Опубликовано17 сентября 2026 г.DeepSeek-AI, Anyi Xu, B. Li
ЗА ЦИФРАМИ

Как меняется интерес

История начинает расти

График появится после повторных замеров. Текущий показатель уже получен из источника.

13 голосов источника

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Эта модель предназначена для снижения использования памяти и пропускной способности для задач с длинными контекстами, делая её более экономичной для развертывания.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема