Разработчики нашли способ снять одно из главных ограничений современных LLM.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">DeepSeek показала, что гигантская модель не обязана съедать пропорционально больше быстрой памяти. Компания представила DeepSeek V4.1 Flash, у которой KV-кэш требует лишь четверть HBM по сравнению с V4 Flash. Речь идёт именно о памяти для контекста, а не о четырёхкратном сокращении всей памяти, нужной для весов модели. Для многопользовательских сервисов разница особенно важна.
Основа V4.1 Flash содержит 552 млрд параметров, а отдельная условная память Engram добавляет ещё 196 млрд. Полный набор файлов на Hugging Face достигает примерно 763 млрд параметров с учётом вспомогательных компонентов. При этом модель активирует около 8 млрд параметров при обработке запроса и 16 млрд при генерации ответа, поэтому размер весов и вычислительная нагрузка растут не одинаково.
Главную экономию даёт новая схема Causal Encoder-Decoder. Двадцать слоёв энкодера сначала обрабатывают вход, после чего двадцать слоёв декодера получают общий KV-кэш из итогового состояния энкодера, а не создают отдельные полные копии на каждом уровне. В описании модели DeepSeek указывает размер глобального KV-кэша 890 байт на токен. Такой кэш хранит состояние уже обработанного контекста.
Дополнительно Compressed Sparse Attention 2 переиспользует данные внимания между слоями, а основные записи KV-кэша хранятся в FP4. Постоянный кэш, который приходится переносить на накопители, сократился примерно до одной восьмой от V4 Flash. Такой подход продолжает курс, который DeepSeek уже выбрала в V4, где разработчики тоже сокращали стоимость длинного контекста.
Экономия HBM особенно заметна на фоне дефицита HBM , который усиливает бум ИИ-инфраструктуры. Чем меньше памяти занимает контекст каждого пользователя, тем больше одновременных сессий можно обслуживать на тех же ускорителях. DeepSeek оценивает выигрыш по KV-кэшу примерно в четыре раза относительно V4 Flash и в 437 раз относительно первого поколения.
V4.1 Flash поддерживает контекст до миллиона токенов и умеет работать с текстом и изображениями. Модель уже доступна через API и опубликована с открытыми весами по лицензии MIT. V4 Flash компания уже сняла с API, а с 14 сентября запросы к V4 Pro временно направит на V4.1 Flash до выпуска V4.1 Pro. Новая архитектура рассчитана на дальнейшее масштабирование.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">DeepSeek показала, что гигантская модель не обязана съедать пропорционально больше быстрой памяти. Компания представила DeepSeek V4.1 Flash, у которой KV-кэш требует лишь четверть HBM по сравнению с V4 Flash. Речь идёт именно о памяти для контекста, а не о четырёхкратном сокращении всей памяти, нужной для весов модели. Для многопользовательских сервисов разница особенно важна.
Основа V4.1 Flash содержит 552 млрд параметров, а отдельная условная память Engram добавляет ещё 196 млрд. Полный набор файлов на Hugging Face достигает примерно 763 млрд параметров с учётом вспомогательных компонентов. При этом модель активирует около 8 млрд параметров при обработке запроса и 16 млрд при генерации ответа, поэтому размер весов и вычислительная нагрузка растут не одинаково.
Главную экономию даёт новая схема Causal Encoder-Decoder. Двадцать слоёв энкодера сначала обрабатывают вход, после чего двадцать слоёв декодера получают общий KV-кэш из итогового состояния энкодера, а не создают отдельные полные копии на каждом уровне. В описании модели DeepSeek указывает размер глобального KV-кэша 890 байт на токен. Такой кэш хранит состояние уже обработанного контекста.
Дополнительно Compressed Sparse Attention 2 переиспользует данные внимания между слоями, а основные записи KV-кэша хранятся в FP4. Постоянный кэш, который приходится переносить на накопители, сократился примерно до одной восьмой от V4 Flash. Такой подход продолжает курс, который DeepSeek уже выбрала в V4, где разработчики тоже сокращали стоимость длинного контекста.
Экономия HBM особенно заметна на фоне дефицита HBM , который усиливает бум ИИ-инфраструктуры. Чем меньше памяти занимает контекст каждого пользователя, тем больше одновременных сессий можно обслуживать на тех же ускорителях. DeepSeek оценивает выигрыш по KV-кэшу примерно в четыре раза относительно V4 Flash и в 437 раз относительно первого поколения.
V4.1 Flash поддерживает контекст до миллиона токенов и умеет работать с текстом и изображениями. Модель уже доступна через API и опубликована с открытыми весами по лицензии MIT. V4 Flash компания уже сняла с API, а с 14 сентября запросы к V4 Pro временно направит на V4.1 Flash до выпуска V4.1 Pro. Новая архитектура рассчитана на дальнейшее масштабирование.
- Источник новости
- www.securitylab.ru