---
title: 'DeepSeek Just Made AI Memory 4x Smaller!'
source: 'https://youtube.com/watch?v=vIHw_2VjSUw'
video_id: 'vIHw_2VjSUw'
date: 2026-09-18
duration_sec: 310
channel: 'Two Minute Papers'
---

# DeepSeek Just Made AI Memory 4x Smaller!

> Source: [DeepSeek Just Made AI Memory 4x Smaller!](https://youtube.com/watch?v=vIHw_2VjSUw)

## Summary

DeepSeek has released version 4.1 Flash, a new AI model that boasts impressive speed and performance, even surpassing some competitors in certain tests. The key innovation is a 4x reduction in KV cache size, achieved through a technique called CSA2, which enables shared memory across layers. This makes the model more efficient and potentially cheaper to run, signaling a positive trend for AI accessibility.

### Key Points

- **New Model Introduction** [00:04] — DeepSeek 4.1 Flash is described as 'incredibly fast' and can beat Claude Opus 5 and Kim K3 in some tests, but not all.
- **Performance and Cost** [00:29] — The model consistently outperforms DeepSeek 4.0 Pro, which is a huge surprise. Running the system locally could cost a quarter of the previous $300,000.
- **Visual Capabilities** [00:41] — DeepSeek 4.1 Flash has innate visual perception, allowing it to recreate games from images of menus.
- **KV Cache Reduction** [01:11] — The KV cache is 4x smaller than the previous Flash 4.0 version, and 437x smaller than V1 from 3 years ago.
- **CSA2 Technique** [01:45] — The technique is called CSA2, explained in a free research paper. It involves shared memory across layers, with an encoder creating global memory and a decoder reading from it.
- **Model Size and Usage** [03:00] — The model has over 500 billion parameters, making it impossible to run at home. The creator uses Lambda for experiments.
- **Token Usage Catch** [03:59] — The catch is that 4.1 Flash 'likes to think' and consumes many tokens, though it's not too expensive. It can be run for free with the right hardware.
- **Lambda Recommendation** [04:40] — The creator recommends Lambda for reproducing AI research papers, training models, and running inference or text-to-image/video tasks.

### Conclusion

DeepSeek 4.1 Flash represents a significant step forward in AI efficiency, with a 4x smaller KV cache and shared memory architecture. This trend towards cheaper, more accessible AI is a positive development for the entire field.

## Transcript

Новый DeepSK уже здесь.  4.1 Flash, и это просто потрясающе.  Посмотрите-ка.  Это невероятно быстро.  И меня это тоже потрясло. Послушайте, в некоторых тестах он может превзойти Claude Opus 5
Kim K3, но не во всех. Посмотрим, что из этого выйдет.  Но есть один нюанс.  Я покажу вам в конце.  Кроме того, он стабильно превосходит DeepSeek 4.0 0 Pro,
что является огромным сюрпризом.  То есть, эксплуатация той системы на местном уровне обходится примерно в 300 тысяч долларов, а эта может обойтись в четверть этой суммы .  Что ж, это всё ещё большие деньги,
но тенденция неоспорима.  Через год эти деньги могут оказаться у нас в кармане .  Оно также обладает врожденным визуальным восприятием.  Таким образом, наконец-то вы можете предоставить ему изображения культового игрового меню, и он напишет игру, которая его воспроизведет.
Подробнее о других своих экспериментах я расскажу в конце.  И это в конце.  И это одновременно и огромное, и маленькое.  Как?  Что ж, а теперь придержите свои бумаги, уважаемые коллеги- ученые.  Он небольшой из-за
ученые.  Он небольшой из-за кэша KV.  Эта версия содержит контекст и в 437 раз меньше, чем версия V1 3 года назад, но также в четыре раза меньше, чем предыдущая версия Flash 4.0.  Но это было всего
несколько месяцев назад, и вы сжали его в 4 раза, то есть сколько?  Как им это удалось? Мы знаем?  Да, мы это делаем.  Уважаемые коллеги- ученые, это двухминутная статья с участием доктора Эра. Почему?  Потому что это открытая модель,
и существует бесплатная научная статья, объясняющая её.  Я не эксперт, всего лишь студент, но постараюсь объяснить. Они называют эту технику CSA2, и, наконец, они на верном пути.  Как видите, нейронная сеть состоит из множества
нейронная сеть состоит из множества слоев нейронов, и по мере распространения информации через эти слои каждый из них имеет свою собственную память типа ключ-значение, но здесь это не так. них имеет свою собственную память типа ключ-значение, но здесь это не так. Флэш-память Deepseek 4.1 наконец-то обеспечивает
общую память между слоями.  Не каждый должен всё помнить.  Нет, они разделяют воспоминания.  Это невероятно сложно реализовать качественно, потому что для разных слоев требуется разный взгляд на одну и ту же историю.  А если заглянуть под капот
и присмотреться, то увидим структуру кодировщика-декодера. Кодировщик создает общую глобальную память, а декодер считывает данные из нее.
И всё это в конечном итоге приводит к значительному уменьшению размера кэша ключ-значение, что является моей головной болью, поскольку требует слишком много видеопамяти.  Невероятный шаг вперед.
много видеопамяти.  Невероятный шаг вперед. Я также сказал, что это невероятно много — более 500 миллиардов параметров.  Поэтому у меня нет ни малейшего шанса запустить это дома. А когда я попытался воспроизвести эту прекрасную бумагу для спирализации меда, GPT6
прекрасную бумагу для спирализации меда, GPT6 Astra справилась с задачей на отлично.  Просто потрясающе. Opus 5.1 не так впечатляет, но физика в нём довольно впечатляющая.  Рендеринг выполняется
немного реже.  Что касается этого проекта, то нам еще нужно подготовить пару статей, чтобы он соответствовал предыдущему, но это обязательно произойдет.  В этом я уверен.  И видите ли, я здесь для того, чтобы показать вам правду, а не просто верить заголовкам.  Теперь,
когда YouTube перестал рекомендовать мои работы по моделированию в физике, что меня очень расстраивает, я хотя бы могу показать вам это, и это наполняет меня радостью. Подпишитесь и нажмите на колокольчик, чтобы увидеть больше.   А ещё есть подвох.  4.1 Флэш любит
ещё есть подвох.  4.1 Флэш любит много думать и тратит много жетонов. К счастью, это не так уж дорого, но, черт возьми, сколько же это жетонов!  Но если у вас есть необходимое оборудование, вы можете запускать всё это бесплатно.  Я этого не делаю, поэтому запускаю процесс
через API или Lambda.  Но учитывая, что каждый раз, когда DeepS публикует новую что каждый раз, когда DeepS публикует новую статью, ИИ становится дешевле для всех нас. Огромное спасибо за этот колоссальный вклад в развитие человечества.  Это значительно
облегчит работу многих врачей и ученых .  Открытая наука — залог успеха. Какое замечательное время, чтобы жить!  Я использую Lambda для воспроизведения научных работ по искусственному интеллекту, часто за считанные
минуты.  Это также отлично подходит для обучения собственных моделей или тонкой настройки существующих. Выполнить логический вывод или преобразовать текст в изображение или видео.   Проще простого.  Запуск чат-бота простого.  Запуск чат-бота или агента Deepseek.  Очень быстро, очень надежно.
Lambda предоставляет вам мощные графические процессоры NVIDIA для проведения собственных экспериментов.  Я проверяю идеи из статей, которые пишу, и через несколько мгновений получаю результаты.  Любить это.  Серьезно, попробуйте прямо it out now at lambda.ai/papers. EI/ peepers.
