DeepSeek 4.1 Flash: 4x Smaller Memory!
54sThe shocking claim of 4x memory reduction with performance surpassing giants grabs attention and sparks curiosity.
▶ Play Clip"Title is accurate—the video does explain the 4x memory reduction, but it's padded with personal anecdotes and a sponsor segment."
DeepSeek has released version 4.1 Flash, a new AI model that boasts impressive speed and performance, even surpassing some competitors in certain tests. The key innovation is a 4x reduction in KV cache size, achieved through a technique called CSA2, which enables shared memory across layers. This makes the model more efficient and potentially cheaper to run, signaling a positive trend for AI accessibility.
DeepSeek 4.1 Flash is described as 'incredibly fast' and can beat Claude Opus 5 and Kim K3 in some tests, but not all.
The model consistently outperforms DeepSeek 4.0 Pro, which is a huge surprise. Running the system locally could cost a quarter of the previous $300,000.
DeepSeek 4.1 Flash has innate visual perception, allowing it to recreate games from images of menus.
The KV cache is 4x smaller than the previous Flash 4.0 version, and 437x smaller than V1 from 3 years ago.
The technique is called CSA2, explained in a free research paper. It involves shared memory across layers, with an encoder creating global memory and a decoder reading from it.
The model has over 500 billion parameters, making it impossible to run at home. The creator uses Lambda for experiments.
The catch is that 4.1 Flash 'likes to think' and consumes many tokens, though it's not too expensive. It can be run for free with the right hardware.
The creator recommends Lambda for reproducing AI research papers, training models, and running inference or text-to-image/video tasks.
DeepSeek 4.1 Flash represents a significant step forward in AI efficiency, with a 4x smaller KV cache and shared memory architecture. This trend towards cheaper, more accessible AI is a positive development for the entire field.
Cost Reduction
Shows a clear trend towards cheaper AI, making it more accessible.
00:29CSA2 Technique
Explains the core innovation behind the memory reduction.
01:45Shared Memory Architecture
Highlights a fundamental shift in how neural networks manage memory.
02:17Open Science
Emphasizes the value of open research in driving progress.
04:28[00:04] Новый DeepSK уже здесь. 4.1 Flash, и это просто потрясающе. Посмотрите-ка. Это невероятно быстро. И меня это тоже потрясло. Послушайте, в некоторых тестах он может превзойти Claude Opus 5
[00:16] Kim K3, но не во всех. Посмотрим, что из этого выйдет. Но есть один нюанс. Я покажу вам в конце. Кроме того, он стабильно превосходит DeepSeek 4.0 0 Pro,
[00:29] что является огромным сюрпризом. То есть, эксплуатация той системы на местном уровне обходится примерно в 300 тысяч долларов, а эта может обойтись в четверть этой суммы . Что ж, это всё ещё большие деньги,
[00:41] но тенденция неоспорима. Через год эти деньги могут оказаться у нас в кармане . Оно также обладает врожденным визуальным восприятием. Таким образом, наконец-то вы можете предоставить ему изображения культового игрового меню, и он напишет игру, которая его воспроизведет.
[00:57] Подробнее о других своих экспериментах я расскажу в конце. И это в конце. И это одновременно и огромное, и маленькое. Как? Что ж, а теперь придержите свои бумаги, уважаемые коллеги- ученые. Он небольшой из-за
[01:11] ученые. Он небольшой из-за кэша KV. Эта версия содержит контекст и в 437 раз меньше, чем версия V1 3 года назад, но также в четыре раза меньше, чем предыдущая версия Flash 4.0. Но это было всего
[01:29] несколько месяцев назад, и вы сжали его в 4 раза, то есть сколько? Как им это удалось? Мы знаем? Да, мы это делаем. Уважаемые коллеги- ученые, это двухминутная статья с участием доктора Эра. Почему? Потому что это открытая модель,
[01:45] и существует бесплатная научная статья, объясняющая её. Я не эксперт, всего лишь студент, но постараюсь объяснить. Они называют эту технику CSA2, и, наконец, они на верном пути. Как видите, нейронная сеть состоит из множества
[02:02] нейронная сеть состоит из множества слоев нейронов, и по мере распространения информации через эти слои каждый из них имеет свою собственную память типа ключ-значение, но здесь это не так. них имеет свою собственную память типа ключ-значение, но здесь это не так. Флэш-память Deepseek 4.1 наконец-то обеспечивает
[02:17] общую память между слоями. Не каждый должен всё помнить. Нет, они разделяют воспоминания. Это невероятно сложно реализовать качественно, потому что для разных слоев требуется разный взгляд на одну и ту же историю. А если заглянуть под капот
[02:34] и присмотреться, то увидим структуру кодировщика-декодера. Кодировщик создает общую глобальную память, а декодер считывает данные из нее.
[02:47] И всё это в конечном итоге приводит к значительному уменьшению размера кэша ключ-значение, что является моей головной болью, поскольку требует слишком много видеопамяти. Невероятный шаг вперед.
[03:00] много видеопамяти. Невероятный шаг вперед. Я также сказал, что это невероятно много — более 500 миллиардов параметров. Поэтому у меня нет ни малейшего шанса запустить это дома. А когда я попытался воспроизвести эту прекрасную бумагу для спирализации меда, GPT6
[03:16] прекрасную бумагу для спирализации меда, GPT6 Astra справилась с задачей на отлично. Просто потрясающе. Opus 5.1 не так впечатляет, но физика в нём довольно впечатляющая. Рендеринг выполняется
[03:28] немного реже. Что касается этого проекта, то нам еще нужно подготовить пару статей, чтобы он соответствовал предыдущему, но это обязательно произойдет. В этом я уверен. И видите ли, я здесь для того, чтобы показать вам правду, а не просто верить заголовкам. Теперь,
[03:43] когда YouTube перестал рекомендовать мои работы по моделированию в физике, что меня очень расстраивает, я хотя бы могу показать вам это, и это наполняет меня радостью. Подпишитесь и нажмите на колокольчик, чтобы увидеть больше. А ещё есть подвох. 4.1 Флэш любит
[03:59] ещё есть подвох. 4.1 Флэш любит много думать и тратит много жетонов. К счастью, это не так уж дорого, но, черт возьми, сколько же это жетонов! Но если у вас есть необходимое оборудование, вы можете запускать всё это бесплатно. Я этого не делаю, поэтому запускаю процесс
[04:13] через API или Lambda. Но учитывая, что каждый раз, когда DeepS публикует новую что каждый раз, когда DeepS публикует новую статью, ИИ становится дешевле для всех нас. Огромное спасибо за этот колоссальный вклад в развитие человечества. Это значительно
[04:28] облегчит работу многих врачей и ученых . Открытая наука — залог успеха. Какое замечательное время, чтобы жить! Я использую Lambda для воспроизведения научных работ по искусственному интеллекту, часто за считанные
[04:40] минуты. Это также отлично подходит для обучения собственных моделей или тонкой настройки существующих. Выполнить логический вывод или преобразовать текст в изображение или видео. Проще простого. Запуск чат-бота простого. Запуск чат-бота или агента Deepseek. Очень быстро, очень надежно.
[04:55] Lambda предоставляет вам мощные графические процессоры NVIDIA для проведения собственных экспериментов. Я проверяю идеи из статей, которые пишу, и через несколько мгновений получаю результаты. Любить это. Серьезно, попробуйте прямо it out now at lambda.ai/papers. EI/ peepers.
⚡ Saved you 0h 05m reading this? Transcribe any YouTube video for free — no signup needed.