Gemma 4: Run Powerful AI on Your Phone — Full Breakdown & Transcript

Google Just Destroyed All Open-Source Models (Gemma 4)

0h 23m video Published Apr 3, 2026 Transcribed Sep 3, 2026 David Ondrej David Ondrej
93.7K views 1.9× channel baseline Recent velocity 0.6 views/hour View full performance history →
Intermediate 12 min read For: Tech enthusiasts, developers, and AI users interested in running open-source models locally on their own hardware.
AI Trust Score 65/100
⚠️ Average / Some Fluff

"The title overpromises with 'destroyed' but the content delivers substantial value on Gemma 4's capabilities and setup."

AI Summary

The video introduces Google's Gemma 4, a new open-source AI model family that delivers impressive performance despite its compact size, capable of running locally on laptops and even smartphones. It highlights the benefits of local AI models—free, unlimited, and private—and positions them as a disruptive force against commercial AI services. The video also covers practical setup instructions for running Gemma 4 on various devices and integrating it with AI agents.

[00:02]
Gemma 4 Introduction

Google releases Gemma 4, an open-source model with powerful capabilities that can run on phones, potentially saving users money on ChatGPT subscriptions.

[00:15]
Benefits of Local AI Models

Local models are free, have no request limits, and ensure 100% privacy. The video suggests that big AI companies want users to ignore local models to protect their business models.

[00:43]
Gemma 4 Performance

Gemma 4 outperforms models nearly 30 times larger, matching the performance of Kim K 2.5 (1.1 trillion parameters) despite having only 31 and 26 billion parameters.

[01:22]
Multimodal Capabilities

Gemma models are multimodal, handling audio, images, and video. An example shows a developer building an image classifier in a few hours.

[02:03]
Supabase Sponsor Segment

Supabase provides MCP out of the box, allowing AI tools to interact directly with Postgres databases via a single connection string, solving the data access problem for AI agents.

[03:08]
Gemma 4 Improvements

Gemma 4 shows significant improvements over Gemma 3 in writing, instruction following, multi-step text, math, and software, described as the biggest open-source improvement since DeepSeek.

[03:37]
Four Versions of Gemma 4

Google provides a dense model (41B) and a mixture-of-experts (sparse) model. The smaller versions (E2B, E4B) are for laptops and phones.

[04:05]
Dense vs. Mixture of Experts

Dense models activate all parameters constantly, while mixture-of-experts models activate only relevant experts, making them faster and more efficient.

[05:08]
Benchmark Ranking

The dense 31B model ranks third among all open-source models on the Arena benchmark, surpassing even 700B parameter models.

[05:22]
Setup Methods

Three main ways to run Gemma 4: Ollama (easy), LM Studio (convenient), and llama.cpp (fastest). The video demonstrates using Ollama.

[06:30]
Installing Ollama

Install Ollama with a single command in the terminal. The video encourages users to overcome fear of the terminal.

[07:10]
Hardware Requirements

Running larger models requires at least 24GB VRAM on Nvidia GPUs or unified memory on Apple Silicon Macs. RAM is shared between CPU and GPU on Macs.

[07:54]
Running on Phones

Gemma 4 models (E2B, E4B) can run on smartphones, demonstrated on an iPhone. The Google AI Edge Gallery app allows local execution.

[09:39]
Using Ollama Desktop App

Ollama has a desktop app for a more user-friendly chat interface, similar to ChatGPT.

[10:58]
Implications for AI Industry

Running powerful models locally threatens the business model of commercial AI providers like OpenAI.

[13:47]
Limitations and Use Cases

Gemma 4 is sufficient for most questions, but top-tier models like Opus 4.6 and GPT 5.4 are still better for advanced programming and math.

[14:18]
Web Development Capabilities

Gemma 4 can generate web components and UI designs, with the 26B and 31B models performing well in tests.

[16:43]
Community Support

Prince Kanuma added MLX support within 12 hours of release, improving performance on Apple Silicon.

[17:34]
Setting Up Hermes Agent

Steps to integrate Gemma 4 with the Hermes agent: run Ollama, install Hermes via curl, and configure the custom endpoint to localhost:11434/v1.

[20:12]
Hermes Agent Performance

Gemma 4 31B runs as a local agent with a 260k context window, but is slow due to preloaded prompts. PiDev is suggested as a more minimal alternative.

Gemma 4 represents a major leap in open-source AI, making high-performance models accessible on consumer hardware. The video provides practical guidance for running these models locally, highlighting their potential to disrupt the AI industry and empower users with privacy and cost savings.

Mentioned in this Video

Tutorial Checklist

1 06:30 Open a terminal and install Ollama using the one-line command from ollama.com.
2 08:08 Run 'ollama run gemma4:31b' (or appropriate model name) to download and start the model.
3 11:44 For phones, download 'Google AI Edge Gallery' from the App Store or Play Store.
4 12:08 In the app, select the Gemma 4 model (E2B or E4B) and download it, then start chatting.
5 17:34 To use with Hermes agent, run 'ollama serve' in the terminal.
6 18:02 Install Hermes agent using the curl command from its GitHub page.
7 19:16 Configure Hermes to use a custom endpoint: localhost:11434/v1, and select the Gemma 4 model.

Study Flashcards (10)

What is Gemma 4?

easy Click to reveal answer

A new open-source AI model family by Google, available in dense and mixture-of-experts variants.

00:02

What are the benefits of local AI models?

easy Click to reveal answer

Free, unlimited requests, and 100% privacy.

00:15

How does Gemma 4 compare to larger models?

medium Click to reveal answer

It outperforms models nearly 30 times larger, matching Kim K 2.5 (1.1 trillion parameters) with only 31B and 26B parameters.

01:08

What is the difference between dense and mixture-of-experts models?

medium Click to reveal answer

Dense models activate all parameters, while mixture-of-experts activate only relevant experts, making them faster and more efficient.

04:05

What are the three main ways to run Gemma 4 locally?

easy Click to reveal answer

Ollama, LM Studio, and llama.cpp.

05:22

What is the command to install Ollama?

medium Click to reveal answer

A one-line command from ollama.com, typically 'curl -fsSL https://ollama.com/install.sh | sh'.

05:49

What hardware is needed to run the largest Gemma 4 model?

medium Click to reveal answer

At least 24GB VRAM on Nvidia GPUs or unified memory on Apple Silicon Macs.

07:10

How can you run Gemma 4 on a smartphone?

easy Click to reveal answer

Using the Google AI Edge Gallery app, available on iOS and Android.

11:44

What is the custom endpoint for connecting Hermes to Ollama?

hard Click to reveal answer

localhost:11434/v1

19:29

What is the context window size for Gemma 4 31B in Hermes?

medium Click to reveal answer

260,000 tokens.

20:12

💡 Key Takeaways

💡

Local AI models are free and private

Highlights the core value proposition of local models, challenging the subscription model of commercial AI.

00:15
📊

Gemma 4 outperforms models 30x larger

Demonstrates the efficiency of the model architecture, making high-end AI accessible on consumer hardware.

01:08
🔧

Dense vs. mixture-of-experts explained

Clarifies a key technical distinction that affects performance and hardware requirements.

04:05
📊

31B model ranks third in open-source benchmark

Shows that small models can compete with much larger ones, a significant milestone for open-source AI.

05:08
💡

Local models threaten commercial AI business models

Highlights the disruptive potential of local AI, which could reshape the industry.

10:58

[00:02] выпуском Gemma 4, новой модели с открытым исходным кодом, обладающей невероятной мощностью. Но самое удивительное, что она может работать даже на вашем телефоне. И на самом деле, Gemma 4 может сэкономить вам сотни долларов, потому что вам больше не нужно

[00:15] платить за ChatGPT. Дело в том, что прелесть локальных моделей ИИ заключается в их полной бесплатности, отсутствии ограничений по количеству запросов и 100% конфиденциальности. И в этом заключается негласный секрет индустрии искусственного интеллекта. Крупнейшие компании, занимающиеся искусственным интеллектом, хотят, чтобы вы игнорировали

[00:30] локальные модели. Потому что если вы можете запускать ИИ на своем ноутбуке, их бизнес-модель рухнет. Во-первых, что вообще такое « Джемма 4»? Это новая модель с открытым исходным кодом, созданная Google, которая просто невероятна, учитывая её компактные размеры. Мы

[00:43] вступаем в эпоху, когда функциональные модели искусственного интеллекта больше не являются платными, а могут работать на устройствах, которые у вас уже есть. И достаточно взглянуть на рост популярности локальных моделей искусственного интеллекта за последние 5 лет. Да, можно с

[00:56] уверенностью сказать, что если вы не запускаете модели ИИ локально, вы отстаёте. Теперь давайте подробнее рассмотрим Gemma 4, потому что, каким-то образом, Google просто превзошла все ожидания с этой моделью. Она превосходит модели, которые почти в 30 раз

[01:08] больше. Повторю ещё раз. Модель Gemma 4, несмотря на то, что содержит всего 31 и 26 миллиардов параметров, находится на одном уровне с моделью Kim K 2.5, имеющей 1,1 триллиона параметров. Но это еще не все: в лучших традициях Google, модели Gemma

[01:22] являются мультимодальными, а это значит, что они отлично справляются с обработкой аудио, изображений и видеосигналов . Например, этот парень очень быстро, буквально за пару часов, разработал классификатор изображений. Здесь вы можете увидеть, что это Джемма. Думаю, это

[01:35] маленькая. Итак, существует четыре версии, но об этом позже. И распознает объекты, но и записывает описание практически в реальном времени, потому что это очень маленькая модель того, что он держит в руках, что он делает на экране.

[01:48] хорошо справляются с мультимодальными задачами. А чуть позже я покажу вам, как установить и запустить Gemma 4 как на ноутбуке, так и на телефоне. Но сначала, если вы используете модели с открытым исходным кодом, вам также понадобится база данных с открытым исходным кодом.

[02:03] И вот тут на помощь приходит Supabase. Самая большая проблема с ИИ-агентами сейчас заключается не в самом ИИ, а в предоставлении им доступа к реальным данным. Видите, вы можете создать работающего агента всего за 20 минут. Но как только возникает необходимость прочитать базу данных,

[02:15] записать данные в таблицу или проверить, кто вошел в систему, вы снова возвращаетесь к настройке API, управлению учетными данными и написанию связующего кода, не имеющего никакого отношения к самому продукту. К счастью, Supabase это исправляет. Они поставляют MCP прямо из коробки,

[02:28] а это значит, что ваши инструменты искусственного интеллекта, будь то Cursor, Cloud Code, Codex или что-либо еще, что вы используете, могут напрямую взаимодействовать с базой данных Postgres через единую строку подключения. Но вот что делает его невероятно мощным инструментом для

[02:40] создателей агентов. Ваши эмбеддинги, ваши данные, ваши настройки, ваше файловое хранилище — всё это находится в одном экземпляре PostgreSQL. Таким образом, когда вашему агенту необходимо выполнить векторный поиск сходства между документами пользователей, он обращается не к трем отдельным

[02:53] создаёте агентов искусственного интеллекта или системы автоматизации на Python, Supabase — это незаменимый инструмент. У них очень легко настроить. Это займет всего несколько минут, и вы можете попробовать это видео, и спасибо компании Supabase за спонсорство этого видео. Итак,

[03:08] вернемся к Джемме 4. Посмотрите на улучшения во всех областях, не так ли? письмо, следование инструкциям, многоэтапный текст, математика, программное обеспечение. Это скачок, который совершила Gemma 4, синяя версия, по сравнению с Gemma 3,

[03:23] прошлогодней моделью с открытым исходным кодом от Google. Излишне говорить, что это огромное, возможно, даже самое значительное улучшение в области открытого исходного кода со времен выхода DeepSeek. Google предоставил нам как плотную модель, которая является самой большой, с 41

[03:37] миллиардом параметров, так и модель, основанную на смеси экспертов, которая является разреженной. Итак, вот четыре разных версии Джеммы. Это самые маленькие. E2B означает эффективные параметры. В основном, эти два предназначены для

[03:51] ваш ноутбук не совсем уж плохой, тогда вам, вероятно, тоже придётся запускать эти программы а эта — смешанной моделью, созданной на основе экспертных оценок. А вот что это на самом деле означает, верно? Плотная модель означает, что все параметры, то есть все 31 миллиард,

[04:05] активны постоянно. Это гораздо более простая архитектура с гораздо что его эксплуатация обходится дорого. С другой стороны, сочетание экспертов, которое за последние 2 года, представляет собой минималистичную архитектуру. Обе они представляют собой

[04:18] трансформаторную архитектуру, но они либо разреженные, либо плотные. В этом и заключается разница в активации параметров, верно? Таким образом, огромное количество параметров, которое, опять же, представляет собой смесь экспертных моделей, модель 26B,

[04:30] активируется не все одновременно. Таким образом, хотя они и похожи по параметрам, они не похожи по скорости. 31B будет намного медленнее, чем 26B, потому что это смесь экспертов, а это значит, что не все

[04:42] 26 миллиардов параметров активны на каждом этапе. Так что, если вы спросите о программировании, это может активировать эксперта по программированию и эксперта по математике, но не активирует эксперта по английскому языку. Таким образом, если у вас всего около 16 ГБ

[04:56] оперативной или видеопамяти, вы, вероятно, сможете запустить 26-битную версию для экспертов, но точно не сможете запустить 31-битную. А вот наглядная визуализация того, как это работы модели, когда генерируются токены . И что поразительно, так это то, что

[05:08] плотная модель с 31 миллиардом параметров занимает третье место в бенчмарке Arena среди всех моделей с открытым исходным кодом. Таким образом, она превосходит даже модели с 700 миллиардами параметров, что просто неслыханно в мире моделей с открытым исходным кодом. Итак

[05:22] , как же правильно настроить Gemma 4, чтобы она работала на вашем ноутбуке или ноутбука, и есть три основных способа это сделать, верно? Итак, у нас есть Ollama, у нас есть LM Studio и у нас есть llama.cpp. Ollama работает медленнее, чем

[05:37] llama.cpp. Поэтому, если вам нужна максимальная производительность, выбирайте этот вариант. Если вам важны удобство и простота, выбирайте Ollama. Если у вас уже установлена ​​LM Studio , то используйте LM Studio, верно? Таким образом, неправильного выбора не существует. Я

[05:49] покажу вам, как играть в "Оламу", потому что это очень просто. Итак, просто зайдите на ollama.com, и вот команда установки в одну строку. Понял, открой терминал, введи команду в терминале, и готово. В поиск Spotlight. Если вы используете Windows, Linux или какую-либо другую

[06:02] малоизвестную операционную систему и не знаете, как открыть терминал, я открою вам один малоизвестный секрет. Просто спросите ИИ. Как открыть терминал в системе Windows 95? Бум. Любая проблема, любой вопрос, любая

[06:16] трудность — обратитесь к одной из передовых моделей искусственного интеллекта . Только не застрянь, ладно? и боятся терминала без всякой причины. Это самый простой способ взаимодействия с компьютером. Итак, откройте терминал, хорошо? Прекратите искать оправдания.

[06:30] Скопируйте эту команду в одну строку и вставьте её . Готово. Да, установить Ollama так просто . Всё очень просто. Это можно сделать, даже если вы не разработчик. Перестаньте бояться терминала. Далее нам нужно вернуться на сайт Ollama,

[06:43] и в верхнем левом углу мы увидим раздел с моделями. И здесь, как мы уже видим, Gemma 4 находится на вершине списка, но здесь представлены они поддерживают. Если Gemma 4 не отображается у вас вверху списка, просто введите Gemma

[06:56] вверху, и, как вы понимаете, система отфильтрует результаты, оставив только модели Gemma. Очевидно, нам нужна прокрутить вниз, можно увидеть разные размеры, верно? Итак, Google выпустил четыре разных размера. И опять же, это зависит от вашего компьютера.

[07:10] Для запуска таких больших игр вам потребуется как минимум 24 ГБ видеопамяти. Если у вас видеокарта Nvidia или вы не используете Mac. Если вы используете Mac OS с процессорами Apple Silicon, то есть M1, M2, M3, вас общая оперативная память. Итак, я покажу

[07:26] по сути, ваша оперативная память распределяется между центральным и графическим процессорами, что является огромным вас компьютер под управлением Windows и вы используете видеокарту Nvidia, то объем оперативной памяти не имеет значения. Главное — это видеопамять видеокарты, верно? Итак, еще раз, укажите

[07:41] свои характеристики, я снова открою вам секрет: введите свои характеристики в мощный чат-бот с искусственным интеллектом, укажите, какую систему вы используете, и спросите, какие из этих моделей вы можете запустить. Но прелесть Gemma в том, что вы можете

[07:54] они буквально работают на моем iPhone, и я покажу вам это через несколько минут. Но сначала давайте настроим ноутбук. Итак, прокрутите вверх, и вы увидите, что Ollama использует Gemma 4. Это установка для общего использования. Но если

[08:08] например, у вас есть компьютер, и вы хотите запустить самую большую версию Gemma, просто скопируйте терминал. Давайте очистим терминал, Давайте очистим терминал, затем наберем Ollama, пропустим клавишу пробела,

[08:21] вставим название модели и нажмем Enter. Бум. Вот и все. Всего две команды в терминале, и у нас есть всё необходимое. И это запустит установку и загрузку данной модели. У меня этого не произошло,

[08:33] верно? Итак, если хотите посмотреть, давайте попрощаемся . Чтобы проверить, скачали ли вы модель или использовали ли вы Ollama ранее, просто введите команду Ollama list, и она выведет список

[08:46] всех моделей, которые вы скачали с помощью Ollama. Итак, я собираюсь пройти уровень «Clean», и я снова пройду уровень « плотная модель, самая большая из них. И как только загрузка завершится, что займет,

[09:00] знаете ли, 5, 10, 15 минут, в зависимости от вашего интернет-соединения, вы увидите, что сделать «эй», и вы можете начать общаться с моделью, полностью загруженной на мой MacBook. Смотрите, это довольно быстро. Думаю, это

[09:12] 40-50 токенов в секунду, и на моём MacBook всё загружено. И это находится на том же уровне интеллекта, что и Kimiko 2.5, то есть на уровне 1,1 триллиона параметров. Ребята, подумайте об этом. GPT-4

[09:27] была первой моделью, официально превысившей 1 триллион параметров, и всего 2,5 года назад это была лучшая модель в мире. И теперь мы запускаем их на своих ноутбуках. Мы действительно живём в будущем, ребята.

[09:39] использовать терминал. Хорошо, теперь вы можете ввести "пока". У Ollama также есть настольное приложение, так что, если вы введете Ollama, вы сможете открыть настольное приложение и предустановок для агентов ИИ. Скопируйте команду и запустите её в терминале. Итак,

[09:52] Ollama запускает облачную платформу. Вы можете использовать Ollama для управления всеми новейшими агентами ИИ, или же левом углу, чтобы отправить сообщение сюда, и вы увидите различные модели. Итак, приступим к Джемме 31Б. Вот и всё. А это,

[10:06] знаете ли, немного более удобный интерфейс. У вас происходит настоящий чат. Таким образом, если вы хотите использовать что-то похожее на ChatGPT, вам не обязательно как это сделал я, как любое другое приложение. Оллама. Бум. Вот оно. И мы можем

[10:19] начать беседу. Перечислите 10 величайших философов всех времен. И, кстати, философов всех времен. И, кстати, хороша эта модель. На самом деле, она обладает огромными знаниями, учитывая, что у неё всего 31 миллиард

[10:34] параметров. Как видите, это модель рассуждений, то есть она думает, прежде чем дать рассуждения в течение 4 или 5 секунд, а теперь в них перечисляются 10 величайших философов с классическим предупреждением магистра права о том, что

[10:46] невозможно узнать, кто из них величайший. И да, я не собираюсь ждать, пока это закончится, потому что я также записываю в 4K, и MacBook, ребята. Именно этого опасается OpenAI.

[10:58] Вы просто платите пару тысяч долларов за мощный компьютер, и вам больше никогда . Итак, теперь, когда вы знаете, как запустить Gemma 4 на ноутбуке, давайте поговорим о телефоне. Итак, в этих моделях, как уже говорилось, E2B и E4B означают «эффективный».

[11:15] 4 миллиарда. Думаю, обе программы предназначены для специалистов разного уровня, но они работают даже на телефоне. Если же у вас смартфон десятилетней давности, то, вероятно, нет. Но если у вас есть приличный телефон, которому 1, 2 или 3 года , вы, безусловно, сможете

[11:29] запустить эти приложения, и я покажу вам, как это сделать как на Android, так и на iOS. Итак, просто то приложение, которое вам нужно, и, повторюсь, оно доступно как в Google Play Store, так и в Apple App Store. На самом деле, позвольте мне начать запись экрана моего телефона. В

[11:44] App Store или Google Play введите Google AI Edge Gallery, и это будет значок, верно? Это должно выглядеть так или выглядит вот так. Надеюсь, я смогу записать экран своего телефона и скачать это. Это совершенно бесплатно. Это

[11:56] официальное приложение от Google. Затем нажмите « Открыть», и откроется файл. Вы увидите, что вверху уже написано «Попробуйте Gemma 4 сегодня» Таким образом, это позволяет запускать модели локально на вашем

[12:08] телефоне. Итак, кликните на кнопку «Чат с ИИ», и вы увидите четыре осторожны, потому что в двух нижних образцах нет Джеммы. Итак, это не те четыре «четырехкратные Джеммы». Два нижних образца, относящиеся к старшему поколению, не содержат Джеммы. Поэтому

[12:21] вам точно не стоит запускать эти программы, потому что они гораздо менее мощные. Вам следует обратить внимание на два верхних варианта. Верхний файл имеет размер 2,5 ГБ. Это размер на диске, это версия E2B, а более крупная — E4B, которую я бы рекомендовал, если она у вас есть,

[12:36] и эта версия занимает 3,6 ГБ. Таким образом, это займет определенное место в памяти вашего телефона. Но если вы его скачаете, что опять же займет пару минут нажать эту синюю кнопку и начать чат. Вверху написано «

[12:50] в память, и теперь они загружены, и я могу сказать: "Эй". видите, это произошло быстро. Это совсем неплохо, хорошо? Скажите: «Объясните,

[13:02] как примерно 40 токенов в секунду. Всё работает на моём iPhone. У меня iPhone 16 поколение. И это вполне пригодно для использования. Если вы находитесь в

[13:18] лесу и получили травму, сломали ногу, у вас нет может спасти вам жизнь. Итак, все вы, зайдите в галерею Google AI Edge причин этого не делать. Это совершенно бесплатно, и вы можете запустить это на

[13:33] И ещё раз, все эти данные остаются конфиденциальными на вашем компьютере. Вы же не Сэму Альтману, Дарио Амодеи или Марку Цукербергу это отправите. Это приложение установлено локально на вашем телефоне и может ответить на большинство вопросов так же хорошо, как и ChatGPT.

[13:47] Очевидно, что если вы хотите довести возможности до предела в программировании, математике или решении задач, то да, Opus 4.6 и GPT 5.4 — эти лучшие модели с многотриллионными параметрами — всё равно будут лучше. Но для большинства вопросов этого вполне

[14:03] не понадобилось бы. Прежде чем я покажу вам, как запустить Gemma 4 внутри агента Hermes, чтобы у вас был сверхмощный агент, работающий локально на вашем компьютере, я хочу показать вам два твита. Во-первых, от Стива Вайба или STV Vibe. Итак,

[14:18] вызовом инструментов, но как насчет веб-программирования? Потому что люди опять же думают: Насколько они полезны при программировании? Ну, посмотрите сами, хорошо? Итак, вот Вверху представлены эталонные

[14:32] изображения, а внизу — результат работы Gemma 4. И слева — снова 26 миллиардов результатов, полученных от разных экспертов. Справа —

[14:44] они воспроизводят модель, и, кстати, в правом верхнем углу — модель E4B. Вот тест, который я только что запустил на своем телефоне. Посмотрите, как точно они воспроизводят эталонное изображение.

[14:56] экспертов, и вы можете видеть, хорошо, давайте я сделаю паузу. Итак, 26B и 31B, обе отлично справились. E4B, ну, вы понимаете, это попытка. Это попытка. Но, повторюсь, эту модель можно

[15:09] запустить локально на вашем телефоне. И, очевидно, я бы сказал, что 31B лучше, свечение и всё такое, но обе модели действительно хороши, понятно? Итак, давайте рассмотрим следующий пункт. Это эталонное изображение обзора, которое

[15:21] может быть на любом веб-сайте. Итак, хорошо, E4B, построенный первым, не совсем соответствует нем отсутствуют некоторые элементы дизайна, но этот вполне пригоден для использования. телефон. У вас есть модель, которую вы можете запустить на своем телефоне, и которая генерирует полезные веб-

[15:37] компоненты. Безумный. Но давайте рассмотрим модели 26B и 31B. Итак, уже 26B. Хорошо, оба варианта намного лучше. Я бы сказал, что 26B здесь лучше из-за межбуквенного расстояния, но оба варианта в целом удачно подобраны

[15:49] . Создается впечатление, что это больше похоже на рукописный текст. Да, оба варианта гораздо ближе к оригиналу, но всё же 26B выигрывает. Да, вы можете смело использовать эти модели для написания кода локально. Например, если

[16:02] интернет, и вы хотите продолжить разработку своего приложения, вы можете подключить его к Cursor, к Open Code, к Hermes Agent и продолжать разработку, в то время как другие просто будут тратить время, например, на просмотр чертовой информационно-развлекательной системы в

[16:15] самолете. А это страница с ценами, и вы можете видеть, что E4B здесь предлагает довольно выгодные условия. Конечно, это не совсем соответствует оригиналу, но в целом В некоторых A/B-тестах это может даже превзойти результаты более крупных тестов. Gemma 4 — компания, обладающая

[16:28] превзойти результаты более крупных тестов. Gemma 4 — компания, обладающая исключительными способностями в разработке пользовательских интерфейсов и веб-сайтов, особенно учитывая её размер. Повторюсь, это самое главное. Эти модели содержат ребята, и при этом демонстрируют производительность на уровне 700 или 1 триллиона параметров.

[16:43] Например, 1 триллион параметров. Я просто не могу передать словами, насколько это невероятно. Следующее, что я хочу вам показать, это вот этот парень, принц Канума. Он отлично приготовил, и, кажется, через 24 часа блюдо было готово, а то и через 12 часов.

[16:55] В течение 12 часов после выхода Gemma 4 он добавил поддержку MLX, благодаря чему игра стала эффективнее работать на процессорах M, то есть на процессорах Apple Silicon. А вот он из Польши, из Кракова. Вы можете увидеть Краков,

[17:09] напомнило мне о том, что я собираюсь построить офис в Катовице. Итак, если вы — разработчик, ориентированный на ИИ, человек с действительно технически подкованным опытом, будь то обучению на основе ИИ, и вы хотите присоединиться к моей команде, обязательно напишите мне в

[17:22] Instagram или Twitter, потому что я собираюсь создать элитную собираюсь создать элитную команду для работы в офисе в Катовице, Польша. А теперь позвольте мне показать вам, как запустить агент Hermes с Gemma 4. Итак, первое, что

[17:34] нам нужно сделать, это открыть терминал, слова, и нажать Enter. Как видите, этот адрес уже используется, потому что у меня уже запущена программа Ollama. Поэтому обязательно введите это, чтобы

[17:49] не запущен, он будет внутри агента Hermes. Поэтому обязательно запустите это в любом случае. Далее перейдите на официальный GitHub для агента Hermes. Прокрутите вниз, чтобы найти команду `curl

[18:02] install um` в одну строку. Итак, еще раз, одна команда, которую мы просто копируем и запускаем в папке, куда хотим собираюсь использовать для этого IDE. Я собираюсь использовать курсор. Можете смело использовать VS Code

[18:16] причина, по которой мне нравится IDE, заключается в том, что вы можете видеть папки, и у вас есть LS, вы увидите, что у нас есть две папки. Я собираюсь выполнить команду CD в папка. Как видите, справа ничего нет. А здесь я вставлю

[18:32] команду для установки агента Hermes. У нас есть несколько ошибок. Думаю, это потому, что оно уже установлено, верно? Версия Гермеса. настройки. Я недавно опубликовал видео на эту тему. Если вы его ещё не видели,

[18:48] посмотрите его после этого. Чтобы проверить свою версию, просто введите команду Hermes version. Как установлено обновление, и доступно обновление, поэтому введите «Hermes update», чтобы получить последнюю версию агента Hermes. И если мы прямо сейчас проверим версию Hermes

[19:03] , то увидим самую последнюю. Красивый. А теперь самое важное. Как выбрать компанию Ollama в качестве поставщика для обеспечения работы Hermes? Итак, вы вводите модель Hermes,

[19:16] различных вариантов, но нам нужно прокрутить вниз и нажать на «Пользовательская конечная точка», ввести URL-адрес вручную, и ввести его. Здесь нам нужно указать конечную точку как localhost 11434/v1.

[19:29] Итак, вот строка, которую вам нужно скопировать, поэтому убедитесь, что она в точности такая же. Это . Поэтому, можете смело поставить видео на паузу и ввести точное значение: видео на паузу и ввести точное значение: localhost:11434/v1.

[19:44] нажмите Enter. И мы видим, что доступные модели есть, и система корректно отправила пинг на этот конечный пункт и нашла эти модели. Таким образом, вместо того чтобы вводить полное название модели, мы можем просто выбрать номер.

[19:57] Gemma 4 31B, поэтому я сейчас его наберу . да, нажмите Enter. Вот и всё . В качестве агента сохранена модель Gemma 4 31B,

[20:12] выберем Hermes , просто Hermes в качестве начального агента. Вот и всё , Джемма 4, привет. Посмотрим, сработает ли это. Итак, 260 000 контекстных окон — совсем неплохо для модели с 31 миллиардом параметров.

[20:26] Итак, сейчас происходит загрузка в память, и если это сработает, у нас будет полностью агент искусственного интеллекта. Это, по сути, улучшенная версия Open Claude, верно? Запущено полностью локально на моём MacBook. Мы по-прежнему не получили ответа.

[20:41] Так что давайте наберём терпения. Давайте посмотрим, загрузится ли это в память. Ollama PS, оно заряжено. Я не понимаю, почему генерация токенов занимает так много времени . «

[20:54] это занимает некоторое время, потому что , как вы видите, там около 12 000 токенов, так как есть много заранее подготовленных запросов от агента Гермеса. понятно? Но теперь, когда он загружен, он должен быть

[21:07] самым быстрым. Покажите мне содержимое вашей папки .hermes в виде древовидной структуры файлов. Посмотрим, насколько быстро это теперь происходит. Очевидно, ответ. Раньше всё работало так быстро,

[21:21] подсказок, верно? Итак, мы просто общались с исходной моделью лучше подошёл бы проект PyDev. Да, есть. Хорошо, значит, оно Давайте посмотрим, насколько хорошо он справляется с поиском инструментов. Таким образом,

[21:39] для анализа внутренних папок необходимо использовать инструмент поиска. Хорошо, захватывающе. Всё это работает локально с запущенным агентом Hermes, и мы тестируем возможности вызова инструментов

[21:52] Gemma 4. Хорошо, да, всё очень медленно, особенно когда появляется командная строка. Но минималистичный агент, и это pi.dev. Итак, если вам нужно то, что работает на если вам нужно то, что работает на Open Claw, это суперминималистичный агент

[22:07] с минимальным набором инструментов и минимальным количеством подсказок. Для локальных моделей это будет лучше, потому что не будет так много зависимостей, так много с самыми современными моделями это будет не так эффективно . Я бы так и

[22:21] сказал. Итак, Пи, дай мне знать, если хочешь, чтобы я снял видео о Пи, потому что это такая андерграундная штука, о существовании которой мало кто знает, но на которой, собственно, и дайте мне знать, если вы хотите, чтобы я снял видео об агенте PiDev.

[22:35] Но да, это работает очень медленно. Итак, повторюсь, если вы находитесь в самолете, если у это намного лучше, чем ничего, но это не будет так же эффективно, как, например, модели искусственного интеллекта, размещенные на суперкомпьютерах

[22:51] если вас интересует программирование в области искусственного интеллекта, обязательно присоединяйтесь к нового контента, который будет выпущен через 8 дней. Но выпущен через 8 дней. Но до тех пор цена составляет 37 долларов в месяц.

[23:04] если вы всерьез увлечены программированием с использованием ИИ и хотите освоить Cloud Code, Cursor, CodeX и другие инструменты программирования, если вы хотите иметь возможность создавать что угодно с помощью инструментов ИИ, тогда обязательно присоединяйтесь к новому обществу.

[23:18] Ссылка будет размещена под видео. И снова, в течение следующих 8 дней это будет 37 долларов в месяц, а затем цена вырастет до 77 долларов в месяц, и так будет всегда. Это самое большое снижение цен за всю нашу историю. Это самая

[23:30] Нового общества. Итак, еще раз, если вы серьезно относитесь к программированию в области ИИ, присоединяйтесь прямо сейчас, because there's a massive release coming in 8 days.

More from David Ondrej

View all

⚡ Saved you 0h 23m reading this? Transcribe any YouTube video for free — no signup needed.