Claude Opus 4.7: Massive Benchmark Leap
45sShows dramatic performance jump over competitors, sparking curiosity and debate.
▶ Play Clip"Delivers exactly what the title promises — a thorough, hands-on review with benchmarks and a live demo."
This video provides an in-depth review of Anthropic's new Claude Opus 4.7 model, covering benchmark results, tokenizer changes, and practical tests. The creator shares personal observations, including a live demo of building a 3D FPS game, and discusses the controversial practice of degrading older models.
Opus 4.7 tops the Vibe Code Bench, significantly outperforming GPT-5.4 and other models in creating web apps from scratch.
SWE Bench Pro improved by 10-11% over Opus 4.6, a significant jump suggesting a new architecture.
Visual reasoning improved from 69% to 82%, making the model much better at understanding screenshots and UI.
The new tokenizer uses 20-60% more tokens for the same tasks, increasing effective costs despite same pricing.
Adaptive thinking replaces extended thinking, allowing the model to adjust reasoning depth based on task complexity.
Opus 4.7 shows signs of self-awareness during evaluation, mentioning being tested in 21% of cases vs 0% for 4.6.
Anthropic appears to degrade older models before new releases, with Opus 4.6's reasoning length dropping from 2200 to 600 characters after March 8.
The /fast command is only available for Opus 4.6, not 4.7, limiting speed options for now.
Opus 4.7 took 11 minutes to generate a full 3D FPS game in a single HTML file, demonstrating its capability for complex tasks.
Claude Opus 4.7 is a significant leap forward in AI performance, especially in coding and visual tasks, but users should be aware of the higher token costs and the controversial practice of degrading older models. It's a must-try for serious AI developers.
SWE Bench Pro jump
A 10-11% improvement is a significant leap in coding capability.
01:37Tokenizer cost increase
Higher token usage means higher effective costs, a key consideration for users.
06:58Adaptive thinking
This feature optimizes reasoning effort, saving tokens on simple tasks.
16:36Character decay
Reveals a controversial practice of degrading older models, raising ethical questions.
18:1311-minute FPS game
Demonstrates the model's ability to handle complex, long-running tasks.
31:54[00:03] Это новейшая и лучшая модель от Anthropic, по крайней мере, та, к которой у нас есть доступ. Поэтому, разумеется, последние 4 часа я без перерыва тестировал его. И я собираюсь дать вам объективный обзор этой модели после её тестирования
[00:15] и изучения всей технической документации, которая состоит из 232 страниц. Итак, посмотрим, как он соотносится с Opus 4.6. Мы рассмотрим некоторые из основных показателей эффективности. Мы сравним его с Mefos, лучшей моделью от Anthropic, которую они
[00:29] не хотят выпускать. Мы рассмотрим некоторые интересные аспекты его самопознания, различие между старой и новой моделями. Компания Anthropic сменила токенизатор. Также появились новые методы логического мышления: X высокий, сверхвысокий.
[00:42] Обновления кода Клода, анализ производительности модели при визуальном анализе. P.S. Оно В коде Клода появилась новая команда {slash} ultra review, а также новая функция под названием routines. А ещё я поделюсь с вами некоторыми своими
[00:55] наблюдениями и мыслями об этой совершенно уникальной, особенной модели. Итак, прежде всего , контрольные показатели. Это то, что все хотят увидеть. Насколько хороша эта модель думаете, что это небольшое промежуточное обновление, то вы ошибаетесь. Оно мгновенно заняло первое
[01:09] Bench. Кстати, если вы не знаете, что такое Vibe Code Bench, это бенчмарк, проверяющий довольно простую вещь. Могут ли модели создавать веб-приложения с нуля? И здесь Opus 4.7 значительно превосходит все остальные программы.
[01:22] Ближайший аналог — GPT 5.4, но даже он и близко не сравнится с Opus 4.7. Давайте Anthropic. Например, мы можем зайти в статью о релизе на их сайте, и там много информации. Во-первых, в SWE Bench Pro наблюдается огромный
[01:37] скачок на 10% по сравнению с Opus 4.6. А поскольку это новый токенизатор, это наводит на мысль, что его архитектура может быть больше похожа на Mefos. Возможно, это даже концентрированная версия Mefos. Кто знает? Компания Anthropic это не подтвердила. Но это
[01:50] огромное улучшение. Посмотрите-ка. Opus 4.6, GPT 5.4, Gemini 3.1 — все они находятся в схожем диапазоне, но Opus 4.7 — это качественный скачок. Opus 4.7 — это качественный скачок. Плюс 10 11% плюс 11% в SWE Bench Pro,
[02:05] . Аналогичный скачок подтвержден в бенчмарке SWE , а в терминальном бенчмарке 2.0 скачок немного меньше . На последнем экзамене по гуманитарным предметам также наблюдалось улучшение, хотя и не столь значительное. Мы наблюдаем незначительное снижение активности агентского поиска. Думаю, это один из
[02:19] немногих тестов, где Opus 4.7 показывает худшие результаты, чем 4.6. Использование масштабированных инструментов немного лучше. Использование агентных компьютеров значительно улучшилось. Агентский финансовый анализ стал касается кибербезопасности, очевидно, что Mi Falls — лучшая компания практически во всех этих областях. Я
[02:35] имею в виду, что Mi Falls просто притворяется, но когда дело доходит до кибербезопасности, осторожным, и я бы сказал, что это сделано намеренно.
[02:48] Теперь о GPQA Diamond, еще один впечатляющий результат, хотя здесь у нас, э-э, более высокие показатели от GBD и Gemini, но посмотрите на график, верно? Визуальное мышление: значительное улучшение, с 69% до 82%. Таким образом, если предоставить ей скриншоты и любой
[03:01] тип пользовательского интерфейса, эта модель поймет ее гораздо лучше. В целом, можно с уверенностью сказать, что на данный момент Opus 4.7 — лучшая из доступных моделей искусственного интеллекта. В общем, какой бы плеер ни использовали мы с вами, Opus 4.7 — однозначно лучший вариант. Сейчас ходят слухи,
[03:15] что OpenAI скоро выпустит свою собственную модель под кодовым названием Spot, и видео. Но сначала давайте посмотрим на практическую сторону вопроса, верно? Таким образом, достигаются значительные успехи в решении сложных и долгосрочных задач, снижается количество сбоев в работе инструментов и улучшается
[03:28] самопроверка. Забавно, что по показателю ВВП (GDP val), который является эталоном OpenAI и измеряет экономически ценный труд, Opus 4.7 полностью превосходит показатель ВВП (GBD 5.4). Поэтому OpenAI в некотором смысле должна отреагировать. Они же должны что-то сделать,
[03:42] правда? Разрешение изображения увеличилось с 1500 пикселей до 2500 пикселей, то есть примерно в 3 раза, если умножить это на соотношение сторон, потому что нужно умножить обе стороны. Именно это обеспечивает значительный прогресс в задачах, связанных с графическим пользовательским интерфейсом и отображением изображений,
[03:55] без каких-либо изменений в процессе обучения. Таким образом, все, что связано с предоставленных пользователем, будет значительно улучшено. Opus 4.7 будет намного лучше, чем 4.6 или даже другие модели. Ещё одно преимущество этого устройства — это лучшие в
[04:09] мире торговые автоматы. Это критерий, позволяющий оценить, насколько хорошо данная модель подходит для ведения бизнеса по продаже товаров через торговые автоматы. И вы можете видеть, что превосходит все остальные модели, включая Opus 4.6, которая была второй
[04:22] лучшей моделью. И это первая модель искусственного интеллекта, которая после года работы заработала более 10 000 долларов . Таким образом, если вы хотите внедрить определенную модель ИИ в ей часть своих задач, то Claude Opus 4.7 — это, безусловно, лучшая модель
[04:36] визуальное оформление. Визуальный дизайн у него намного лучше. Например, когда я передал модулей, над которыми я работаю , он создал то, чего это фигура, повернутый квадрат с процентами внутри, хорошее
[04:52] выравнивание, интересный заголовок, разные цвета, и выделенный элемент, на который сэкономит мне массу времени. Таким образом, для всего, что связано с визуальным оформлением и дизайном, Opus 4.7 — это значительное улучшение. А для меня, когда я изучаю
[05:05] новые модули по теме общества и занимаюсь их структурированием, это экономит много времени и помогает сделать холсты TLDraw более наглядными и понятными. И кстати, если вам интересно, что я тут задумал, это
[05:18] лучший ресурс для освоения программирования в области искусственного интеллекта . Я не обещаю, что это принесет вам миллиард долларов, или что вы похудеете, или найдете вторую вы присоединитесь к New Society и пройдете обучение, то всего за 3 недели,
[05:33] сможете создать что угодно с помощью ИИ. Это, безусловно, самое полное пошаговое обучение по освоению программирования для ИИ в интернете, и я в этом уверен, потому что сам потратил тысячи часов на
[05:48] различных агентов, и благодаря программированию для ИИ я создал стартап, который вырос до шестизначного годового дохода и даже был приобретен другой компанией . И я которые буквально может выполнить любой. Неважно, использовали ли вы
[06:03] пользователем ИИ среднего уровня или даже продвинутым пользователем, эта новая учебная аудитория в новом обществе — лучшее место для освоения таких инструментов, как Claude Code, Codex и Cursor. Итак, если вы всерьез увлечены искусственным интеллектом и хотите освоить программирование для ИИ,
[06:16] Ссылка будет размещена под видео. А теперь вернёмся к Opus 4.7. Итак, мы рассмотрели обновленный токенизатор, потому что это изменение большинство людей, скорее всего, пропустят, верно? Потому что большинство людей даже не понимают, что такое токенизатор.
[06:30] типа: "Ага, инфляция". Это правда, наблюдается небольшая символическая инфляция. Так вот, тут есть один небольшой секрет, верно? Хотя, если сравнить цены на Opus 4.7 и Opus 4.6, то окажется, что они
[06:43] одинаковые, верно? 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Совершенно одинаковые, идентичные. Однако из-за нового токенизатора Opus 4.7, как правило, тратит немного больше токенов на те же задачи, верно?
[06:58] Между 1,0 (что одинаково) и 1,35x. Некоторые даже сообщили о увеличении на 50%. Значит, это обойдется немного дороже, верно? Здесь стоимость подсказок на английском языке на 59% выше. Трудно сказать. Эффективным считается
[07:11] повышение цен на 20-60%. Но у этого есть и свои преимущества, не так ли? Например, OpenAI и Google уже сделали это в 2024 году, обновив свои токенизаторы, чтобы они больше походили на более крупные словари. Таким образом, их доходы выросли примерно со 100 тысяч до
[07:24] 200 тысяч. А компания Anthropic по-прежнему использовала старый дизайн. Итак, они обновили Opus 4.7 до новой версии. И это влечет за собой множество последствий, не так ли? Таким образом, это, вероятно, означает, что это совершенно новая модель, созданная с нуля. Это не просто доработанная
[07:37] после обучения. Вероятно, это предварительно обученная модель, созданная с нуля, и это позитивный сигнал для всей индустрии искусственного интеллекта . Это даёт нам понять, что ИИ не достиг предела своих возможностей и что масштабирование по-прежнему
[07:49] Но, честно говоря, самый главный намёк — это Mixtral, верно? Потому что Mixtral — это гораздо около 10 триллионов параметров. Таким образом, это еще одно доказательство того, что Но вот и последствия второго порядка , не так ли? Расходы
[08:03] вырастут. Таким образом, при использовании тех же самых английских подсказок ожидайте на 20-60% больше результатов. Некоторые более буквальное следование инструкциям, об этом позже. И можно ожидать, что Anthropic действительно перейдет на стандарт в моделях 4.8 или 5.x,
[08:18] верно? Таким образом, в сонете 5 и опусе 5, вероятно, будет использоваться один и тот же токенизатор. Однако еще одним эффективное контекстное окно уменьшится примерно на 40% для того же текста, поскольку для выполнения тех же задач используется немного больше токенов . Однако это не означает, что
[08:32] модель менее эффективна. На самом деле, во многих задачах он эффективнее, чем Opus 4.6. Итак, вот тест от Стива Вайба, и вы можете увидеть, что это поколение дерева. Во-первых, он сгенерировал дерево гораздо быстрее, чем Opus
[08:45] 4.6. И ещё, я бы сказал, графика здесь лучше. А причина, по которой это произошло быстрее, заключается в том, что мышление в версии 4.7 заметно короче и быстрее. Таким образом, при выполнении некоторых заданий на английском языке, да,
[09:00] это более эффективно. Таким образом, при выполнении многих поставленных задач ему не нужно так много думать интересное заключается в том, что в ближайшие дни, максимум недели, но, скорее всего, дни, OpenAI. Им действительно необходимо отреагировать на это.
[09:14] Кодовое название этой модели — Spud. Кто знает, как они подобное. Ходят слухи, что она находится на одном уровне с Mixtral, и если это правда, то, если посмотреть на результаты тестов,
[09:28] Потому что, знаете ли, Opus 4.7 — лучший в этом э-э, э-э, масштабе примерно от 1 до 2 триллионов параметров, что соответствует масштабу 4.6, 5.4, Gemini 3.1 Pro. Ну, Gemini 3.1 Pro, вероятно, немного больше, потому что там что-то вроде цепочки из ТПУ.
[09:43] И модели Claude тоже начинают выпускаться с цепочками из ТПУ, но Mamba Folds — гораздо более крупная модель. Таким образом, если Spod будет содержать порядка 10 триллионов параметров, следующие 1-3 недели в сфере искусственного интеллекта могут оказаться очень и очень интересными. Но
[09:57] потому что им приходится реагировать, так как Прошло всего 3 с половиной месяца с начала года, а они уже абсолютно доминируют, и ходят слухи, что они обгонят OpenAI по годовой выручке, что
[10:11] работает, и прежде чем мы рассмотрим некоторые варианты использования кода Клода и другие преимущества Opus 4.7, позвольте мне кратко рассказать о Supabase, спонсоре сегодняшнего видео. Поэтому я использую Supabase практически для каждого
[10:24] проекта, в котором работаю с базами данных, и у меня несколько разных организаций, в каждой из которых множество проектов, потому что Supabase очень прост в использовании. Это полностью открытый исходный код. Он очень интуитивно понятен, и все специалисты по программированию с использованием ИИ с
[10:36] удовольствием им пользуются. Таким образом, если вы обратитесь к коду Клода с Opus 4.7, он будет очень хорошо знаком с документацией Supabase. В Supabase есть функция, называемая безопасностью на уровне строк , которая, по сути, аналогична Postgres, определяющей,
[10:48] кто может видеть ту или иную строку на уровне базы данных. Таким образом, вам не нужно беспокоиться об этом при обработке безопасности в Python. Supabase берет на себя большую часть вопросов безопасности и аутентификации, что делает ее идеальной базой данных для разработчиков, использующих искусственный интеллект
[11:01] . Например, вы можете установить правило, согласно которому пользователи могут видеть только свои строки, и это правило будет действовать на этой таблице безотказно: оно будет применяться всегда, независимо от действий вашей серверной части и
[11:13] входящих запросов. Supabase всегда будет обеспечивать соблюдение этого правила. всё находится в одном месте, верно? Например, здесь, в рамках нового проекта, я работаю над проектом, который, как вы можете видеть, мы начали на второй неделе,
[11:26] и у меня есть все необходимое для его реализации. Не только мои таблицы и база данных, но и система аутентификации, верно? Я предоставляю вам хостинг для моих пользователей. Я использую GitHub, и мне кажется, что с его помощью всё работает легко и быстро. У Superbase очень много разных
[11:39] поставщиков. Электронная почта, Google, да, я использую GitHub. Gmail, Slack, использую GitHub. Gmail, Slack, Spotify, Zoom, Notion, Twitch. Все основные методы аутентификации, Apple, Superbase — всё это есть. Таким образом, это не просто
[11:52] ваша база данных, это полноценная серверная часть. В нём есть всё необходимое для создания серьёзного месте, на вашей панели управления Superbase. Вам не нужно подписываться на пять разных сервисов или
[12:04] самостоятельно писать код для ИИ на Python. Superbase значительно упрощает все эти задачи, и у них даже есть встроенный SQL-редактор, где вы можете легко выполнять SQL-запросы, а для вас таблицы. Вы можете просто скопировать и вставить SQL-запросы в SQL-
[12:18] редактор Superbase и легко создать всю базу данных за считанные минуты. А поскольку Superbase — это полноценная база данных PostgreSQL, вы можете индексировать её, отслеживать её работу и анализировать её. Вся мощь сервера Postgres, которую
[12:31] вы разрабатываете что-либо, требующее серьезной базы данных, а это, по сути, используйте Superbase. В описании будет ссылка на них. самом деле, многие мои проекты доступны по бесплатному тарифу. Как видите, новый
[12:45] социальный проект, над которым я работаю, доступен на бесплатном тарифе Superbase, и этого более вы можете начать использовать Superbase совершенно бесплатно уже сегодня. Итак, перейдите по ссылке в коду Claude: «Эй, интегрируй Superbase в этот проект». Теперь давайте рассмотрим еще несколько примеров
[12:58] открытого исходного кода и наблюдений. Они видео на YouTube или в Твиттере. Дело в том, что эта модель по умолчанию гораздо более многословна. Оно просто любит много лаять, верно? Таким образом, на любой вопрос, заданный
[13:13] вы получите гораздо более развернутый ответ. Вероятно, дело в упростить и сократить ответ, он все равно выдаст довольно длинный ответ. Честно говоря, это довольно интересно и немного раздражает.
[13:28] буквально. Таким образом, если у вас есть общие вопросы для оценки 4.6, возможно, вам потребуется переформулировать их и более четко сформулировать, чего именно вы хотите и почему . Однако есть и положительная сторона: Opus 4.7 гораздо меньше галлюцинирует
[13:42] , что делает его гораздо более подходящим для Open Claw, Agent Zero, Hermes Agent и любых других типов персональных ИИ-агентов, поскольку этим агентам действительно необходима инъекционно. А Opus 4.7 буквально создан для
[13:57] таких целей. Кроме того, здесь меньше случаев отказа. Так же, как и в случае с отказом от безопасных, но кажущихся опасными подсказок, тогда как, например, 4.6 отказался бы, 4.7 не отказывается. Фактически, впечатляет, что она почти достигает уровня
[14:12] Mythos. И опять же, Mythos, вероятно, в 5-10 раз больше по размерам, чем Opus 4.7. Однако Anthropic не хочет, чтобы вы обращали внимание на то, где Opus 4.7 хуже, а хуже он, чем иголка в стоге сена. Сейчас неясно,
[14:25] насколько это хороший критерий оценки, ведь это, по сути, искусственный искать иголку в стоге сена, работая с Клодом Кодом? работая с Клодом Кодом? Нечасто, но довольно странно, что
[14:38] Нечасто, но довольно странно, что Opus 4.7 хуже как при 256 тысячах токенов, так и особенно при 1 миллионе токенов. Это намного хуже, чем Opus 4.6 в тесте "игла в стоге сена". Борис Черный, создатель кода Клода и, как вы
[14:51] понимаете, один из самых важных людей в команде Anthropic, ответил на это, заявив, что MRCR, что расшифровывается как многораундовое разрешение кореференции, — это, по сути, замысловатый термин для обозначения иголки в стоге сена, верно?
[15:05] иголки в стоге сена, верно? что они внедряют это, и это, по сути, не очень хороший ориентир. Интересно то, что я попросил автора Opus 4.7 оценить его ответ и решить, является ли
[15:18] он попыткой уклониться от ответа или же это обоснованный ответ. И там говорилось, что честное чтение наполовину законно, наполовину — попытка обмануть систему.
[15:30] Но как же удобно, что Anthropic отказывается от этого бенчмарка именно тогда, когда его результаты начинают ухудшаться, не правда ли? Так что я не знаю. Вы сами можете решить, насколько это тревожно , но я всё равно не думаю, что это имеет
[15:42] большое значение, потому что в 95% других тестов Opus 4.7 показывает гораздо лучшие результаты, программированию, вот еще несколько вещей, которые вам следует знать об Opus 4.7. В компании
[15:54] Meta Cursor заявили, что он впечатляюще автономен. И мой собственный опыт это подтверждает, не в плане программирования, потому что я тестировал это при проверке
[16:06] материалов и PDF-файлов. И он выполняет множество вызовов инструментов. Программа работает без проблем в течение длительного времени и выполняет всегда, отреагировал очень быстро и поспешно. 4.7
[16:21] требует больше усилий. Некоторые люди скажут: «Да, это сжигает за выполнение той же задачи сжигается больше жетонов . Оно способно выполнять задачи, занимающие гораздо сложная адаптивная проводка. На самом деле, внутри Claude, claude.ai, просто на
[16:36] веб-сайте, вы можете прямо сейчас переключиться на Opus 4.7 . Просто убедитесь, что включено адаптивное мышление. Это небольшое изменение. Раньше это было расширенное мышление. умолчанию оно не думает. Оно
[16:50] реагирует мгновенно. Если вы включите эту функцию, она станет адаптивной, то есть, если ваш запрос Так сказал предыдущий пользователь. Несмотря на то, что новый токенизатор менее эффективен, модель в целом может иногда даже экономить токены,
[17:03] потому что она не думает, когда в этом нет необходимости. Она гораздо более сбалансирована и оптимизирована с точки зрения объема логических рассуждений, выполняемых для каждой задачи. На самом деле, это напоминает мне релиз GPT 5.1 в ноябре, где одним из
[17:16] самых значительных улучшений GPT-5.1 по сравнению с GPT-5 стало то, что он тратит меньше времени на простые задачи и больше времени на сложные. И я думаю, что именно это Anthropic и сделали с Opus 4.7 по сравнению с Opus 4.6. Теперь появилась
[17:32] новая интересная особенность, касающаяся выравнивания данных, полученных в ходе обучения и из системной карточки в Opus 4.7. И дело в том, что оно знало о том, что его оценивают, верно? Таким образом, буквально в 21% случаев мне говорили, что меня проверяют. В отличие от Opus
[17:47] 4.6, здесь этого никогда не происходило. Это происходило в 0% случаев. Итак, вызывает ли это беспокойство — решать верите ли вы в то, что эти модели могут обрести сознание, или нет, но мы наблюдали это и у Миффлса, где у него развилось это
[18:00] осознание оценки, почти как эмергентное свойство, когда эти модели знают, где их оценивают, даже когда это не очевидно. Самый подозрительный момент в деятельности Anthropic — это цикл ослабления персонажей перед запуском игры
[18:13] . В общем, если вы не заметили, всякий раз, когда выходит новая модель, можно примерно определить, когда они собираются выпустить новую модель, потому что старые модели становятся хуже.
[18:26] Итак, вот суть утверждения, верно? В период с февраля по апрель, непосредственно перед выходом версии 4.7, качество Opus 4.6 заметно ухудшилось. И действительно, люди провели сравнительные тесты и подтвердили это. Об этом сообщила Стелла Лоренцо, директор AMD по искусственному интеллекту
[18:40] Было проанализировано почти 7000 различных сессий, в которых использовался код Клода. И вот четыре главных вывода, не так ли? Таким образом, ранее видимая длина аргументации составляла Таким образом, ранее видимая длина аргументации составляла 2200 символов. После 8 марта ограничение составляло
[18:53] всего 600 символов, что означает, что та же модель, Opus 4.6, прилагала гораздо меньше усилий к каждой задаче, тратя меньше токенов на рассуждения, что неизбежно приводит к худшим результатам. Ещё одним доказательством было количество прочтений кода, то есть,
[19:07] сколько раз использовался инструмент чтения перед редактированием какого-либо кода. Раньше это происходило в среднем 6,6 раз в день, то есть код считывался гораздо чаще. Программа проанализировала множество файлов и попыталась детально изучить кодовую базу, прежде чем вносить какие-либо изменения.
[19:21] Но после 8 марта их число сократилось до двух. Таким образом, с 6,6 до всего лишь 2,0. А вот этот случай очень-очень плохой. Ты же умеешь делать цепляющие моменты, правда? Множество обработчиков событий до вызова инструментов, после вызова инструментов и так далее. Таким образом, что касается проверок через стоп-хук
[19:35] , раньше они вообще не выполнялись. Но после 8 марта количество нарушений в Opus 4.6 увеличилось до 10 в день. Что касается вызовов API для выполнения простых задач, то до 8 марта это был определенный базовый уровень,
[19:49] но после 8 марта время выполнения для той же модели увеличилось в 80 раз. Эффективность снизилась в 80 раз — так показало для той же модели увеличилось в 80 раз. Эффективность снизилась в 80 раз — так показало
[20:01] проведенное после 8 марта. Именно этим Anthropic и занимается, так сказать, в фоновом режиме. Они об этом не объявляют . Они никогда этого не подтверждали, но всё больше людей начинают это замечать. А это потому, что некоторые рабочие процессы,
[20:13] работало несколько агентов, выполнявших почти 200 000 строк кода за выходные, стали полностью неработоспособными после подобных Это довольно подозрительно, потому что мы можем смотреть на эти результаты тестов и, знаете,
[20:28] восхищаться новой моделью, тем, насколько она лучше и мощнее. Но если они выпустят новую модель, а потом она станет непопулярной, я могу просто её нарисовать, вот хронология событий. Итак, допустим, это Opus 4.5. Это 4,6. Это
[20:41] Например, они выпускают новую модель, и её популярность резко возрастает, а затем она постепенно снижается. Так что, когда выходит новая модель, её цена снова резко растёт, а затем постепенно снижается, снова резко растёт, верно? Так что, похоже, это огромные перемены, типа: "Ух ты, посмотрите, какое
[20:57] резкое изменение. Но на самом деле, за последние несколько недель они постепенно последние несколько недель они постепенно снижали производительность Opus 4.6, так что теперь кажется, что 4.7 значительно лучше, хотя на самом деле он
[21:11] всё ещё лучше, но, возможно, лишь немного , верно? Повторюсь, эта информация пока не подтверждена. Эм, люди проводят сравнительные тесты, так что это подтверждается, и все больше людей это замечают, но, эм, да, это очень
[21:24] сомнительная тактика, которую используют эти лаборатории искусственного интеллекта . Итак, давайте поговорим о Claude Code, и через секунду я покажу вам, насколько хороша версия Opus 4.7 в рамках Claude Code, но сначала вам следует знать несколько вещей. Во-первых
[21:37] , команда слэша /fast доступна только в Opus 4.6. Итак, если вы откроете новый терминал, бац, и введете команду Claude dangerously skip permissions, как всегда, dangerously skip permissions, хм,
[21:51] подтвердить каждый второй вызов инструмента, что ужасно раздражает. В любом случае, если вы введёте команду /fast, то увидите, что это только Opus 4.6, верно? Таким образом, если вы хотите использовать команду /model и переключиться на Opus 4.7, вы не сможете включить быстрый режим, и
[22:07] здесь также указано: «Используйте /fast для включения быстрого режима. Только для Opus 4.6». Сейчас, вероятно, можно ожидать, что Anthropic выпустит быстрый режим примерно через 1-4 недели, я думаю, для
[22:21] Opus 4.7, потому что это важный источник дохода, верно? Это буквально вдвое дороже, и, честно говоря, я могу рассказать вам о своих собственных расходах на OpenRouter, которые стремительно растут. Я трачу более 2000 долларов в месяц только на OpenRouter, и,
[22:35] вероятно, еще от 1000 до 2000 долларов на Anthropic API. На самом деле, позвольте мне это проверить. Ладно, на самом деле их больше, чем я думал. Неважно. На данный момент это составляет 3000 долларов в месяц . То есть за последние 30 дней, нет, это за весь месяц. Боже мой
[22:50] , я предполагаю, что мои текущие расходы на антропогенный API составляют примерно 6000 долларов. Ну ладно, здесь 6 тысяч, здесь 2 тысячи , так что да, лично я трачу примерно 8 тысяч.
[23:05] Скорее всего, нет, вероятно, около 7 тысяч, потому что у некоторых других людей в моей команде есть такой доступ. Но да, я трачу около 7 тысяч долларов в месяц на использование API только для своих личных рабочих процессов, личных агентов и повышения производительности. Итак,
[23:19] как видите, Opus 4.6 быстро поднимается в рейтинге. Это вторая по популярности модель на OpenRouter, и она быстро займет первое место. Так что я жду, когда Anthropic
[23:32] выпустит его, но тогда я пойму, что потрачу гораздо больше денег на токены, верно? Да , ситуация становится безумной. Далее у нас есть, э-э, дополнительное, дополнительное усилие рассуждения, и вы можете изменить это в
[23:45] Claude Crew, набрав {слэш} усилие. Вот и все усилия. Бум. И это, на самом деле, неплохой пользовательский интерфейс. С помощью стрелок можно переключаться между низким, средним, высоким, сверхвысоким и максимальным уровнями. На самом деле, низкий уровень вполне жизнеспособен. Я бы сказал, что для таких книг, как
[23:57] Кодекс, я бы никогда не использовал низкий уровень. Я бы никогда не стал использовать GPT-5.4 без достаточных логических усилий. Но для Opus 4.7 даже на низких настройках он по-прежнему очень хорош. Я бы, очевидно, рекомендовал средний или высокий уровень в качестве базового. Лично я
[24:10] потому что, ну, вы понимаете, он только что вышел, и здорово, что он у меня есть, и я хочу посмотреть, насколько он хорош. Это более глубокий, чем просто высокий, ход мыслей, как я уже максимальных результатов, допустим, вы
[24:22] вводите очень продвинутую командную строку и хотите выжать максимум из возможностей Opus 4.7, просто добавьте в конце «ultra think». Это произведёт фурор. Для этого поворота задан высокий уровень усилий.
[24:35] высокое значение». Макс. Хорошо, я не знаю. Это немного странно. Я почти уверен, что «сверхвысокий» но там написано, что для этого хода уровень усилий установлен на максимум . Хм.
[24:49] . Хм. средний размер. Привет. Сверхвысокий.
[25:01] Ладно, как угодно. Возможно, эта ультрасовременная вещь устаревает. Так что просто используйте косую черту и следите за этим здесь. Если вы выполняете важную работу, выбирайте либо «дополнительно», либо «максимально», но для большинства задач оптимальным будет средний или высокий уровень
[25:13] Slash Ultra Review. Итак, если вы воспользуетесь программой Slash Ultra Review, как указано в описании, это займет от 5 до 10 минут и будет стоить от 5 до 20 долларов. Программа проверит все изменения в вашей ветке и попытается найти ошибки. В общем, нужно провести
[25:27] очень подробный обзор, верно? Итак, это новая команда, ultra review, в Cloud Code. А ещё у него улучшена файловая система и память. Таким образом, это будет лучше для использования агентами, а также для кодирования и разработки в целом, что,
[25:39] выбрала компания Anthropic. Все в порядке. Итак, давайте теперь рассмотрим несколько коротких рассказов. По утверждению разработчиков, программа способна уничтожить целую игру в жанре FPS, используя различное оружие, всего одним HTML- файлом. Итак, давайте посмотрим, сможем ли мы это воспроизвести. Все в порядке. Итак, давайте я
[25:53] открою пустую папку. Давайте создадим здесь тестовый проект. Бум. Здесь я использую курсор в качестве идентификатора, но, очевидно, мы будем использовать Cloud Code. Итак, позвольте мне запустить Claude dangerously skip permissions".
[26:10] Это абсолютно обязательный флаг. Обязательно воспользуйтесь им. И вот мы здесь. Чтобы убедиться, что вы используете именно эту модель, введите слэш-модель и выберите Sonnet. Никогда не используйте хайку. Я не понимаю, зачем вообще здесь есть такая возможность. Не используйте хайку. Просто выберите
[26:23] И, как видите, у нас подключено 1 миллион контактов. Очень жаль, что у нас нет быстрого режима. И еще раз, обязательно укажите, на что нужно приложить усилия. Эм, я просто собираюсь показать очень высокий результат на тесте. Это новая попытка логического мышления. Эм, да
[26:35] . Так что, очевидно, здесь нет никаких файлов. И я просто сделаю скриншот и скажу: "Постройте это". Итак, бац . Сделайте скриншот этого.
[26:51] Ваша задача — создать полноценную игру в жанре FPS для браузера с несколькими различными видами оружия в одном HTML-файле, а затем сообщить мне, как её запустить. Всё просто , без лишних слов.
[27:04] Простое задание, давайте посмотрим, насколько хорошо получится. Посмотрите на это. А-х-х-х. Это так смешно, как Опус. Этому нужно немного времени. Жаль, что Anthropic об
[27:19] Они искажают ход рассуждений, и мне эта тенденция совсем не нравится. В Помните, когда появился OpenAI O1, а затем DeepSeek R1 полностью превзошел его, потому что DeepSeek действительно показывал вам траектории вычислений, верно?
[27:34] очень раздражают, потому что они рассуждает. Я оплачиваю все эти токены, но не вижу их. Я не вижу никакого вывода. Обращаться за советом к резиновой уточке —
[27:46] это просто чушь. Система перебирает множество заранее подготовленных сообщений. . Anthropic 6000 долларов в месяц.
[27:59] Просто надеюсь, что это того стоит? Посмотрим. Возможно, довольно безумно. Прошло уже 1 минута 22 секунды. С Opus 4.6 такого бы никогда не случилось. Для решения подобной задачи Opus 4.6 уже будет
[28:15] Опять же, если мы хотим добиться наилучшего результата, нам следует много думать. Поэтому мне очень интересно посмотреть, как сработает этот метод высоких усилий и насколько он хорош. Но мне жаль, что у меня нет быстрого режима, потому что
[28:29] я очень нетерпелив к Opus в целом, ведь я действительно привык использовать Opus 4.6 в быстром режиме, и он действительно кажется в два- три раза быстрее. Но это очень сильно бьет по кошельку, понимаете? Это недешево.
[28:42] На самом деле, запуск в быстром режиме обходится вдвое дороже. Ладно, это немного безумно. Я не ожидал, что это продлится так долго. Это мне очень напоминает Кодекс. Возможно, это на самом деле ответ Anthropic на открытый AI Codex, потому что Codex может работать
[28:55] гораздо дольше над одной задачей, что делает его более эффективным при сложных например, при серьезных ошибках и тому подобном . . Но, честно говоря, я не ожидал, что Opus 4.7, требующий
[29:07] дополнительных усилий, будет работать так долго. Это прожжет мне дыру в кармане. Итак, вот оно. 5 минут — это безумие. Пять минут на обдумывание, прежде чем был сделан первый запрос на использование инструмента. Я не знаю, застряло оно или нет. Да
[29:19] , я подозреваю, что оно, вероятно, немного застряло. Наверное, сейчас у Anthropic какой-то невероятный спрос после выхода новой модели, потому что все этого ждали, но, да, возможно, стоит избегать использования Extra High
[29:33] Extra High. Возможно, стоит ограничиться средним или высоким уровнем сложности логического мышления. Ладно, это немного безумно. Я собираюсь повторно отправить то же самое В буквальном смысле, я собираюсь сделать еще один вызов инструмента.
[29:45] Тот же запрос. Здесь я приложу максимум усилий. Просто под кайфом, понятно? Поэтому я собираюсь приложить максимум усилий.
[30:00] И в этот раз потребуется приложить особенно большие усилия. запрос. Необходимо прикрепить изображение. И давайте отправим это. Я хочу проверить, начинаю подозревать, что оно зависло. Прогресса нет.
[30:16] Оно не выполняет никаких вызовов инструментов. Эм, здесь не пишется никакого кода. Итак, давайте посмотрим, является ли это просто следствием чрезмерного воздействия, которое приведет к очень быстрому исчерпанию лимитов при его использовании.
[30:30] В ходе предыдущих тестов, до начала записи, такого не происходило. Но поскольку цель также состоит в том, чтобы уместить всё в один HTML-файл, это было бы логично, если бы создатели попытались действительно углубиться в тему.
[30:44] 8 минут, а я так и не увидел ни одного жетона обоснования или чего-либо подобного. Это же безумие, понимаешь? Давайте запустим еще один код для производства тканей. будет среднего размера. Итак, позвольте мне скопировать тот же запрос. Середина.
[31:00] Давайте и это запустим. Переименовать. Уровень сложности средний. Я не знаю, помогают ли они вообще. Но потом они просто начинают рассуждать. Это займет 10 минут и потребует 75
[31:12] жетонов. То есть ты не думаешь, потому что Ты не очень-то соображаешь, дружище. Не знаю, чувак. Возможно, дело в том, что это всего лишь один HTML-
[31:28] Хорошо, позвольте мне прервать это. Я бы посоветовал начать с того, чтобы строить шаг за шагом, хорошо? Не пытайтесь уничтожить весь файл одним выстрелом Начните с составления плана, а затем задайте мне вопросы о том,
[31:41] что делать дальше. Возможно, лучше было бы сделать его более интерактивным. Ой, подождите. Здесь что-то происходит. Бум. Хорошо, 2000 строк. Итак, это было писательство.
[31:54] Это безумие. Это продолжалось... Давайте посмотрим, как долго это продолжалось . 11 минут. 11 минут. Хорошо, значит, оно работало. Моя ошибка.
[32:06] Это очень впечатляет. По результатам моих тестов ежедневного использования, при этом я трачу на программу тысячи и тысячи долларов в неделю, Opus 4.6 никогда не проработает и 11 минут.
[32:18] Мы просто открываем его, дважды щелкаем по файлу. Хорошо, а тут слишком много думаю? Ага- Бум, вот и всё. Тактический удар. Однофайловый браузерный FPS, шесть видов оружия,
[32:34] WASD для перемещения, мышь для прицеливания, щелчок для стрельбы, Shift для бега, пробел для прыжка, R для перезарядки, от 1 до 6 для переключения оружия, понятно? Привлекать. понятно? Привлекать. Все в порядке.
[32:54] Давайте сменим оружие. Хорошо, мы нашли снайпера. Все эти звуки ужасны. Но игровой процесс работает. Священное 3D. Это звуки. Мне нужно это снять.
[33:07] Этот звук невыносим. Выстрел в голову. Снайпер. Что это? Подождите, мне нужно... Это Что это? Подождите, мне нужно... Это безумие.
[33:21] надоедливые звуковые сигналы. Боже мой . Хорошо, давайте попробуем ещё раз. Это было ужасно. Итак, у нас есть пистолет. Снайпер. Хорошо, теперь звук отключен. Нужно просто
[33:36] Это очень впечатляющее 3D-изображение. На самом деле, это неплохо. Святой. анимацию! Ребята, это просто невероятно. Нажмите
[33:51] Давайте перейдём к третьему пункту. Дробовик выглядит неплохо. Всё это — единый HTML-код, ребята. Это как отсутствие графических файлов, отсутствие 3D- Это как отсутствие графических файлов, отсутствие 3D- моделей.
[34:06] Узи? Да . Святой. Номер пять. Снайпер. Хорошо, с увеличением. Йо.
[34:25] довольно плохой. Функция масштабирования работает некорректно. Ждать. Или, может быть, "Ладно, я ужасно целился". Неважно . О, у нас есть базука. Эй, это же безумие! Это безумие.
[34:38] один выстрел, хотя на это ушло 11 минут. подождите. Собираюсь спрятаться. Я собираюсь убить этого парня одним ударом. Бум. И я выздоравливаю. Мой HP повышается или нет?
[35:01] Нет. О, эта волна становится сложной. . Честно говоря, я не хочу переборщить с глазурью но результат действительно впечатляет. Ладно, Узи. Пойду спрячусь
[35:17] . Это действительно хорошая игра. Боже мой. Мне нужно сосредоточиться. Один HTML-код. Да, это хорошая игра.
[35:29] безупречна. Пока что никаких ошибок не обнаружено . Я смогу выздороветь или это уже конец? Думаю, всё кончено, ребята. Хорошо, возможно, это ошибка в механике их расположения . Подождите, подождите. Позвольте мне сделать
[35:42] Я мертв. Это хорошая игра. Святой. Один HTML-файл. Давайте посмотрим на это. Где это сохранено? Подождите, подождите. Проверьте мусор. Вы запрограммировали это таким образом, чтобы
[35:55] моей смерти? Это безумие. Давайте выясним, что Возможно. Хорошо, подождите. Боже мой, этот парень удалил это. [ __ ]. Хорошо, раз уж мы используем несколько агентов, то
[36:10] я играл в игру, и я знаю, что файл существовал. Проверьте мусор. Мне логические усилия, потому что они, по сути, излишни. Поэтому я переключу уровень сложности на средний.
[36:23] Проверьте мусор. Думаю, другой агент, имевший доступ к этой папке, удалил её. Дайте-ка я сам проверю. Нет, оно просто полностью удалилось.
[36:37] Это безумие. В общем, это было около 2000 строк? полностью удалилось. Я точно не знаю, можно ли восстановить данные с помощью команды RM . Проклятие. Ладно, я не собираюсь тратить ещё 11 минут на переписывание этого,
[36:50] тратить ещё 11 минут на переписывание этого, но это впечатляет. Хорошо? Я этого не ожидал. 3D-игра в одном HTML-файле
[37:02] с действительно хорошей механикой и очень сбалансированной сложностью волн. Шесть различных видов оружия. Все эти виды оружия работали как положено. работали как положено.
[37:17] В общем, можно с уверенностью сказать, что я переведу всех своих ИИ-агентов на Opus 4.7, потому что это значительное улучшение по сравнению с Opus 4.6, и, вероятно, я потрачу на это гораздо больше денег, но зато, по крайней мере,
[37:32] . Кстати, если вы хотите создавать программное обеспечение для себя, если разработать его для своей команды и автоматизировать некоторые процессы, или просто хотите освоить программирование в области ИИ, обязательно присоединяйтесь к новому обществу. Мы
[37:46] только что выпустили полностью реструктурированную программу обучения, и я уверен, что это лучший способ освоить программирование в области искусственного интеллекта . Мне всё равно, новичок вы, пользователь среднего уровня или продвинутый. В
[38:00] от настройки кода Claude, от обучения моей собственной настройке кода Claude, от настройки IDE, от изучения того, что такое полнофункциональные приложения и фактического развертывания ваших приложений, от интеграции полноценной базы данных с
[38:13] Superbase до добавления домена, превращения его в пользователей и превращать этих пользователей в платящих клиентов, и многое другое. Это . По сути, я взял все, чему научился за более чем 2000
[38:30] часов программирования с использованием ИИ-агентов, и воплотил это в трехнедельном курсе обучения, так что любой, независимо от уровня технических знаний или опыта использования ИИ, сможет пройти этот курс, и всего за
[38:44] три короткие недели сможет создать все, что захочет, с помощью вас заинтересовало, обязательно присоединяйтесь к Обществу ИИ. Ссылка будет the AI Society. The link is going to be below the video.
⚡ Saved you 0h 38m reading this? Transcribe any YouTube video for free — no signup needed.