TubeSum

AI Optical Illusions — Full Breakdown & Transcript

This image changes when you flip it

0h 02m video Published May 22, 2026 Transcribed Sep 2, 2026 S Steve Mould
Beginner 2 min read For: Anyone curious about how generative AI works and its creative applications.
AI Trust Score 70/100
⚠️ Average / Some Fluff

"Delivers on the promise of explaining the illusion technique, though it's more of a fascinating demo than a deep tutorial."

AI Summary

This video explores how generative AI diffusion models can create optical illusions that work in multiple orientations, such as images that look like a penguin one way and a giraffe when flipped. The creator explains the mechanics of diffusion models and how two researchers, Daniel Gang and Ryan Burgert, hacked the process to produce these dual-image illusions.

[00:00]
The Challenge

Daniel Gang and Ryan Burgert independently found a way to create images that work in both orientations of twisty squares using generative AI.

[00:26]
How Diffusion Models Work

Diffusion models like Stable Diffusion start with pure noise and iteratively remove noise to produce an image that matches a text prompt, refining detail in steps.

[01:35]
Iterative Refinement

The model adds back decreasing amounts of noise (90%, 80%, 70%...) and predicts how much was added, gradually sharpening the image from a blurry blob to a crisp result.

[02:10]
Creating the Illusion

By pausing the generation after the first guess for two different prompts (e.g., penguin and giraffe), flipping one, and averaging the pixels, the combined image becomes the input for both tasks, resulting in an image that looks like one subject in one orientation and another when flipped.

[02:39]
Transparencies

Ryan's method excels at creating transparent effects, and some illusions work in multiple orientations.

The video demonstrates a clever hack of diffusion models to create dual-orientation optical illusions, highlighting the flexibility and creative potential of generative AI when its internal processes are manipulated.

Mentioned in this Video

Study Flashcards (4)

What type of model does Stable Diffusion use?

easy Click to reveal answer

Diffusion model

00:41

What is the first step in generating an image with a diffusion model?

easy Click to reveal answer

Start with pure noise

00:57

How does the diffusion model refine the image?

medium Click to reveal answer

By iteratively adding and removing decreasing amounts of noise (90%, 80%, 70%...) to sharpen details.

01:35

What technique is used to create a dual-orientation illusion?

hard Click to reveal answer

Pause generation after the first guess for two prompts, flip one image, average the pixels, and use the combined image as input for both tasks.

02:10

💡 Key Takeaways

💡

Diffusion Models Explained

Provides a clear, accessible explanation of how state-of-the-art image generation works.

00:41
🔧

The Illusion Hack

Reveals a clever, non-obvious manipulation of the diffusion process to create dual images.

02:10

[00:02] которое бы хорошо смотрелось на этой поверхности при обеих ориентациях этих извилистых квадратов? Я получил электронное письмо от Даниэля Генга и одновременно личное сообщение в Discord от Райана Бургерта. Оба они нашли подходящие изображения, созданные с помощью генеративного искусственного интеллекта. Введите текстовую

[00:15] подсказку, и вы получите изображение, например, Midjourney или Stable Diffusion. Оказалось, что Дэниел и Райан работали над проблемой создания оптических иллюзий с помощью генеративного ИИ, разбирая модели на части и экспериментируя

[00:29] с их внутренними механизмами. И то, что они придумали, идеально подходило для решения задачи с перекрученными квадратиками. Но я понял, что на самом деле не понимаю, как работает стандартная генерация изображений из текста в речь. Таким образом, обе модели используют диффузионные модели, что

[00:42] является передовым подходом в этой области . Райан использует метод стабильной диффузии, о котором вы, возможно, слышали . И это просто невероятно, насколько хорошо это работает. Таким образом, когда вы задаете Stable Diffusion текстовую подсказку, например, «красный

[00:55] кролик в синей шляпе-цилиндре», программа начинает с изображения чистого шума, а затем пытается определить, какой шум следует удалить. Иными словами, какие пиксели нужно скорректировать, чтобы в итоге получить изображение, обладающее всеми характеристиками

[01:07] вектора, предоставленного моделью обрезки. Но это происходит не за один шаг. Иными словами, первая попытка получилась несколько размытой, серой и плоской. Шум заглушает детали. Или, в случае модели диффузии, практически не имеющей

[01:21] подходящих признаков, она выдаст изображение, похожее на среднее значение всех изображений, удовлетворяющих вашему запросу. Иными словами, размытое пятно. Затем вы берете это изображение и добавляете, скажем, 90% шума обратно, после чего просите модель предсказать,

[01:36] сколько шума вы добавили в этот раз. А после того, как вы отбросите это предположение, изображение станет немного чётче. Это происходит потому, что изображение уже имеет некоторую крупномасштабную структуру, и этот уменьшенный шум, наложенный поверх, может начать

[01:50] смещать его в сторону большей детализации в отдельных местах . Затем вы повторяете это с 80% шума, потом с 70%, затем с 60%, и так далее до нуля, и в итоге получаете четкое изображение. Итак, вот как текстовая подсказка превращается в изображение, но,

[02:02] зная, что этот процесс происходит постепенно, шаг за шагом, к четкому изображению, вы можете немного повеселиться. Они запрашивают у модели диффузии изображение пингвина, скажем, но ставят её на паузу после первой попытки. Затем вас просят

[02:16] показать, скажем, фотографию жирафа, и ставят игру на паузу после первой попытки. Итак, у них есть размытое изображение, приближающееся к пингвину, и размытое изображение, приближающееся к... Затем они переворачивают изображение жирафа и объединяют их,

[02:29] Это объединённое изображение становится входными данными для следующего шага как задачи генерации пингвинов, так и задачи генерации жирафов. И вот, постепенно изображение превращается в нечто, напоминающее пингвина в одном ракурсе

[02:45] и жирафа в другом. Как здорово! Метод Райана отлично справляется с использованием прозрачных материалов. Ну разве они не крутые? Некоторые работают в нескольких cool are these? Some work in several orientations.

More from Steve Mould

View all

⚡ Saved you 0h 02m reading this? Transcribe any YouTube video for free — no signup needed.