---
title: 'This image changes when you flip it'
source: 'https://youtube.com/watch?v=eJQg5e85yCI'
video_id: 'eJQg5e85yCI'
date: 2026-09-02
duration_sec: 175
channel: 'Steve Mould'
---

# This image changes when you flip it

> Source: [This image changes when you flip it](https://youtube.com/watch?v=eJQg5e85yCI)

## Summary

This video explores how generative AI diffusion models can create optical illusions that work in multiple orientations, such as images that look like a penguin one way and a giraffe when flipped. The creator explains the mechanics of diffusion models and how two researchers, Daniel Gang and Ryan Burgert, hacked the process to produce these dual-image illusions.

### Key Points

- **The Challenge** [00:00] — Daniel Gang and Ryan Burgert independently found a way to create images that work in both orientations of twisty squares using generative AI.
- **How Diffusion Models Work** [00:26] — Diffusion models like Stable Diffusion start with pure noise and iteratively remove noise to produce an image that matches a text prompt, refining detail in steps.
- **Iterative Refinement** [01:35] — The model adds back decreasing amounts of noise (90%, 80%, 70%...) and predicts how much was added, gradually sharpening the image from a blurry blob to a crisp result.
- **Creating the Illusion** [02:10] — By pausing the generation after the first guess for two different prompts (e.g., penguin and giraffe), flipping one, and averaging the pixels, the combined image becomes the input for both tasks, resulting in an image that looks like one subject in one orientation and another when flipped.
- **Transparencies** [02:39] — Ryan's method excels at creating transparent effects, and some illusions work in multiple orientations.

### Conclusion

The video demonstrates a clever hack of diffusion models to create dual-orientation optical illusions, highlighting the flexibility and creative potential of generative AI when its internal processes are manipulated.

## Transcript

которое бы хорошо смотрелось на этой поверхности при обеих ориентациях этих извилистых квадратов?  Я получил электронное письмо от Даниэля Генга и одновременно личное сообщение в Discord от Райана Бургерта.  Оба они нашли подходящие изображения, созданные с помощью генеративного искусственного интеллекта.  Введите текстовую
подсказку, и вы получите изображение, например, Midjourney или Stable Diffusion. Оказалось, что Дэниел и Райан работали над проблемой создания оптических иллюзий с помощью генеративного ИИ, разбирая модели на части и экспериментируя
с их внутренними механизмами.  И то, что они придумали, идеально подходило для решения задачи с перекрученными квадратиками.  Но я понял, что на самом деле не понимаю, как работает стандартная генерация изображений из текста в речь. Таким образом, обе модели используют диффузионные модели, что
является передовым подходом в этой области .  Райан использует метод стабильной диффузии, о котором вы, возможно, слышали .  И это просто невероятно, насколько хорошо это работает.  Таким образом, когда вы задаете Stable Diffusion текстовую подсказку, например, «красный
кролик в синей шляпе-цилиндре», программа начинает с изображения чистого шума, а затем пытается определить, какой шум следует удалить.  Иными словами, какие пиксели нужно скорректировать, чтобы в итоге получить изображение, обладающее всеми характеристиками
вектора, предоставленного моделью обрезки.  Но это происходит не за один шаг. Иными словами, первая попытка получилась несколько размытой, серой и плоской.  Шум заглушает детали.  Или, в случае модели диффузии, практически не имеющей
подходящих признаков, она выдаст изображение, похожее на среднее значение всех изображений, удовлетворяющих вашему запросу. Иными словами, размытое пятно.  Затем вы берете это изображение и добавляете, скажем, 90% шума обратно, после чего просите модель предсказать,
сколько шума вы добавили в этот раз.  А после того, как вы отбросите это предположение, изображение станет немного чётче.  Это происходит потому, что изображение уже имеет некоторую крупномасштабную структуру, и этот уменьшенный шум, наложенный поверх, может начать
смещать его в сторону большей детализации в отдельных местах .  Затем вы повторяете это с 80% шума, потом с 70%, затем с 60%, и так далее до нуля, и в итоге получаете четкое изображение.  Итак, вот как текстовая подсказка превращается в изображение, но,
зная, что этот процесс происходит постепенно, шаг за шагом, к четкому изображению, вы можете немного повеселиться.  Они запрашивают у модели диффузии изображение пингвина, скажем, но ставят её на паузу после первой попытки.  Затем вас просят
показать, скажем, фотографию жирафа, и ставят игру на паузу после первой попытки.  Итак, у них есть размытое изображение, приближающееся к пингвину, и размытое изображение, приближающееся к... Затем они переворачивают изображение жирафа и объединяют их,
Это объединённое изображение становится входными данными для следующего шага как задачи генерации пингвинов, так и задачи генерации жирафов.  И вот, постепенно изображение превращается в нечто, напоминающее пингвина в одном ракурсе
и жирафа в другом.  Как здорово! Метод Райана отлично справляется с использованием прозрачных материалов.  Ну разве они не крутые?  Некоторые работают в нескольких cool are these? Some work in several orientations.
