[00:02] которое бы хорошо смотрелось на этой поверхности при обеих ориентациях этих извилистых квадратов? Я получил электронное письмо от Даниэля Генга и одновременно личное сообщение в Discord от Райана Бургерта. Оба они нашли подходящие изображения, созданные с помощью генеративного искусственного интеллекта. Введите текстовую [00:15] подсказку, и вы получите изображение, например, Midjourney или Stable Diffusion. Оказалось, что Дэниел и Райан работали над проблемой создания оптических иллюзий с помощью генеративного ИИ, разбирая модели на части и экспериментируя [00:29] с их внутренними механизмами. И то, что они придумали, идеально подходило для решения задачи с перекрученными квадратиками. Но я понял, что на самом деле не понимаю, как работает стандартная генерация изображений из текста в речь. Таким образом, обе модели используют диффузионные модели, что [00:42] является передовым подходом в этой области . Райан использует метод стабильной диффузии, о котором вы, возможно, слышали . И это просто невероятно, насколько хорошо это работает. Таким образом, когда вы задаете Stable Diffusion текстовую подсказку, например, «красный [00:55] кролик в синей шляпе-цилиндре», программа начинает с изображения чистого шума, а затем пытается определить, какой шум следует удалить. Иными словами, какие пиксели нужно скорректировать, чтобы в итоге получить изображение, обладающее всеми характеристиками [01:07] вектора, предоставленного моделью обрезки. Но это происходит не за один шаг. Иными словами, первая попытка получилась несколько размытой, серой и плоской. Шум заглушает детали. Или, в случае модели диффузии, практически не имеющей [01:21] подходящих признаков, она выдаст изображение, похожее на среднее значение всех изображений, удовлетворяющих вашему запросу. Иными словами, размытое пятно. Затем вы берете это изображение и добавляете, скажем, 90% шума обратно, после чего просите модель предсказать, [01:36] сколько шума вы добавили в этот раз. А после того, как вы отбросите это предположение, изображение станет немного чётче. Это происходит потому, что изображение уже имеет некоторую крупномасштабную структуру, и этот уменьшенный шум, наложенный поверх, может начать [01:50] смещать его в сторону большей детализации в отдельных местах . Затем вы повторяете это с 80% шума, потом с 70%, затем с 60%, и так далее до нуля, и в итоге получаете четкое изображение. Итак, вот как текстовая подсказка превращается в изображение, но, [02:02] зная, что этот процесс происходит постепенно, шаг за шагом, к четкому изображению, вы можете немного повеселиться. Они запрашивают у модели диффузии изображение пингвина, скажем, но ставят её на паузу после первой попытки. Затем вас просят [02:16] показать, скажем, фотографию жирафа, и ставят игру на паузу после первой попытки. Итак, у них есть размытое изображение, приближающееся к пингвину, и размытое изображение, приближающееся к... Затем они переворачивают изображение жирафа и объединяют их, [02:29] Это объединённое изображение становится входными данными для следующего шага как задачи генерации пингвинов, так и задачи генерации жирафов. И вот, постепенно изображение превращается в нечто, напоминающее пингвина в одном ракурсе [02:45] и жирафа в другом. Как здорово! Метод Райана отлично справляется с использованием прозрачных материалов. Ну разве они не крутые? Некоторые работают в нескольких cool are these? Some work in several orientations.