---
title: 'Tutorial de inteligencia artificial para cualquier persona'
source: 'https://youtube.com/watch?v=cmep2mdip3k'
video_id: 'cmep2mdip3k'
date: 2026-09-18
duration_sec: 1160
channel: 'Platzi'
---

# Tutorial de inteligencia artificial para cualquier persona

> Source: [Tutorial de inteligencia artificial para cualquier persona](https://youtube.com/watch?v=cmep2mdip3k)

## Summary

This video demystifies the confusing landscape of AI chatbots and models, explaining the difference between apps like ChatGPT, Claude, and Gemini and the underlying reasoning models. It provides a practical guide on which tools to use, how to avoid common pitfalls like paying for ChatGPT without switching models, and how to leverage advanced features like Deep Research and multimodal capabilities.

### Key Points

- **AI is a skill, not an app** [00:30] — AI is not a single application like Excel; it's a skill. Just as Excel is the app and spreadsheets are the skill, AI chatbots are tools that require understanding how to use them effectively.
- **Top three AI apps** [01:12] — The most popular AI apps are ChatGPT, Claude, and Gemini. Grok, Copilot, and DeepSeek are not at the same level and are one or two generations behind.
- **Inference vs. reasoning models** [02:05] — Inference models respond immediately, while reasoning models 'think' first, providing deeper intelligence and better problem-solving but taking longer. Reasoning models are more powerful but not always necessary.
- **Default model trap** [03:25] — ChatGPT defaults to GPT-4O, which has average human-level intelligence. Many paying users never switch to advanced reasoning models like O3, wasting their money.
- **Model naming confusion** [04:12] — Model names are confusing: O3 is more advanced than O4 Mini and O4 Mini High. Claude has Opus 4 (high reasoning) and Sonnet 4 (equivalent to GPT-4O but more advanced).
- **Gemini models** [05:10] — Gemini has 2.5 Flash (fast, less intelligent) and 2.5 Pro (reasoning, more intelligent but slower).
- **Intelligence scores** [06:44] — The Artificial Analysis Intelligence Index scores models: GPT-4O scores 41, O3 Pro scores 71, and Gemini 2.5 Pro scores 70. DeepSeek's latest model is also competitive.
- **Context window explained** [07:25] — Each chat thread has a context window, which is the amount of text it can hold. GPT and Claude have ~120,000 tokens (about 60 pages), while Gemini 2.5 Pro has 1 million tokens (multiple books).
- **Context window includes responses** [09:50] — The context window includes both user input and model responses, so longer responses fill it up faster. More text can lead to better answers but also increases the chance of forgetting earlier context.
- **Multimodal models** [10:37] — Multimodal models can process and generate text, audio, video, and images. Example: uploading an Excel file and asking for charts without providing context.
- **Deep Research feature** [11:43] — Deep Research creates multiple chat threads to search the internet, books, and papers, asking clarifying questions. It's available in paid plans and can be life-changing, though it works about 50% of the time.
- **AI coding tools** [13:16] — Cursor is a must-have for developers, and Claude Code is revolutionary for terminal-based coding. For web design, Lovable and Vercel v0 are growing fast.
- **Specialized AI tools** [16:41] — For graphic design, Adobe Firefly is best; for video, Runway; for voice, ElevenLabs; for speech-to-text, Deepgram is preferred over Whisper.
- **Final advice** [17:33] — Never stick to one tool; test multiple and make them compete. Always use human judgment. Pay for tools, don't use free versions, and never stop learning.

### Conclusion

The key takeaway is to understand the difference between AI apps and models, actively switch to advanced reasoning models when needed, and continuously experiment with new tools. Avoid loyalty to any single AI, and invest in learning to stay ahead in this rapidly evolving field.

## Transcript

puede ser muy confuso, de repente uno tiene chat GPP, Cloud y Gemini y uno no sabe cuál usar y luego le dan a uno como un montón de modelos que están saliendo y todos esos modelos se llaman distinto entre sí, que significa O4, O3, O4 Mini High y cuando uno va y les da click salen en las pantallas y están enredados, es O4 Mini mejor que O3 y entonces O4 Mini High es o no es y en Anthropic D-Sopus 4 y en Gemini es Gemini y todo el tiempo está saliendo una nueva inteligencia artificial, una forma de mantenerse al día y los jefes dicen lo mismo siempre,
díganme qué instalo, qué es lo que tengo que instalar y díganmelo ya. Entonces vamos a explicar, arrancando porque la inteligencia artificial no es una app que se instala, no es como Excel. Una frase que he escuchado de algunos empresarios es que mencionan,
díganme eso como es, yo sé que para contabilidad y para finanzas yo tengo que usar Excel, entonces eso qué es, es chatGPP, es Copilot, es otra cosa. Y no, la inteligencia artificial no es una app, la inteligencia artificial es una habilidad. Así como Excel es la app, pero la habilidad es usar hojas de cálculo.
Y a pesar de que por ahora pareciera que Chachipiti es el más popular, no es ni el más poderoso ni probablemente el que gane, porque aún estamos al inicio de la batalla y esperar sería lo incorrecto. Así que hoy vas a aprender.
Arranquemos por cuáles son las apps más populares. Las tres apps más populares en este momento son Chachipiti, que es la que más gente usa, Club de Anthropic, que es la que gente hipster y con gusto usa, y Gemini de Google, que es la que tiene el modelo más poderoso en este momento.
Ustedes preguntarán, ¿y qué pasó con Grok? ¿Qué pasó con Copilot? ¿Qué pasó con Dipsy? Ninguno de estas aplicaciones está al nivel de CGPT, Cloud y Gemini. Si tú estás usando en este momento Grok, Copilot o Dipsy, estás una o dos generaciones atrás.
Pero esto es al momento de grabar este video. Las cosas pueden cambiar. Mucha gente usa Grok porque mucha gente es muy leal a Elon Musk. Y mucha gente usa Copilot porque toda la empresa usa Microsoft o porque es lo único que les permiten.
Pero la realidad es que ninguno de estos tres son los más populares. Los más populares en apps, que no es lo mismo que modelos, son ChatGPP, Cloud y Gemini. Pero estas son las aplicaciones que se comportan como chat.
Estas aplicaciones por debajo tienen que usar un modelo de inteligencia artificial para generar la respuesta. Hay dos tipos de modelo, los modelos de inferencia y los modelos de razonamiento. Un modelo de inferencia es cuando tú escribes un mensaje en ChatGPP, Cloud o Gemini y te empieza a responder.
Un modelo de razonamiento es cuando te escribes el mensaje y primero dice pensando y se pone a pensar y como que tú ves que está pensando en voz alta, como que escribe su proceso de pensamiento y luego te da una respuesta.
Los modelos de razonamiento generan inteligencia más alta, razonamiento más profundo, pueden resolver problemas más complejos y los resuelven mejor. Sin embargo, se demoran más y en ocasiones tú no necesitas tanta inteligencia.
Probablemente tú recuerdas que hace un par de años se popularizó agregar esto a los prompts, que cuando le escribías a la inteligencia artificial le agregaras al final think step by step o piensa paso a paso.
Esto ya no se necesita, no hay necesidad de hacerlo y no hace ninguna diferencia. Tú también puedes decir, a mí me funciona más este que otro y eso tampoco es una buena actitud. O sea, si es una buena actitud, mientras la estés actualizando todo el tiempo.
Si te quedas con uno porque te funcionó mejor y no estás probando a ver si las cosas cambiaron, está mal. Entonces, hablemos un poquito de cómo funcionan esos modelos entre cada una de las aplicaciones. En ChatGPT, tú ves acá arriba en la esquina superior izquierda que dice modelos.
Y en esos modelos le das clic y típicamente cuando tú usas ChatGPT gratuito o cuando lo pagas pero no le das clic, está por defecto seleccionado GPT-4O. GPT-4O tiene una inteligencia más o menos al nivel del promedio de la humanidad.
Y mucha gente paga por ChatGPT, pero nunca cambia el modelo. Es eso mismo que nada. Ustedes están pagando por perder la plata. Simplemente porque tienen un poquito más de uso, pero están perdiendo la plata. La razón número uno para usar KGPT pagado hay dos. Una es poder configurarlo de tal manera que KGPT no guarde los datos y los use en entrenamiento.
De esa manera se le pueden compartir información a Enterprise, información de la compañía privada. Y la otra es usar los modelos avanzados de razonamiento sin límites. O3 es el modelo más avanzado ahora mismo que tiene CGPT
Es más avanzado que O4 Mini y es más avanzado que O4 Mini High ¿Tiene sentido? No tiene sentido, lo entiendo perfectamente En el caso de Antropic hay dos modelos Cloth Opus 4 y Cloth Sonet 4
Reemplazaron al modelo 3.7 Sonet es el equivalente a GPT-4O en CGPT Pero es mucho más avanzado en cuanto a inteligencia Y Opus 4 es el equivalente a O3 es un modelo de muy alto razonamiento.
Yo sé que algunos de ustedes en este momento están diciendo ¡Wow! Yo pago por CGPT y estoy perdiendo la plata. Pues sí, es porque ustedes no conocían este concepto. Sigan el video y van a aprender m cosas Cloud Opus 4 es un modelo de razonamiento por defecto Cloud Sonnet 4 se le puede pedir que razone pero no es de razonamiento por defecto complejo Estoy completamente de acuerdo con ustedes
Pero no se rindan. Esto realmente tiene sentido. Lo que no tiene sentido es la forma en la que le ponen los nombres. Y si dan Google, Gemini tiene dos modelos típicamente. Un modelo que se llama 2.5 Flash y otro modelo que se llama 2.5
Pro. Flash es el que infiere sin razonar y su inteligencia es reducida. pero es el que razona antes de responder y su inteligencia es muy grande pero es un poco más lento este gráfico les muestra a ustedes
el rendimiento de las inteligencias artificiales desde la que salió en julio del 2023 hasta la más reciente en preguntas de ciencia de nivel de doctorado yo he mostrado varias veces este gráfico
en otros videos del canal de Platzi y en cursos de Platzi aquí ustedes van a ver que no hay aplicaciones de chat ustedes van a ver la palabra chatGTT en este gráfico. No van a ver la palabra Cloth solita.
Aquí van a colocar los nombres de los modelos de inteligencia artificial. Y lo que quiero que vean es que en toda la mitad es donde está GPT-4O, que tiene el 50% de rendimiento comparado con un humano.
Este es el que ustedes usan cuando usan CheGPT. No importa que lo paguen o no, y no cambian el modelo. Por eso están perdiendo la plata. Y luego acá arriba están los modelos de razonamiento. Por ejemplo, ahí arriba está
el modelo O3, las bolitas enfocadas son las de los modelos de OpenAI, que es lo que ustedes logran cuando pagan. Si nos acercamos un poco más, vemos que están los modelos más avanzados, Gemini 2.5 Pro, Cloud 4, incluso está GROP 3, aunque está un poquito más abajo,
y los modelos de OpenAI O3. Existe otro chart, otro análisis, que se llama Artificial Analysis Intelligence Index. Este también me gusta mucho porque es bastante rápido de entender, que le asigna un puntaje promediado, ponderado, de múltiples evaluaciones.
Hay muchas evaluaciones que se usan para evaluar la inteligencia de un modelo. Y aquí están usando varias de ellas para más o menos promediar. Miren, por ejemplo, cómo el modelo menos inteligente en este gráfico es GPT-4O,
que es el de ChatGPP, que es el modelo en el que ustedes usan cuando no pagan o cuando pagan y no cambian el modelo. Tiene 41 puntos de inteligencia. Y miren, por ejemplo, el modelo O3 Pro, que es el último modelo de OpenAI, tiene 71 puntos.
O3, que tiene 70, igual que el de 2.5 Pro. La última versión del modelo de China, Dixie GR1, la versión de mayo del 2035, se acerca bastante, que honestamente es impresionante. Y por detrás están el resto de modelos.
El siguiente concepto a entender, ya que entendimos la diferencia entre un chavio y un modelo, es cuánta inmemoria tienen los modelos de inteligencia artificial. Hay un problema cuando uno usa ChatGPT y es que ChatGPT la gente cree que se acuerda de todo
porque en ocasiones ustedes le preguntan, cuéntame qué sabes de mí y empieza a decirle tú eres una persona hermosa, inteligente, con unos músculos definidos y una cara angelical Eso no viene de que se acuerde de todas las conversaciones Eso viene de que guarda microfrases chiquititas de las conversaciones
y las guarda en una cosa que ChatGPT llama la memoria Pero la realidad es que cada conversación de chat, cada hilo que ustedes tienen con la inteligencia artificial es con una memoria completamente nueva. Y eso se llama la ventana de contexto.
La ventana de contexto es cuántas letras, palabras, sílabas se pueden colocar dentro de una conversación hasta que se acaba. Yo imagino que si ustedes han tenido conversaciones muy largas
con alguna inteligencia artificial, les ha pasado que la ventana les dice esta conversación es demasiado larga y ya no puede continuar. Empieza una conversación nueva o se va a perder el contexto. Por ejemplo, si alguno de ustedes tiene como novio o novia
Una inteligencia artificial no se va a acordar de todo porque se va a perder el contexto. Las ventanas de contexto son uno de los problemas más difíciles de inteligencia artificial porque depende de la memoria y de la cantidad de chips que tenga una empresa. Y ese es un problema que puede costar, honestamente, miles de millones de dólares.
Lo que ustedes tienen que entender de una manera básica cuando están a estar arrancando es que modelos como los GPT de OpenAI o Anthropic Cloud, esos modelos tienen una ventana de contexto más o menos de 120.000 tokens.
120.000 tokens es algo así como un poquito menos de un libro, como 60 páginas de texto. Donde Gemini 2.5 Pro de Google tiene una ventana de contexto de un millón de tokens,
que pueden ser múltiples libros de texto, lo cual es bastante increíble. El lío es que entre más texto ustedes le agregan a una de estas ventanas, más probable es que el modelo se le olvide algunos componentes de ese contexto.
Ese es un problema que se llama el problema de la aguja en el pajar, o needle in a haystack. Y ese problema todav lo est solucionando los laboratorios Por eso es que por ejemplo para manejar contabilidad finanzas estos modelos a veces se equivocan y toca estar verificando constantemente En mis experimentos Google y el modelo Gemini 2 Pro es el mejor pero ten en mente que esto cambia todo el tiempo
Lo otro que tienen que saber de la ventana de contexto es que la ventana de contexto no solamente guarda lo que ustedes le escriben, sino también cuenta lo que el modelo responde. Lo que el modelo responde y lo que el modelo piensa y lo que ustedes escriben, ambas cosas son parte de la ventana de contexto.
Entonces, entre más texto responde Chagipiti o Claude o Gemini, pues más se agrega la ventana de contexto. Pero también entre más texto escribe, pues más inteligente es la respuesta. Hay otro concepto más que se llaman los modelos multimodales. Hoy en día la mayoría de los modelos son multimodales. ¿Pero eso qué significa? Un modelo multimodal es un modelo que puede recibir más cosas que solo texto. Por ejemplo, que puede recibir audio, video, imágenes o archivos. Y que se puede responder con audio, video, imágenes o archivos.
Entonces, por ejemplo, cuando en Drop o en ChatGPT o en MetaAI tú le dices créame una foto de esto, hazme una imagen de esto y genera una imagen, entonces eso es un modelo multimodal. De texto creo una imagen.
O cuando le hablas por voz y te responde en voz, pues de voz creo texto y de texto creo voz. Eso es un modelo multimodal. Mi uso favorito de los modelos multimodales es hacer Excel avanzado sin saber Excel. entonces ustedes pueden a casi que cualquiera
de estas aplicaciones de chat con un modelo de razonamiento arrastrarle un archivo de Excel y decirle cosas como este prompt que tengo acá, créanme todos los gráficos necesarios para entender mejor los datos de esta hoja de cálculo, miren que no estoy dando contexto de nada y me empieza a generar
esos datos, pruébenlo, hay un curso de práctica que se llama el curso de prompt engineering que les enseña muchísimos más trucos de una manera profunda si ustedes quieren hacer esto muy bien vayan y tomen el curso de prompt engineering
Esto yo creo que debería ser obligatorio para todas las personas que trabajan detrás de una computadora, tomar discurso de Tom Engineering. Hay unas características nuevas que quién sabe cuánto vayan a durar, pero una muy popular se llama Deep Research, que ustedes ven acá en la imagen.
Deep Research lo que hace es que crea múltiples chats por detrás, múltiples hilos de chat, donde empieza a buscar en internet, a buscar en libros que tenga internamente, a buscar en papers, a hacer una búsqueda completa.
En ocasiones te hace preguntas, te intenta tratar de entender qué más quieres hacer, etc. Te evalúa, no solamente te responde. Yo, por ejemplo, he usado Dean Research para presentar impuestos, para revisar las finanzas de Platzi
y luego compararlas con otras compañías para hacer análisis de competidores y entender qué cosas podemos estar haciendo diferente, etc. Pruébenlo, es una de las opciones que solamente tienen acceso si la pagan. A mí me da resultados el 50% del tiempo.
y la mitad del tiempo es medio inútil y la otra mitad realmente cambia la vida. Hay un curso de Platzi que se llama el curso de tips y trucos de inteligencia artificial donde yo tengo esta clase de acá, donde explico cómo hacer con la inteligencia artificial,
te da preguntas antes de responder. Si ustedes no pagan, usen esta clase del curso de tips y trucos de inteligencia artificial para hacer una cosa relativamente similar. Es una técnica súper interesante.
Ustedes probablemente han visto que en ocasiones hace unos años nos decían que valía la pena decirle a la inteligencia artificial en el prompt qué tipo de persona era, como eres un experto en tiranzas, eres un experto en inteligencia artificial, eres un experto en cosméticos,
eres un experto en turismo, y luego pedirle ayuda. Eso solía ser muy útil, pero yo creo que con las últimas actualizaciones de los modelos ya no es tan necesario. Mi sugerencia es que hagan la prueba de ponerlo y quitarlo a ver qué resultado les parece mejor.
Y luego hay aplicaciones que usan estos modelos de una manera súper interesante. Si ustedes son desarrolladores de software, sin la menor duda ya han escuchado de Cursor. Si ustedes programan y no están usando una herramienta de código con AI,
es como que llegue la computación y estén decidiendo no aprender a usar computadores. Esto lo deben hacer. Cursor es mágico. Yo entiendo que al principio Cursor es como muy impactante. ¿Será que si voy a editar mi código? ¿No será que crea código basura?
Pero la gran mayoría de las cosas malas de Cursor son mitos. Platzi recientemente lanzó un curso de Cursor y tuvimos a ingenieros del equipo de Cursor con nosotros hablando de cómo hacer esto bien.
Las primeras 200 personas que completen el curso de Cursor van a tener una mentoría con el equipo de ingenieros de Cursor. Así que ve y toma el curso, está recién hecho, no lo duden. Si ustedes no son programadores, sáltense dos minutos en el video.
Pero para los programadores, Cloud Code ha sido una revolución. Esto es distinto a un editor de código. Es más como tener un programador tercero en el computador. Abres la terminal y le dices a Cloud Code hazme esto anal esto c esto Es incre realmente impresionante Y 24 horas atr de este video Jenny Knight lanz un competidor a Cloud Code que se llama Jenny Knight CLI o Command Line Interface
Súper interesante, relativamente similar. Tenemos en YouTube un tutorial, que es el tutorial de Cloud Code, que explica cómo llevarlo paso a paso. Si tú estás haciendo páginas web y necesitas una forma muy rápida de diseñar sitios web,
los dos sitios que más están creciendo en este momento es LogoBall, que está bastante bueno, y Vercel B0. Y aquí les quiero pedir un favor. Pueden ir a Twitter y hablarle a Guillermo Rauch y decirle a Guillermo Rauch que yo le mando a decir
que me encantaría entrevistarlo para hablar de cómo ha avanzado B0 acá en Platzi. Cuéntenle. Mi relación con Guillermo Rauch a lo largo de los años ha sido muy extraña, pero me encantaría que la comunidad Platzi, así como tuvimos al equipo de Cursor y tuvimos al equipo de N8N,
deberemos tener el equipo de Vercel. Entonces, vale, cuéntenle a Guillermo Rauch para que venga. Algunas de estas herramientas, Lobo Bolivé 0 de Vercel son súper sencillas, pero Cloud Code y Gemini necesita que entiendas la terminal. Si no entiendes la terminal no lo vas a poder usar.
Obviamente nosotros les enseñamos con el curso de introducción a la terminal y línea de comandos cómo usar la terminal. También necesitas las bases de la ingeniería de software para poder desarrollar software. Y Platzi lanzó este año un curso de fundamentos de ingeniería de software que te lo enseña a profundidad.
Este curso lo puede tomar cualquier persona desde los 10 años hasta los 80 años para entender cómo funciona el software por dentro. Y no importa lo que la gente te diga, necesitas saber programar.
Aprender a programar no es opcional. Por último, si tú realmente quieres desarrollar esto a profundidad, vale la pena que aprendas cómo funcionan los modelos de lenguaje. Se llaman LLMs. Este es un curso avanzado. Este no es un curso para gente principiante.
El curso Fundamentos de LLM, mi esperanza es que cree una generación de ingenieros de inteligencia artificial. Esta es la primera vez que tenemos un curso de inteligencia artificial tan puro en español.
Por favor, aprovechenlo. Y entiendo, en este punto ustedes van a estar como, esto es demasiado, son muchas herramientas, díganme que instalar por Dios. Tranquilos, simplemente sigan viendo los videos que lanzamos en Platzi y van a estar bien. Ustedes tienen algunas preguntas como, ¿en otros lugares qué pasa si lo voy a usar en diseño gráfico, en video?
Y tenemos la respuesta. La mejor forma de usarlo en diseño gráfico pareciera que va a ser Adobe Firefly. De hecho, es muy bueno para crear haces como haces de animación y cosas por el estilo. Y lentamente Adobe está integrando esto en toda su suite de herramientas.
Para creación de video, hay un equipo, entre ellos latinoamericanos, uno de ellos chileno, que es el equipo de Runway. Runway está creando en mi opinión de los mejores mecanismos para usar videos sobre todo en entornos de marketing y cosas por el estilo
cuando se está creando voz hay varias opciones en este momento el líder del mercado es 11Dubs para crear voces artificiales si ustedes están viendo desde una perspectiva técnica el mejor sistema de voz a texto desde una perspectiva técnica sería ser Whisper
que es un API de OpenAI realmente bueno pero últimamente en Platinum se está aprobando DeepRAM y DeepRAM está mucho mejor los subtítulos de los cursos, los transcripts y muchas de las cosas que usamos internamente los hace DeepRamp, está re bueno
luego ahí les quiero dar un par de comentarios ya para cerrar el primero es, no se queden nunca con una sola herramienta prueben varias y de hecho pónganlas a competir cuando yo hice mis impuestos, por ejemplo mis impuestos son muy complejos porque tenemos que presentar impuestos
en dos países diferentes entonces yo puse tres diferentes mecanismos de inteligencia artificial a generarme mi análisis de impuestos y luego los puse a conversar entre los tres al principio copiando y pegando pero luego con Cloud Code. Programé un pequeño sistema que los hizo compartir la información.
Vi cómo uno de ellos se disculpó con el otro y eventualmente terminaron generando una respuesta. Es muy bonito. Usa siempre tu criterio humano. La razón por la que yo no uso tanto apps e intento usar los modelos tan cerca al modelo como sea posible
es porque quiero estar haciendo un loop iterativo constante, un ciclo eterno de evaluación con criterio humano. Si tú no tienes criterio humano, de pronto tu trabajo no debería existir. y obviamente que debería existir
los humanos multiplicamos esto paga, no usen versiones gratis esto es muy barato y las empresas están desesperadas por contratar gente que entienda todo lo que yo acabo de explicar si tú entiendes
lo que yo acabo de explicar y no tienes empleo lo que tienes que hacer es enviarle mensajes a los hijos de cualquier compañía las que hacen galletas, las que hacen finanzas cualquier compañía y diles yo entiendo esto, ustedes deberían contratarme
para hacer automatización de AI en la compañía paguen, no usen versiones gratuitas no te acostumbres a ninguno a mí me rompe la cabeza la gente que es leal a un modelo de AI eso no tiene sentido, porque estas cosas cambian
todo el tiempo sin parar, no se acostumbren y no crean que porque les funciona un rato, significa que siempre les va a funcionar, a lo que sí tienes que acostumbrarte es a nunca parar de aprender
esto no para y esto no va a parar pero con Platzi te ayudamos a que aunque no pare no duela
