Intentando entender el zoológico de modelos de IA: OpenAI, Anthropic, Google, DeepSeek, Mistral y Cohere
Hace apenas dos años la decisión era sencilla: usar ChatGPT o no usar ChatGPT.
Hoy la situación es bastante diferente.
Si uno empieza a explorar herramientas para automatizar trabajo, construir agentes, generar contenido, programar con IA o crear productos, rápidamente aparecen nombres como GPT-5, Claude Sonnet, Gemini, DeepSeek, Mistral, Cohere y una lista cada vez más larga.
Para alguien que no trabaja en software esto puede resultar bastante confuso.
Incluso para quienes llevamos años en tecnología, seguir el ritmo de los nuevos modelos requiere cierto esfuerzo.
Hace unos días me encontré pensando en esto mientras evaluaba alternativas para algunos agentes que estoy construyendo para SparkIO y otros proyectos. Mi objetivo era simple: entender qué modelos valen la pena para cada tarea y cuándo realmente tiene sentido pagar más.
Lo primero que descubrí es que muchas veces estamos comparando cosas similares con nombres completamente distintos.
Además, detrás de esos nombres hay empresas muy distintas.
OpenAI fue quien popularizó el uso masivo de la IA con ChatGPT. Anthropic nació a partir de investigadores que dejaron OpenAI para enfocarse en seguridad y alineación de modelos. Google llevaba años investigando inteligencia artificial antes de lanzar Gemini. Mistral apareció en Francia con la ambición de construir una alternativa europea. DeepSeek sorprendió a la industria desde China demostrando que era posible competir con costos mucho más bajos. Y Cohere eligió un camino menos visible, enfocándose principalmente en clientes corporativos.
Cuando uno entiende quién está detrás de cada modelo, algunas diferencias empiezan a tener más sentido.
Anthropic ganó la batalla del marketing
Tengo que admitir que Anthropic hizo algo muy inteligente con los nombres.
Sus modelos se llaman:
- Haiku
- Sonnet
- Opus
No hace falta leer documentación para entender la jerarquía.
Haiku es rápido y económico.
Sonnet es el punto de equilibrio.
Opus es el modelo más potente.
Incluso si mañana aparece Haiku 5, Sonnet 5 u Opus 5, cualquiera entiende inmediatamente dónde encaja cada uno.
OpenAI tomó otro camino.
Tenemos GPT-4, GPT-4o, GPT-4.1, GPT-4.1 Mini, GPT-5, GPT-5 Thinking, GPT-5 Instant, o4-mini y otros nombres que van apareciendo con cada generación.
Desde una perspectiva técnica tiene sentido.
Desde una perspectiva humana, cuesta bastante más recordarlo.
Quizás no sea casualidad.
Anthropic fue fundada por investigadores que venían del mundo académico y de la investigación en IA. Da la impresión de que alguien dentro de la empresa entendió que los usuarios comunes no quieren memorizar códigos de producto. Quieren recordar conceptos.
Si alguien me pregunta dentro de seis meses cuál era el modelo intermedio de Anthropic, probablemente recuerde Sonnet.
Si me pregunta cuál era la diferencia entre GPT-4.1, GPT-4o y GPT-4.1 Mini, probablemente tenga que pensarlo unos segundos.
Después de varios meses usando ambas plataformas, sigo recordando perfectamente qué hace Sonnet y todavía tengo que pensar un poco cuando veo algunas variantes de GPT.
Una equivalencia aproximada
No existe una equivalencia perfecta entre proveedores, pero para alguien que recién empieza, esta tabla mental suele funcionar bastante bien.
Anthropic OpenAI Uso típico Haiku GPT Mini / modelos económicos Automatización masiva, clasificación, extracción Sonnet GPT estándar Coding, agentes, análisis, trabajo diario Opus GPT razonamiento avanzado Problemas complejos, investigación, arquitectura
La realidad es que Sonnet se convirtió en una especie de punto dulce para muchos desarrolladores.
De hecho, Anthropic ha ido acercando cada vez más las capacidades de Sonnet a Opus mientras mantiene costos considerablemente menores.
OpenAI tiene una ventaja difícil de ignorar: fue la empresa que logró que la inteligencia artificial dejara de ser una tecnología para investigadores y se convirtiera en una herramienta cotidiana.
Muchas de las personas que hoy utilizan Claude, Gemini o DeepSeek comenzaron usando ChatGPT.
Algo parecido a lo que ocurrió con Google en los primeros años de Internet: quizás ya no sea la única opción, pero fue la puerta de entrada para gran parte del mercado.
El problema de los modelos baratos
Hay algo que noté haciendo desarrollo asistido por IA.
Los modelos económicos suelen funcionar muy bien… hasta que dejan de funcionar.
Por ejemplo, me pasó varias veces con modelos pequeños.
Les planteaba un problema de programación.
Intentaban resolverlo.
Volvían a intentar.
Generaban otra variante.
Después otra.
Y otra.
Después de varios intercambios seguían girando alrededor del problema.
Entonces copiaba exactamente el mismo contexto en Sonnet y encontraba la causa raíz prácticamente de inmediato.
La diferencia no era que el modelo pequeño no supiera programar.
La diferencia era capacidad de razonamiento.
Ese patrón se repite bastante.
Los modelos económicos suelen ser excelentes para tareas repetitivas y bien definidas.
Los modelos más grandes suelen ser mejores cuando el problema requiere entender múltiples variables, identificar patrones o encontrar errores sutiles.
¿Dónde entra DeepSeek?
DeepSeek probablemente sea el actor más interesante del último año.
Lo interesante de DeepSeek no es solamente el modelo.
Es el efecto que produjo.
Durante años existió la sensación de que competir en inteligencia artificial requería inversiones prácticamente ilimitadas.
La aparición de DeepSeek obligó a muchos a replantear esa idea.
De repente apareció un competidor capaz de ofrecer resultados sorprendentemente buenos con una estructura de costos muy diferente.
Su propuesta es simple.
Intentar acercarse al rendimiento de los modelos premium a una fracción del costo.
Y para muchos casos de uso lo logra sorprendentemente bien.
Particularmente en programación.
No me sorprendería que una gran cantidad de agentes de prospección, automatización, clasificación de leads o análisis preliminar terminen ejecutándose sobre DeepSeek mientras reservan modelos premium para los pasos finales.
De hecho, cada vez veo más arquitecturas híbridas:
- DeepSeek para recolección de datos.
- DeepSeek para clasificación.
- DeepSeek para enriquecimiento.
- Sonnet o GPT para generar el informe final.
Desde una perspectiva económica tiene mucho sentido.
Los costos están convergiendo
Hace un tiempo la diferencia entre proveedores era enorme.
Hoy las cosas son más competitivas.
Tomando precios públicos de API durante 2026, Anthropic ubica aproximadamente:
- Haiku: USD 1 por millón de tokens de entrada.
- Sonnet: USD 3 por millón de tokens de entrada.
- Opus: USD 5 por millón de tokens de entrada.
En OpenAI encontramos algo similar:
- GPT Mini: alrededor de USD 0.40 por millón de tokens de entrada.
- GPT estándar: alrededor de USD 2 por millón de tokens de entrada.
- GPT premium: alrededor de USD 2.50 a 5 por millón de tokens de entrada.
Cuando uno mira únicamente el precio por token, las diferencias ya no son tan dramáticas como hace dos años.
La verdadera diferencia suele aparecer en productividad.
Si un modelo más caro resuelve algo en una interacción y el modelo barato necesita diez, el costo efectivo termina siendo distinto.
Los otros jugadores
Después aparecen tres actores que vale la pena seguir de cerca.
Google juega una partida distinta. No necesita demostrar que sabe construir modelos. Necesita descubrir cómo integrar esa capacidad en un ecosistema que ya utilizan miles de millones de personas todos los días.
Gemini probablemente sea el modelo que más ventaja puede obtener de estar conectado con correo electrónico, documentos, calendarios, mapas, búsqueda y otros servicios que muchas personas ya usan a diario.
Mistral representa algo diferente.
Es probablemente la apuesta europea más seria en el espacio de modelos fundacionales y se ganó rápidamente el respeto de muchos desarrolladores por la calidad de sus modelos abiertos.
Muchos equipos la están utilizando cuando quieren reducir dependencia de los grandes proveedores estadounidenses o cuando buscan ejecutar modelos de forma más flexible.
Cohere, por otro lado, suele pasar desapercibida para quienes consumen IA desde aplicaciones como ChatGPT o Claude.
Sin embargo, aparece constantemente en conversaciones empresariales donde el foco está puesto en búsqueda documental, gestión del conocimiento e integración corporativa.
No tiene la visibilidad de OpenAI o Anthropic, pero es una empresa que muchas organizaciones grandes siguen de cerca.
Entonces, ¿cuál conviene?
Después de probar bastante, mi recomendación práctica sería algo así.
Si recién estás empezando:
- ChatGPT o Claude.
- No te compliques demasiado.
Si hacés mucho coding:
- Claude Sonnet sigue siendo difícil de superar.
- GPT está muy cerca dependiendo del tipo de trabajo.
Si estás construyendo agentes con mucho volumen:
- DeepSeek merece una prueba seria.
- El ahorro puede ser significativo.
Si querés correr modelos localmente:
- Mistral.
- Gemma.
- Qwen.
Aunque ahí empezás a intercambiar costo de tokens por costo operativo, mantenimiento, hardware y disponibilidad.
Y ese es un detalle que muchas veces se pasa por alto.
Mantener una mini PC funcionando 24 horas por día también tiene un costo.
No siempre económico.
Muchas veces mental.
Mi conclusión por ahora
La industria parece estar entrando en una etapa interesante.
Ya no existe un único ganador claro.
Tampoco existe un modelo perfecto para todo.
Lo que estoy viendo cada vez más es una arquitectura de múltiples modelos.
Un modelo económico para procesar volumen.
Un modelo intermedio para la mayoría de las tareas.
Un modelo premium reservado para los momentos donde realmente agrega valor.
Curiosamente, eso se parece bastante a cómo diseñamos sistemas de software desde hace años.
No ponemos la base de datos más potente para cada operación.
No usamos el servidor más grande para cada servicio.
Optimizamos cada componente según su función.
Quizás la próxima habilidad importante para quienes construimos productos con IA no sea aprender un modelo específico.
Quizás sea aprender a combinar varios.
Hace apenas dos años la conversación era “¿usas ChatGPT?”.
Hoy la pregunta empieza a ser otra.
¿Qué modelo estás usando para cada tarea?
La respuesta ya no suele ser uno solo.
Y probablemente esa sea una señal de que el mercado está empezando a madurar.
Related Sparkio Products
Founder Interactive business history simulator inspired by the stories and decisions behind the world's most influential companies.
AppGrid Platform designed to help independent developers connect their products with potential customers.