Conoce los modelos que hay detrás de las herramientas: fabricantes, modalidades y qué herramientas los usan. Navega por fabricante o modalidad y verifica en las páginas de cada herramienta.
OpenAI
El modelo más reciente y de frontera de OpenAI, publicado en septiembre de 2026 con un nivel Astra Pro; es el predeterminado insignia de ChatGPT y Codex.
OpenAI
La línea actual de la API de OpenAI desde julio de 2026, dividida en los niveles Sol, Terra y Luna según capacidad y coste, que hereda el razonamiento y la llamada a herramientas de GPT-5.
OpenAI
Modelo de OpenAI lanzado el 2025-08-07 que sustituyó a GPT-4o como insignia de ChatGPT desde el primer día y asigna a cada petición el esfuerzo de razonamiento necesario.
OpenAI
El modelo de cuarta generación de OpenAI, destacado en razonamiento y calidad de escritura, usado como motor predeterminado por muchas herramientas de escritura, programación y conocimiento.
OpenAI
Los primeros modelos de pesos abiertos de OpenAI, publicados el 2025-08-05 en variantes de 120b y 20b con licencia Apache 2.0, libres de autoalojar y ajustar.
OpenAI
El modelo de imágenes de OpenAI del 2026-09-08 que reemplazó a DALL·E 3 como generador interno de ChatGPT, con mejor adhesión a instrucciones largas y texto dentro de la imagen.
OpenAI
El tercer modelo texto a imagen de OpenAI, retirado de forma permanente de la API el 2026-05-12; las imágenes de ChatGPT usan GPT Image 2.5 y Microsoft rebautizó Bing Image Creator como Image Creator from Designer.
OpenAI
El segundo modelo texto a imagen de OpenAI, con edición y variantes, que abrió la comercialización de la difusión; se apagó junto a DALL·E 3 el 2026-05-12.
OpenAI
Nombre colectivo de la familia texto a imagen de OpenAI, de DALL·E 2 a DALL·E 3; ambas referencias se retiraron el 2026-05-12 y su sucesor es GPT Image 2.5.
OpenAI
Sora 2 y Sora 2 Pro (2025-09-30) elevaron el realismo físico y la sincronía de audio y vídeo, pero la app de consumo cerró el 2026-04-26 y la API se retira desde el 2026-09-24.
Anthropic
La familia Claude de Anthropic, conocida por su contexto largo y su escritura y programación; hoy la integran Claude Opus 5, Claude Sonnet 5 y el nivel 4.5, muy adoptada por herramientas para desarrolladores.
Anthropic
El modelo insignia de Anthropic desde el 2026-07-24, el más fuerte en agentes de larga duración y razonamiento difícil, y también el más caro y lento de llamar.
Anthropic
El nivel principal de la generación Claude 5, publicado en junio de 2026, cercano a Opus 5 con menor coste y latencia; suele ser el predeterminado en código y agentes.
Anthropic
El insignia de la generación anterior (noviembre de 2025), un salto en programación prolongada y agentes multipaso que marcó la referencia de código antes de Claude 5.
Anthropic
El modelo principal previo (septiembre de 2025), equilibrado en razonamiento, escritura y programación, que heredó de Claude 3.5 Sonnet los predeterminados de herramientas como Cursor.
Anthropic
El nivel ligero del 2025-10-15: respuestas casi instantáneas con capacidad cercana al anterior insignia, ideal para conversación masiva y subtareas delegadas.
Anthropic
Nombre colectivo de la generación Claude 3.5, sobresaliente en documentos largos y comprensión de código, que salió de servicio con la ventana de retiro del 2025-10-28.
Anthropic
Nombre colectivo de la generación Claude 3, la primera con comprensión visual, que abarca Haiku, Sonnet y Opus; Sonnet se retiró el 2025-07-21 y la línea ya no actúa como nivel insignia.
La familia nativamente multimodal de Google: en texto mandan Gemini 3 Pro, 2.5 y los niveles Omni, mientras la imagen va a Nano Banana Pro, el vídeo a Veo y la música a Lyria.
El modelo insignia de Google desde el 2025-11-18, por delante de la generación 2.5 en razonamiento y multimodalidad; la categoría Ultra se abandonó en favor del nombre Pro.
El nivel rápido omnímodo de Google de 2026, que unifica entrada de texto, imagen, audio y vídeo para interacción multimodal en tiempo real con baja latencia.
El insignia anterior del 2025-03-25, un modelo de razonamiento con contexto largo y presupuestos de pensamiento que aún motoriza muchas herramientas de terceros.
El nivel rápido de la generación 2.5 desde junio de 2025, que atiende razonamiento y multimodalidad de alta concurrencia a bajo coste y latencia.
El modelo de imagen de Google (id gemini-3.1-flash-image), popularizado como Nano Banana, que reemplazó a Imagen 4 como referencia de imagen del fabricante con gran consistencia entre varias imágenes y edición conversacional.
Google DeepMind
La versión actual de vídeo de Google, que mantiene la generación conjunta de imagen y audio y el control de cámara de Veo 3 con mejor consistencia de sujeto y control de referencia y fotogramas.
Google DeepMind
El primer modelo de vídeo con audio integrado de Google DeepMind, de calidad y coherencia punteras; veo-3.0 se cerró el 2026-06-30 y la versión vigente es Veo 3.1.
Google DeepMind
El modelo de generación musical de Google DeepMind, que produce pistas completas con voz a partir de indicaciones de texto para herramientas creativas como Flow y la app Gemini.
Meta
La familia de pesos abiertos de Meta, con un ecosistema enorme; es la base de facto para despliegues locales y autoalojados, y su generación más reciente es Llama 4.
Meta
La generación de pesos abiertos de Meta publicada el 2025-04-05: Scout y Maverick pudieron descargarse ese mismo día, mientras Behemoth quedó explícitamente en entrenamiento.
xAI
El modelo estrella actual de xAI según su documentación (2026), que amplía el razonamiento y la información en tiempo real de la serie 4 en Grok y X.
xAI
El modelo de cuarta generación de xAI, con razonamiento reforzado, información en tiempo real y datos de X integrados, aunque hoy queda dos revisiones detrás de Grok 4.6.
xAI
El modelo de tercera generación de xAI, orientado a preguntas y respuestas en tiempo real con un estilo directo.
xAI
La línea de generación de imagen, vídeo y voz de xAI, un producto de consumo pensado para convertir texto en clips rápidos con audio.
Mistral
El actual modelo estrella de pesos abiertos de Mistral (versión v25.12), fuerte en multilingüismo, razonamiento y llamada a funciones, autoalojable gracias a sus pesos publicados.
Mistral
El nombre genérico del nivel estrella de Mistral, popular en despliegues empresariales europeos; en la práctica esa cadena resuelve hoy en Mistral Large 3.
Mistral
El modelo ligero de Mistral: eficiente y de bajo coste, adecuado para despliegues locales y en el borde.
Mistral
El modelo específico de código de Mistral (lanzamiento 25.08), para autocompletado en línea y contexto de repositorio; backend habitual de los plugins de IDE.
Mistral
El modelo de audio de Mistral, que envía el habla directamente a un modelo multimodal para transcribir y responder preguntas habladas en varios idiomas.
DeepSeek
La línea principal abierta de DeepSeek de diciembre de 2025, que sustituye a V3.1 en razonamiento con contexto largo y llamada a herramientas manteniendo precios agresivos.
DeepSeek
La referencia oficial de la era V4 de DeepSeek (instantánea V4-Pro-0813) para razonamiento complejo y código largo, invocable en la API como deepseek-v4-pro.
DeepSeek
El nivel rápido de la generación V4 de DeepSeek, publicado como deepseek-flash con V4.1-Flash vigente, que atiende llamadas masivas y por lotes a bajo coste.
DeepSeek
Nombre colectivo de la familia abierta de DeepSeek; hoy la forman la línea V3.1/V3.2 y los dos niveles V4, y 'DeepSeek V4' no corresponde a ningún SKU oficial.
Alibaba
La generación Qwen de pesos abiertos de Alibaba, publicada el 2025-04-28 con tamaños desde el borde hasta el servidor; una de las bases autoalojadas principales en China.
Alibaba
El modelo estrella de Alibaba anunciado el 2025-09-24, con más de 1T de parámetros, orientado a razonamiento complejo y tareas de agente y servido sobre todo por API.
Alibaba
La siguiente entrega de Qwen, con pesos publicados el 2026-08-12, que mantiene la línea abierta de Alibaba para autoalojar y ajustar.
Alibaba
El nombre del nivel estrella de la API de Qwen, con gran comprensión del chino y capacidad multimodal, muy desplegado en empresas; los pesos abiertos equivalentes hoy son la serie Qwen3.
Alibaba
El modelo equilibrado de Qwen, con buen balance entre capacidad y coste, adecuado para la mayoría de escenarios de conversación y escritura en chino.
Alibaba
El modelo rápido de Qwen: bajo coste y alto rendimiento, adecuado para el procesamiento masivo de texto.
Alibaba
La familia de generación de vídeo de código abierto de Alibaba, con calidad de primera línea entre los modelos abiertos en texto a vídeo e imagen a vídeo, muy usada en la comunidad creativa china.
Zhipu AI
El modelo estrella anterior de Zhipu AI, de septiembre de 2025, con pesos abiertos, buena programación y texto largo; muy citado en despliegues autoalojados.
Zhipu AI
La nueva línea principal de Zhipu AI, que releva a GLM-4.6 como nivel promovido, con más capacidad de agente y código y contexto largo reforzado.
Zhipu AI
El nivel superior actual de Zhipu AI, con pesos abiertos y contexto de un millón de tokens, pensado para documentos largos y código de repositorio completo.
ByteDance
El modelo de generación de imágenes de ByteDance del 2025-09-09, disponible vía Volcano Engine y las entradas Doubao y Jimeng; opción habitual entre el texto a imagen chino.
Kuaishou
La versión madura y principal de Kling de Kuaishou, con mejor consistencia de personaje, rango de movimiento y comprensión del chino que la serie 1.x.
Kuaishou
La generación más reciente de Kling (2026), con hasta 15 segundos por generación, salida 4K y sincronía labial; de lo más fuerte de la generación de vídeo china.
MiniMax
Nombre colectivo del vídeo Hailuo de MiniMax, que hoy incluye Hailuo-02, 2.3 y el H3 omnimodal de pesos abiertos, con movimiento natural, física realista y buena lectura de instrucciones en chino.
MiniMax
La versión principal anterior de Hailuo, superior a 02 en seguimiento de instrucciones, física y consistencia de personaje; habitual en clips sociales y storyboards publicitarios.
MiniMax
La generación más nueva de MiniMax (julio de 2026), ofrecida como modelo omnimodal de pesos abiertos para servir generación y comprensión de vídeo en la misma pila.
MiniMax
El modelo de propósito general de MiniMax de mayo de 2026, centrado en contexto largo y agentes como la pata textual frente a la serie Hailuo.
Moonshot AI
Nombre colectivo de los modelos Kimi de Moonshot AI, evolucionados de los contextos largos iniciales a K2, K2.5 y el K3 de 2,8T de parámetros, manteniendo como estrella la lectura de documentos larguísimos.
Moonshot AI
El modelo estrella abierto de Moonshot AI de julio de 2025: un MoE de 1T de parámetros totales y 32B activos, publicado con una licencia MIT modificada y muy fuerte en agentes y código.
Moonshot AI
La iteración de K2 de enero de 2026, que refuerza la comprensión multimodal y las cadenas de razonamiento conservando la ventaja en documentos largos.
Moonshot AI
El nuevo modelo estrella de Moonshot AI (julio de 2026), con 2,8T de parámetros, construido para agentes de larga duración y razonamiento complejo.
Stability AI
El modelo insignia texto a imagen de código abierto de Stability AI, con un ecosistema enorme de despliegue local y ajuste fino; es la base de comunidades como Civitai y ComfyUI.
Stability AI
La versión clásica de Stable Diffusion, compacta y con un ecosistema ControlNet maduro; la opción de entrada al despliegue local.
Stability AI
El modelo texto a imagen en tiempo real de Stability AI: genera en un solo paso con latencia mínima, ideal para lienzos interactivos.
Stability AI
El modelo de difusión de vídeo de código abierto de Stability AI, referente en imagen a vídeo, con amplio ajuste fino e integración comunitaria.
Stability AI
El modelo de música y efectos de sonido de Stability AI, que genera música, samples y efectos de uso comercial y ofrece licencia comercial.
Black Forest Labs
La familia de generación de imágenes de Black Forest Labs, líder en calidad y renderizado de texto; la línea actual es FLUX.2 [pro], [dev] y [klein], aunque el trío FLUX.1 sigue en circulación.
Black Forest Labs
La generación de imágenes de Black Forest Labs de diciembre de 2025: [pro] vía API, [dev] con pesos abiertos para ajuste fino y [klein], publicado en abierto en enero de 2026 como nivel ligero y rápido.
Comunidad open source
El modelo de superresolución de imagen de código abierto: se ejecuta en local y es totalmente gratuito; es el motor central de ampliadores como Upscayl.
Midjourney
La generación más nueva de Midjourney, en alpha desde el 2026-03-17 y disponible en paralelo a V7 mientras se estabiliza.
Midjourney
La generación de Midjourney del 2025-04-04, por delante de V6 en calidad y adhesión a la indicación, durante mucho tiempo el producto de imagen principal de la casa.
Recraft
El modelo de tercera generación de Recraft, líder en generación vectorial y control de estilo de marca para diseñadores; su generación sucesora no está catalogada aquí, así que conviene mirar la documentación actual.
Ideogram
La generación de Ideogram de marzo de 2025, un paso más en renderizado de texto y composición de maquetación, habitual en carteles y visuales de marca.
Ideogram
El modelo de segunda generación de Ideogram, con renderizado de texto preciso para carteles, conceptos de logotipo y tipografía, sustituido por Ideogram 3 en marzo de 2025.
Ideogram
El primer modelo de Ideogram, que inauguró el renderizado fiable de texto en la generación de imágenes.
Leonardo AI
El nuevo modelo base de Leonardo AI, con gran mejora en calidad de imagen y adherencia a la indicación, habitual en activos de juego y creativos.
Leonardo AI
La primera serie de modelos de difusión de Leonardo AI, con muchas plantillas de estilo y un gran volumen de obras comunitarias.
Adobe
El modelo Firefly de tercera generación de Adobe, profundamente integrado con Photoshop e Illustrator y con derechos comerciales claros.
Adobe
El modelo Firefly de segunda generación de Adobe, con relleno generativo y efectos de texto maduros, integrado en el flujo de diseño.
Freepik
El modelo de generación de imágenes de alta fidelidad de Freepik, con gran detalle, integrado con su biblioteca de recursos y su sistema de licencias comerciales.
Magnific AI
El modelo de ampliación de Magnific, famoso por su reconstrucción alucinada de detalles, que convierte imágenes de baja resolución en piezas muy detalladas.
Playground
El modelo de imagen tipo lienzo de Playground, que unifica generación, repintado parcial y edición por capas.
Krea
El modelo de generación en tiempo real de Krea: renderiza y amplía bocetos al instante en el lienzo, acelerando muchísimo la iteración de diseño conceptual.
Runway
El nivel superior de Runway del 2025-12-11, que lleva más lejos el realismo físico y el seguimiento de instrucciones como su nuevo insignia de vídeo.
Runway
El modelo de vídeo de Runway del 2025-04-01, centrado en consistencia de personaje y escena guiada por referencias y en el control de cámara; tomó la línea principal de Gen-3 Alpha.
Runway
El modelo de edición de vídeo de Runway del 2025-07-31, que trata el metraje ya generado como material editable: cambias elementos u encuadre y el resto se mantiene.
Runway
El modelo de transferencia de interpretación de Runway del 2025-08-20, que traslada el movimiento y las expresiones de un actor a un personaje destino conservando los matices.
Pika
El modelo de vídeo de segunda generación de Pika, destacado en plantillas de efectos y consistencia de personajes, habitual en vídeo corto para redes.
Pika
El primer modelo de vídeo de Pika: ligero y fácil de empezar, popular para vídeos creativos en redes sociales.
Luma AI
El modelo de vídeo de Luma AI, con movimiento físico natural y planos cinematográficos, compatible con control por fotogramas clave y vídeo en bucle.
Luma AI
La tecnología de captura y reconstrucción de Luma, que recrea escenas 3D y activos de gaussian splatting a partir de vídeo y fotos.
Genmo
El modelo de vídeo de código abierto de Genmo, desplegable y autoalojable; un hito importante de la generación de vídeo abierta.
LTX Studio
El modelo de vídeo de LTX Studio, que integra guion gráfico, consistencia de personajes y control de cámara para narrativa audiovisual.
D-ID
El modelo de avatar fotodirigido de D-ID: basta una foto de un rostro para hacerlo hablar, y su API encaja en atención al cliente y marketing.
HeyGen
El modelo de avatares de HeyGen, que convierte un guion en vídeo hablado con aspecto real en un clic, con buena traducción de vídeo y sincronía labial.
ByteDance
El conjunto de modelos de IA integrados en CapCut, que cubre edición inteligente, subtítulos automáticos, efectos de IA y avatares, con la mayor variedad de plantillas en chino.
VEED
El conjunto de modelos de IA de edición online de VEED, con subtítulos automáticos, voz IA, reducción de ruido y avatares.
Suno
La versión actual de Suno, de septiembre de 2026, cuya base de entrenamiento es la primera autorizada con licencias de discográficas, con el cumplimiento comercial como reclamo central.
Suno
El modelo musical de Suno del 2025-09-23, un paso claro sobre V4 en voz y arreglo, y la línea principal hasta la llegada de v6.
Udio
El modelo musical de alta fidelidad de Udio, destacado en canciones con voz y temas completos de varios géneros, con regeneración parcial y edición fina.
ElevenLabs
Nombre colectivo de la familia de síntesis de voz de ElevenLabs, referencia del sector en realismo y expresividad emocional, con Eleven v3 como línea principal actual.
ElevenLabs
El modelo de voz de ElevenLabs lanzado en junio de 2025: más de 70 idiomas, control fino de emoción y estilo, generaciones largas y diálogo entre varios hablantes.
Murf
La biblioteca de voces de Murf, con más de 120 voces en más de 20 idiomas, habitual en formación corporativa y vídeos explicativos.
LOVO
El modelo de voz Genny de LOVO, con más de 500 voces y expresión emocional, que unifica doblaje y edición de vídeo.
Play.ht
El modelo de síntesis de voz de Play.ht, con salida en streaming de baja latencia para escenarios en tiempo real y biblioteca multilingüe.
Speechify
El modelo de lectura de Speechify, que convierte documentos, webs y libros en voz natural; habitual en aprendizaje y accesibilidad.
Kits.AI
La plataforma de entrenamiento de modelos de voz de Kits.AI, para clonar la propia voz o usar voces de artistas autorizados en demos.
Adobe
El modelo de mejora de voz de Adobe Podcast, que convierte una grabación ruidosa en calidad de estudio con un clic, gratis.
Meshy
El modelo de generación 3D de segunda generación de Meshy, con mejor calidad en texto a 3D e imagen a 3D, habitual en activos de juego y comercio electrónico.
Meshy
El primer modelo de generación 3D de Meshy, que bajó la barrera de entrada al texto a 3D.
Tripo AI
El modelo de generación 3D de Tripo AI, rápido en imagen a 3D y texto a 3D y con calidad de topología en mejora continua.
Deemos
El modelo de generación 3D de alta fidelidad de Deemos, centrado en activos fotorrealistas de personas y personajes; habitual en proyectos audiovisuales y de humanoides virtuales.
Spline
El diseño 3D con IA en el navegador de Spline, que genera escenas y animaciones desde una indicación y las incrusta directamente en la web.
Grammarly
El modelo de asistencia de escritura de Grammarly, que unifica corrección gramatical, ajuste de tono y detección de plagio en navegador y teclado móvil.
Rytr
El modelo de escritura ligero de Rytr, con más de 40 casos de uso y plantillas de tono; asequible y fácil de empezar.
Consensus
El modelo de preguntas académicas de Consensus, que responde a partir de artículos revisados por pares, indicando conclusiones e indicadores de calidad de la cita.
Character.AI
El modelo de conversación por rol de Character.AI, con un ecosistema enorme de personajes creados por la comunidad; referente del acompañamiento y el entretenimiento.
Replit
El modelo de programación de Replit, que monta una aplicación funcional desde una indicación y la despliega.
ClickUp
El modelo de IA de gestión de proyectos de ClickUp, que redacta tareas, resume documentos y responde sobre el estado del proyecto.
Gamma
El modelo de generación de presentaciones de Gamma, que crea diapositivas y sitios atractivos desde un esquema o documento.
Beautiful.ai
El modelo de maquetación inteligente de Beautiful.ai, que alinea y reordena las diapositivas según el contenido.
Descript
El modelo de edición de Descript, que permite editar audio y vídeo como si fuera un documento; pionero de la edición guiada por transcripción.
Entrenado por el usuario
Modelos ajustados o entrenados por el usuario con su propio material; habituales en el ecosistema LoRA de comunidades como Civitai y Tensor.Art.
Varios fabricantes
Nombre colectivo de los modelos desarrollados internamente y no publicados por cada proveedor; su alcance se rige por la documentación oficial.
Fliki
La biblioteca de voces de Fliki, con más de 2000 voces IA en más de 80 idiomas; específica para la narración de texto a vídeo.
NovelAI
El modelo de narrativa de NovelAI, específico para escribir novelas largas, con gran mantenimiento del estilo y consistencia de personajes.
NovelAI
El modelo de imagen de estilo anime de NovelAI, con buena consistencia de personajes y gran reputación en la comunidad de fan-art.
El directorio de modelos solo incluye modelos con nombre público que alguna herramienta de este directorio indica explícitamente. Las herramientas que usan un modelo propio sin nombre publicado conservan ese texto en la página de la herramienta, sin convertirse en una ficha de modelo; las distintas versiones de un mismo proveedor se agrupan en la ficha de su familia. Las capacidades, la disponibilidad y las licencias se rigen por la documentación oficial del proveedor.
Las fichas describen las capacidades del producto; las páginas de modelos responden qué motor hay debajo: en qué difieren las versiones de un mismo fabricante y si tus herramientas candidatas comparten base. Revisar la base primero acota las opciones más rápido que comparar solo funciones.