Pega un prompt, mira los tokens y el coste en GPT, Claude, Gemini, Qwen y DeepSeek, y compara dos modelos
| Modelo | Tokens | Entrada | Salida | Una petición | {n} peticiones | Contexto | ¿Cabe? |
|---|
Los grandes modelos de lenguaje se facturan por token, un pequeño fragmento de texto equivalente más o menos a tres cuartas partes de una palabra inglesa. Los proveedores cobran por separado los tokens que envías (entrada) y los que el modelo escribe de vuelta (salida), y la salida suele costar varias veces más, así que una pregunta corta con una respuesta larga puede costar más que un documento largo con un resumen breve.
El precio es solo un eje a la hora de elegir un modelo. La ventana de contexto fija cuánto texto puede considerar el modelo a la vez, desde unos cien mil tokens hasta un millón o más; la velocidad decide si un chat parece instantáneo; y los modelos multimodales también pueden leer imágenes, escuchar audio o ver vídeo. Los modelos baratos y rápidos sirven para clasificar, extraer datos y chats de mucho volumen, mientras que los modelos insignia y de razonamiento compensan su precio en programación difícil, análisis y planificación.
Comparar modelos de la clase de GPT, Claude, Gemini, Qwen, DeepSeek, Grok y Llama lado a lado hace visibles los compromisos antes de que un proyecto escale: multiplica el coste por petición por tu volumen mensual y una diferencia de precio de diez veces se convierte en una partida real del presupuesto. Los modelos de pesos abiertos añaden otra opción, ya que pueden ejecutarse en tu propio equipo o a través de varios anfitriones que compiten entre sí.