GPT-5.6 Sol vs Terra vs Luna: El costo real de los proyectos de video con IA
La tabla de precios de tokens no puede decirte el costo de AI Video. Solo puede indicarte el precio de la respuesta del modelo. El costo del proyecto depende de la frecuencia con la que la respuesta necesita ser modificada, si se pueden evitar fallos de renderizado, la cantidad de contexto reenviado y qué tareas realmente requieren razonamiento avanzado.
Hasta el 28 de agosto de 2026, OpenAI lista GPT-5.6 Sol a 4 USD por millón de tokens de entrada y 20 USD por millón de tokens de salida, Terra a 2 USD y 12 USD, y Luna a 0,20 USD y 1,20 USD. Los costos de entrada en caché son de 0,40 USD, 0,20 USD y 0,02 USD respectivamente. Según la tarifa de OpenAI, el precio actual de Sol es promocional al menos hasta el 21 de noviembre.
Este artículo simula un flujo de trabajo real de preproducción de un video de anime de un minuto. GPT-5.6 se utiliza para el análisis de texto e imágenes, planificación, generación de indicaciones y revisión, no para la renderización directa del video.
Proyectos que estamos evaluando
Supongamos que un creador independiente está produciendo un cortometraje animado de 60 segundos que incluye ocho tomas. El flujo de trabajo incluye:
- Desarrollo previo;
- Un guion de 900 palabras;
- Especificaciones de caracteres;
- Un storyboard de ocho tomas;
- Octava generación de indicaciones y revisiones;
- Dirección de voz y sonido;
- Realizar verificación de continuidad utilizando el fotograma seleccionado;
- Título, descripción, subtítulos y metadatos de la plataforma.
Los costos de video, imágenes, voz y edición varían según la plataforma y no se incluyen en el cálculo de tokens. Esta exclusión es intencionada: primero queremos comprender la capa de planificación y luego estudiar cómo afecta a la costosa capa de renderizado.
Puedes ejecutar este flujo completo en Elser AI, donde el guion, los personajes, el storyboard, las escenas, el audio y el montaje final se mantendrán vinculados. El siguiente cálculo ayuda a decidir qué modelo de lenguaje debe respaldar cada decisión.
Entrada de precio actual
| Modelo | Entrada no almacenada en caché / 1M | Entrada almacenada en caché / 1M | Salida / 1M | | Sol | $4.00 | $0.40 | $20.00 | | Terra | $2.00 | $0.20 | $12.00 | | Luna | $0.20 | $0.02 | $1.20 |
La fórmula básica es:
cost = (número de tokens de entrada no almacenados en caché × tarifa de entrada / 1,000,000) + (número de tokens de entrada en caché × tarifa de caché / 1,000,000) + (número de tokens de salida × tarifa de salida / 1,000,000)
Siempre se factura según los datos reales de uso de la API. La estimación de palabras a tokens es solo una herramienta de planificación, no una factura.
Escenario A: Uso de un solo modelo para manejar todas las tareas
Suponiendo que el proyecto consumió 160,000 tokens de entrada y 55,000 tokens de salida durante el informe de investigación, las iteraciones y el proceso de revisión, sin utilizar caché.
Sol
Entrada: 0.16 × $4.00 = $0.64 Salida: 0.055 × $20.00 = $1.10 Total: $1.74
Tierra
Entrada: 0.16 × $2.00 = $0.32 Salida: 0.055 × $12.00 = $0.66 Total: $0.98
Luna
Entrada: 0.16 × $0.20 = $0.032 Salida: 0.055 × $1.20 = $0.066 Total: $0.098
En este caso simplificado, el costo de Luna es aproximadamente una décima parte del de Terra. Sin embargo, la diferencia absoluta entre Terra y Sol es de solo 0.76 dólares. Si Sol puede evitar una renderización de video innecesaria, podría resultar más barato a nivel de proyecto. Por el contrario, usar Sol para generar nombres de archivo apenas ahorra algo, mientras consume potencia de cómputo de alta gama que podría ser más útil en escenarios de alto valor.
Escenario B: Asignación de trabajo según la dificultad
Tareas de enrutamiento más cercanas al entorno de producción real:
Luna:80,000 entradas, 25,000 salidas
Usa Luna para expansión creativa, gestión de metadatos, ajuste de formato, limpieza de subtítulos, estandarización de registros de tomas y llenado de plantillas de indicaciones.
0.08 × $0.20 + 0.025 × $1.20 = $0.046
Terra: 65,000 entradas, 24,000 salidas
Usar Terra para desarrollo de scripts, planificación de tomas, diálogos, sugerencias de escenas y resumen de revisiones.
0.065 × $2.00 + 0.024 × $12.00 = $0.418
Sol: 25,000 entradas, 6,000 salidas
Realizar la revisión narrativa final, la detección de contradicciones y el diagnóstico de los escenarios de fallo más costosos utilizando Sol.
0.025 × $4.00 + 0.006 × $20.00 = $0.22
Total de rutas
El flujo de trabajo de enrutamiento tiene un costo aproximado de 0.684 USD en tokens de modelo de texto. En nuestro ejemplo, resulta más económico que usar solo Terra y ofrece una capacidad de razonamiento más sólida en dos momentos clave donde se pueden evitar errores costosos.
Esto no es un punto de referencia general. Muestra un método: estimar la cantidad de tareas, medir el uso real y pagar donde la capacidad cambia la tasa de aceptación.
Escenario C: Agregar caché de indicaciones
Supongamos que el proyecto envía repetidamente una biblia de producción estable de 12,000 palabras que incluye una tabla de roles, guía de estilo, restricciones de seguridad, terminología y patrón de salida, y este contenido aparece en 12 solicitudes.
Sin usar caché, este bloque generará 144,000 tokens de entrada. Si se incluye una escritura no almacenada en caché y 11 lecturas en caché, el costo aproximado de entrada de Terra es:
Los primeros 12,000 tokens no almacenados en caché: 0.012 × $2.00 = $0.024 A continuación 132,000 caché: 0.132 × $0.20 = $0.0264 Entrada de contexto estable total: $0.0504
Si no se utiliza caché, el mismo contexto costará:
0.144 × $2.00 = $0.288
Para este bloque de contexto, se redujo un 82.5%. Esto no es un ahorro para todo el proyecto, porque los prompts variables y las salidas aún se facturan al precio normal.
Para mejorar la reutilización de la caché:
- Primero coloca contenido estable;
- Mantén su redacción y orden sin cambios;
- Instrucción de escenario de separación de variables después del punto de interrupción;
- Evitar inyectar marcas de tiempo o ID de solicitud en el prefijo estable;
- Medir la tasa de aciertos de caché, en lugar de asumir que ocurre.
El costo que realmente importa: producción aceptable
Ejecuta el mismo cálculo de costos en Elser AI para un cortometraje real. Regístrate, crea una escena representativa y mide los entregables aprobados, no el contenido generado originalmente.
Imagina dos métodos de generación de prompts:
- Después de cuatro revisiones, Luna generó un aviso de filmación utilizable.
- Terra generó un aviso de filmación utilizable después de dos revisiones.
Luna puede seguir siendo más barata en costos de token, pero el tiempo adicional de revisión manual podría ser el factor dominante. Ahora supongamos que una instrucción más débil provoca dos fallos en la renderización de video, cada uno con un costo de 1 dólar. El ahorro en tokens de texto desaparece.
Seguimiento del costo de cada toma aceptada, incluyendo:
Costo del modelo de texto
- Imagen/Referencia de generación
- Generación y expansión de video
- Voz y audio
- Ampliar/Exportar
- Tiempo de revisión manual
- Costo de la salida descartada
El modelo correcto es aquel que minimiza esta cantidad total mientras cumple con los requisitos de calidad y tiempo de entrega.
Recomendaciones por fases
Exploración de premisas: Luna
Solicitar 30 premisas restringidas en una tabla. El costo de la selección manual es bajo, por lo que es razonable usar Luna para generar múltiples opciones.
Guion y lógica de personajes: Terra
Terra es la opción predeterminada para redactar y revisar. Ofrece más espacio para albergar conversaciones detalladas y continuidad, sin necesidad de pagar el precio completo de Sol.
Formato de guion gráfico y sugerencias: Primero Terra, luego Luna
Usar Terra para definir la intención de grabación y la lógica de la cámara. Una vez aprobado el patrón, Luna puede completar los campos estructurados repetitivos.
Diagnóstico de escenarios de alto riesgo: Sol
Envía el prompt, el fotograma de referencia, la salida fallida y un historial de pruebas conciso. Por favor, Sol, clasifica las posibles causas y propón un plan experimental univariante.
Limpieza de metadatos y subtítulos: Luna
Estas son tareas de alta capacidad y comprobables. Utilizan una arquitectura estricta y verificaciones automatizadas.
Auditoría de Continuidad Final: Sol o Terra
Para narrativas complejas con muchas referencias, usa Sol. Para contenido breve con reglas claras, Terra es suficiente.
Una vez aprobado, traslada los activos a Elser AI para generar y ensamblar escenas, voces, música y efectos, manteniendo las modificaciones vinculadas al plan original.
No pagues por salidas innecesarias
El costo de los tokens de salida es de cinco a seis veces mayor que el de los tokens de entrada, y esto es así para los tres modelos. La solicitud respalda el producto mínimo viable para la próxima decisión.
En lugar de:
Un análisis exhaustivo de cada posible problema que pueda existir en esta fotografía.
Uso:
Devuelve las cinco causas de fallo más probables, la evidencia de cada una y una prueba controlada. Máximo 500 palabras.
Cuando un humano o una herramienta necesita consumir una respuesta, solicita tablas, JSON o campos fijos. Las introducciones extensas y motivacionales no mejorarán la calidad de la producción.
Entrada de imágenes y herramientas de presupuesto
Los cálculos simples anteriores solo cubren los tokens de texto. Las entradas de imagen se procesan mediante tokenización, y las llamadas a herramientas pueden generar costos adicionales. El procesamiento rápido también puede tener precios diferentes. Utilice el panel de uso y facturación de OpenAI para llevar un registro:
- Entrada no almacenada en caché;
- Entrada en caché;
- tokens de salida e inferencia;
- Entrada de imagen;
- Uso de búsqueda web u otras herramientas;
- Procesar niveles.
No aplique resultados de estimación de texto sin formato a flujos de trabajo visualmente intensivos.
Construcción del libro mayor de costos de producción
Cuando sus supuestos presupuestarios estén listos, comience a crear con Elser AI y verifique la ruta completa desde el guion hasta la escena final antes de comprometerse con un gasto mensual.
Para cada entregable aceptado, crea una línea:
| Entregable | Modelo | Intentos | Entrada | Caché | Salida | Costo de herramientas | Costo de renderizado | Minutos de revisión | ¿Aceptado? | |---|---|---:|---:|---:|---:|---:|---:|---:|---|
Después de cinco proyectos, el patrón se vuelve claramente visible. Puede que descubras que Sol reduce el número de revisiones de guiones, pero no aporta valor añadido a la escritura de subtítulos, o que una mejor tabla de referencia ahorra más costos que cualquier cambio de modelo.
Si Elser es su entorno de producción, incluya la versión generada de Elser y la revisión final del corte en el mismo libro mayor. El objetivo es optimizar todo el flujo de trabajo, no un solo elemento de línea de la API.
Preguntas Frecuentes
¿Cuánto cuesta hacer un video de IA con GPT-5.6?
No hay un monto fijo. En nuestro flujo de trabajo de demostración de un minuto, el costo de uso de texto para enrutar GPT-5.6 es de menos de 1 dólar, sin incluir imágenes, videos, audio, herramientas ni trabajo humano. Su uso real puede variar significativamente.
¿Es Luna siempre la opción más barata?
Su tarifa de tokens es la más baja. Sin embargo, cuando la tarea es ambigua o de alto riesgo, puede no ser la opción de menor costo por resultado aceptado.
¿Cuándo debería usar Sol?
Para planificación compleja, razonamiento entre documentos, diagnóstico difícil de fallos o revisión final, en escenarios donde una mejor decisión puede evitar costosos errores de producción.
¿Cuáles son las mejores configuraciones predeterminadas para los creadores?
Terra es la opción predeterminada para el equilibrio. Enruta las tareas estructuradas repetitivas a Luna y escala las decisiones más difíciles a Sol.
¿Puede el almacenamiento en caché reducir el costo de salida?
No. Reduce el costo de entrada repetitiva que cumple con los requisitos. Mantén la salida concisa y estructurada para controlar los gastos de salida.
Conclusión
El flujo de trabajo de video con IA más barato no utiliza el modelo de lenguaje más económico. Es aquel que logra un video final aceptable con la menor cantidad de ciclos desperdiciados. Asigna tareas repetitivas a Luna, trabajo de desarrollo a Terra y decisiones costosas a Sol. Almacena en caché el contexto estable, restringe la salida y mide el costo total por cada toma aceptable. Esto transforma los precios de un eslogan publicitario en una ventaja real de producción.




