El precio de la API de DeepSeek cambiará el 16 de agosto: esto es lo que realmente costará
Calcula los costos de DeepSeek V4 Pro y Flash bajo el cronograma de precios pico y valle del 16 de agosto, con ejemplos prácticos de presupuesto.

DeepSeek está a punto de hacer que la gestión del presupuesto de la API sea más complicada—y potencialmente más controlable. A las 16:00 UTC del 16 de agosto de 2026, la empresa planea reemplazar sus tarifas planas actuales de V4 con precios pico y valle. El uso fuera de horas pico costará la mitad de la tarifa pico, creando un incentivo directo para trasladar cargas de trabajo flexibles fuera de las horas de mayor actividad.
El cambio afecta tanto a DeepSeek-V4-Flash como al recién lanzado DeepSeek-V4-Pro. También altera la economía lo suficiente como para que las comparaciones de costos anteriores se vuelvan engañosas. Este artículo traduce la tabla oficial por millón de tokens en cargas de trabajo realistas y explica cómo evitar los errores presupuestarios más comunes.
Primero, el Tiempo
A partir de la fecha de verificación de este artículo—14 de agosto—el nuevo horario está anunciado pero aún no activo. DeepSeek dice que comienza a las 16:00 UTC del 16 de agosto. Las ventanas pico designadas son de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC. Todas las demás horas son fuera de pico.
Debido a que los precios son información operativa en tiempo real, confirme la página oficial de precios antes de financiar una cuenta o publicar una calculadora. Las tarifas a continuación reflejan esa página al 14 de agosto de 2026.
La Tabla de Precios Programada
Los precios son por un millón de tokens.
| Modelo y período | Entrada en caché | Entrada sin caché | Salida | |---|---:|---:|---:| | V4 Flash fuera de horas pico | $0.007 | $0.22 | $0.66 | | Pico de Flash V4 | $0.014 | $0.44 | $1.32 | | V4 Pro fuera de horas punta | $0.022 | $0.66 | $1.98 | | V4 Pro pico | $0.044 | $1.32 | $3.96 |
Tres patrones son inmediatamente visibles. La salida es la categoría costosa. Una falla de caché cuesta mucho más que un acierto de caché. Pro cuesta aproximadamente tres veces la tarifa correspondiente de Flash. Esas proporciones son más útiles que un precio único destacado porque las aplicaciones reales tienen diferentes combinaciones de entrada/salida.
Lo que Cuesta una Solicitud Típica
Considera un asistente de soporte que lee 8,000 tokens de entrada no almacenados en caché y produce 1,000 tokens de salida. Con el precio Flash fuera de horas pico, el costo del modelo es aproximadamente:
SOLO TRADUCCIÓN:```
(8,000 / 1,000,000 × $0.22) + (1,000 / 1,000,000 × $0.66) = $0.00242
Con el precio máximo de Flash, se duplica a aproximadamente $0.00484. Con Pro, la misma combinación de tokens cuesta alrededor de $0.00726 fuera de las horas pico y $0.01452 en horas pico.
Estos números parecen pequeños, pero el volumen cambia la perspectiva. Con un millón de solicitudes de este tipo al mes, la diferencia solo del modelo entre Flash fuera de horas pico y Pro en horas pico es de aproximadamente $12,100. Las llamadas a herramientas, las API de búsqueda, el almacenamiento, la observabilidad, los reintentos y la revisión humana añadirían más.
Ahora considera un agente de codificación que consume 120,000 tokens de entrada no almacenados en caché y emite 20,000 tokens de salida por tarea. Flash cuesta aproximadamente $0.0396 fuera de horas pico o $0.0792 en horas pico. Pro cuesta aproximadamente $0.1188 fuera de horas pico o $0.2376 en horas pico. Si el modelo Pro reduce materialmente los intentos fallidos, aún puede ser económico. Necesitas la tasa de éxito para decidir.
Los aciertos de caché pueden cambiar el resultado
La brecha entre la entrada en caché y la que no tiene caché es enorme. Para V4 Pro fuera de horas pico, un millón de tokens de entrada sin caché cuestan $0.66, mientras que la entrada en caché cuesta $0.022. Esto convierte la arquitectura de prompts en una preocupación económica.
Coloca material estable y reutilizable donde el mecanismo de caché del proveedor pueda reconocerlo. Evita cambiar espacios en blanco, orden, marcas de tiempo o metadatos irrelevantes en un gran prefijo estático. Separa las instrucciones duraderas y los documentos de referencia del contenido del usuario por solicitud. Luego mide el uso real de aciertos de caché en lugar de asumir que el diseño funciona.
El almacenamiento en caché no debe usarse para justificar el envío de todo. Un mensaje más pequeño y relevante suele ser más confiable que una montaña de ruido almacenada en caché. Optimice primero la relevancia, la capacidad de almacenamiento en caché en segundo lugar.
Cómo usar el precio fuera de horas punta
Muchas tareas de IA no son verdaderamente en tiempo real. La generación de informes nocturnos, la indexación de repositorios, las actualizaciones de incrustaciones, la clasificación de documentos, la creación de datos sintéticos, las ejecuciones de evaluación y los borradores de contenido de baja prioridad pueden esperar.
Construye una cola con tres clases de servicio:
- Interactivo: ejecutar inmediatamente y aceptar la tarifa actual.
- Flexible: programa para la próxima ventana de baja demanda.
- Lote: procesar en lotes controlados durante horas de menor actividad.
Traduzca las ventanas UTC con cuidado. Los cambios de horario de verano pueden alterar las asignaciones del reloj local. Almacene los horarios en UTC y muestre la conversión a los operadores. Agregue fluctuación para que cada trabajo en cola no comience exactamente en el límite, y limite la concurrencia para evitar una tormenta de reintentos.
Los errores que rompen las previsiones de costos
El primer error es contar solo el texto visible. Los tokenizadores dividen palabras, código, puntuación, JSON y contenido multilingüe de manera diferente. Usa el uso reportado por la API.
El segundo es ignorar los bucles de agente. Una "solicitud de usuario" puede desencadenar docenas de llamadas de modelo, operaciones de búsqueda, ejecuciones de pruebas y reparaciones. Presupuesto por trabajo completado, no por mensaje de chat.
El tercero es asumir que el pensamiento máximo es calidad gratuita. Un mayor esfuerzo de razonamiento puede aumentar la latencia y el consumo. Dirige el trabajo simple hacia el bajo esfuerzo, las tareas diarias del agente hacia el alto, y usa el máximo solo cuando las evaluaciones muestren un beneficio.
El cuarto es olvidar los fallos. Los tiempos de espera, argumentos de herramienta inválidos, desbordamiento de contexto y salidas rechazadas cuestan dinero. Rastrea las razones de reintento y corrige errores sistémicos en lugar de pagar por la repetición.
La quinta es publicar precios futuros como precios actuales. Hasta la hora de activación indicada, las tarifas antiguas siguen siendo aplicables. Después de la activación, la página oficial es la fuente de verdad.
Un mejor presupuesto para el modelo
Crea una hoja de trabajo con estas columnas:
- nombre de la carga de trabajo;
- solicitudes por mes;
- entrada promedio en caché;
- entrada promedio no almacenada en caché;
- salida promedio;
- división esperada de horas punta/valle;
- multiplicador de reintentos;
- Flash o Pro;
- costo de herramientas y búsqueda;
- minutos de revisión humana;
- tasa de finalización exitosa.
Calcula un escenario bajo, esperado y alto. El escenario alto debe incluir un pico de fallos de caché y bucles adicionales del agente. Configura alertas sobre dólares por tarea exitosa, no solo tokens por solicitud.
Si tu organización aún está identificando dónde encaja la IA en su flujo de contenido o creativo, experimentar a través de Elser AI puede ayudar a definir el flujo de trabajo útil antes de comprometerte con una arquitectura a escala de API. Un proceso claro evita que los equipos optimicen los precios de los tokens para una tarea que los usuarios no necesitaban.
Preguntas Frecuentes
¿Cuándo comienza el nuevo precio de DeepSeek?
DeepSeek dice las 16:00 UTC del 16 de agosto de 2026. Verifica la página en vivo en caso de que el horario cambie.
¿Cuándo son las horas pico?
Las ventanas pico anunciadas son 01:00–04:00 UTC y 06:00–10:00 UTC. Las demás horas se consideran fuera de pico.
¿Es V4 Pro tres veces más caro que Flash?
Las tarifas programadas son aproximadamente tres veces las de Flash en cada categoría de token. El costo total por tarea exitosa puede diferir porque la calidad, los reintentos y la reparación humana también importan.
¿Cuál es la forma más fácil de ahorrar dinero?
Usa Flash para trabajos simples validados, programa trabajos flexibles fuera de horas pico, reduce la salida innecesaria, mejora los aciertos de caché y detén los bucles fallidos repetidos de agentes.
Fuentes y Verificación
Este artículo utiliza el registro de cambios de la API oficial de DeepSeek, la documentación de modelos y precios, y el material de lanzamiento de V4 como fuentes principales. Las etiquetas de productos se conservan deliberadamente: V4 Pro 0813 es GA, mientras que V4 Flash 0731 se describe como beta pública en la fecha de verificación. Las cifras de referencia se identifican como reportadas por el proveedor, no como resultados independientes de Elser AI. Los precios programados se etiquetan como futuros hasta su fecha de activación anunciada. Los lectores que tomen decisiones de producción o compra deben volver a verificar la documentación en vivo porque los alias de modelos, precios, límites de velocidad, estado beta y el comportamiento de las funciones pueden cambiar después de la publicación. Sigue siendo necesaria una evaluación independiente en tareas representativas.
Conclusión
El sistema de horas punta/valle de DeepSeek convierte el tiempo en una variable de coste de primera clase. Los mayores ahorros provendrán de combinar la programación, el almacenamiento en caché, el enrutamiento de modelos, el control de salida y la reducción de fallos. Copiar la tabla de precios no es suficiente. Modele su combinación real de tokens y mida el costo de un resultado empresarial exitoso.








































































