Publicado a finales de julio, DeepSeek-V4-Flash-0731 es el último modelo de la serie DeepSeek-V4, diseñada para ofrecer una gran eficiencia en contextos de largo plazo: reducir los costos de cálculo y memoria sin mermar las capacidades del modelo, al tiempo que se exploran arquitecturas con menor latencia.
- El modelo reproduce exactamente la arquitectura y el tamaño del DeepSeek-V4-Flash-Preview de abril (284.000 millones de parámetros, de los cuales 13.000 millones están activados, y un contexto de un millón de tokens), pero incorpora nuevas técnicas de posentrenamiento destinadas, en particular, a reforzar sus capacidades agénticas.
- Con V4-Flash, la apuesta de DeepSeek no es igualar el límite en cuanto a inteligencia bruta, sino maximizar la densidad de inteligencia por parámetro activo y por dólar.
- Según Artificial Analysis 1 su costo medio es de solo 0,03 dólares por prueba, es decir, aproximadamente cien veces menos que un modelo de referencia como Claude Fable 5 (3,15 dólares).
- Sin modificar la arquitectura ni las capacidades básicas, la mejora del proceso posterior al entrenamiento permite, por tanto, aumentar considerablemente la eficiencia económica del modelo. Con un millón de tokens de contexto, DeepSeek-V4-Flash-0731 solo consume aproximadamente el 10 % de los cálculos (FLOP) por token generado y el 7 % de la memoria (caché KV) de DeepSeek-V3.2, el modelo anterior.
- Además, V4-Flash-0731 ofrece un rendimiento superior al de DeepSeek-V4-Pro, por un tercio de su precio. Estos dos modelos pertenecen a la misma familia arquitectónica y utilizan los mismos factores de compresión de la atención para mejorar la eficacia en contextos largos. No obstante, difieren en su escala: 43 capas, una dimensión de 4.096, 256 expertos y 13.000 millones de parámetros activados para Flash, frente a 61 capas, una dimensión de 7.168, 384 expertos y 49.000 millones de parámetros activados para Pro.
- En las pruebas de rendimiento de agentes publicadas por DeepSeek, V4-Flash-0731 supera a V4-Pro-Preview en las nueve evaluaciones presentadas: 82,7 frente a 72,1 en Terminal Bench 2.1, 54,4 frente a 12,8 en DeepSWE, 76,7 frente a 52,7 en CyberGym, o incluso 70,3 frente a 55,9 en Toolathlon-Verified.
- El informe de abril aún estimaba que el V4-Pro-Max se encontraba a entre tres y seis meses de alcanzar el nivel de Estados Unidos en cuanto al razonamiento; el Flash-0731 reduce la diferencia en lo que respecta a la ejecución agéntica.
- Desde su lanzamiento el 31 de julio de 2026, V4-Flash ocupa el primer puesto en la clasificación semanal de uso de OpenRouter, gracias a una relación calidad-precio que se traduce rápidamente en tráfico real.
- En cuanto a la licencia, DeepSeek-V4-Flash-0731, al igual que la mayoría de los modelos recientes de DeepSeek, se publica bajo licencia MIT: se permite su uso comercial, su modificación y su redistribución. Kimi K3, por el contrario, exige a cualquier empresa que supere los 20 millones de dólares de facturación anual que firme un acuerdo comercial específico.
- DeepSeek también publica el módulo «draft», junto con las versiones iniciales de V4-Flash y V4-Pro, que se utiliza para la decodificación especulativa —una técnica que acelera la inferencia al hacer que un modelo pequeño prediga varios tokens a la vez, predicciones que luego verifica el modelo principal—, así como el código que permite entrenarlo: 2 Moonshot, por su parte, conserva una ventaja estructural a la hora de ofrecer K3 en su propia infraestructura: su borrador, derivado del ajuste fino de una capa MTP que a su vez ha sido preentrenada con el modelo base, no se ha publicado.
En una conversación con inversores celebrada en mayo, 3 el cofundador de DeepSeek, Liang Wenfeng, insistía en que la publicación de los pesos no permite automáticamente a los proveedores externos igualar el costo de inferencia de DeepSeek: alcanzar el mismo costo por token requiere numerosas optimizaciones que pocas empresas tienen la capacidad de implementar.
- En él también describía la principal diferencia entre China y Estados Unidos: la capacidad de cálculo y las GPU. La falta de potencia de cálculo reduce directamente el tamaño de los modelos y el número de experimentos que se pueden llevar a cabo en paralelo, y por lo tanto la calidad de los modelos; afirma que intenta conseguir el mayor número posible de GPU, siempre que su precio sea razonable.
- Según él, el modelo económico cuenta con una base sólida: incluso sin una nueva disrupción tecnológica, la venta de API podría bastar para que DeepSeek fuera rentable y para sostener una empresa que cotiza en bolsa.
Notas al pie
- Véase: «Comparison of Models: Intelligence, Performance & Price Analysis».
- Véase: DSpark: «Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation», 6 de julio de 2026.
- Fred Gao, «DeepSeek’s Liang Wenfeng Breaks His Silence», 23 de julio de 2026.