JOURNAL / 2026.08.04
DeepSeek publica V4-Flash-0731 para agentes, pero no su harness de evaluación
El nuevo checkpoint con licencia MIT mejora mucho las cifras de agente y ya funciona en la API; los pesos son auditables, pero el sistema que produjo los resultados aún no puede reproducirse completo.
DeepSeek publicó el 31 de julio DeepSeek-V4-Flash-0731, la versión oficial de su modelo Flash para agentes. No es una arquitectura nueva: conserva el diseño del preview de abril y, según la empresa, sólo ha recibido un nuevo postentrenamiento. Sí es un cambio material de capacidad y disponibilidad. Hay un checkpoint nuevo con licencia MIT, la API pública ya lo sirve bajo el nombre deepseek-v4-flash y el modelo admite el formato Responses que usan varios agentes de programación.
La distinción respecto del lanzamiento de abril importa. El informe técnico de V4 describe un modelo de mezcla de expertos con 284.000 millones de parámetros totales, 13.000 millones activos por token y una ventana de contexto de un millón de tokens. La versión 0731 mantiene esa base, añade al checkpoint el módulo de decodificación especulativa DSpark y concentra la novedad en cómo el modelo fue entrenado después del preentrenamiento para razonar y actuar con herramientas.
En otras palabras, DeepSeek no necesitó presentar otra escala de modelo para reclamar otro nivel de comportamiento. Ésa es la parte más interesante del lanzamiento.
La mejora aparece en bucles de trabajo, no en preguntas aisladas
La ficha de V4-Flash-0731 compara el nuevo checkpoint con el preview en nueve evaluaciones de agentes. En Terminal-Bench 2.1, DeepSeek declara que pasa del 61,8 % al 82,7 %; en Toolathlon-Verified, del 49,7 % al 70,3 %. También informa de mejoras amplias en ingeniería de software, ciberseguridad y tareas profesionales de varios pasos.
Esas dos pruebas ayudan a entender la afirmación sin convertir la entrada en una tabla. Terminal-Bench 2.1 contiene 89 tareas verificables dentro de un terminal: configurar software, procesar datos, compilar proyectos o resolver problemas científicos. Su propia revisión de mayo corrigió 28 tareas porque dependencias externas, recursos o instrucciones defectuosas alteraban el resultado. Toolathlon-Verified propone 108 tareas que combinan 604 herramientas de 32 aplicaciones, con unas veinte rondas de interacción de media y comprobadores ejecutables.
Por tanto, una subida en ambas es más informativa sobre persistencia y uso de herramientas que otra mejora en un examen de respuesta breve. No demuestra, sin embargo, que el modelo complete el 82,7 % de «las tareas de terminal» en general ni que vaya a conservar ese rendimiento en el repositorio, las herramientas y las políticas de una organización concreta.
Hay una limitación todavía más inmediata: para las pruebas de programación, DeepSeek utilizó el nivel de razonamiento max y el modo mínimo de DeepSeek Harness, que la empresa dice que publicará más adelante. Dos de las nueve pruebas son además conjuntos internos. La compañía ha publicado los pesos que generan los tokens, pero no todo el sistema que decidió qué contexto entregar, cuándo ejecutar una herramienta, cómo observar el resultado y cuándo detenerse.
Eso impide separar hoy cuánto de la subida procede del postentrenamiento y cuánto del andamiaje. Tampoco se publican para estas cifras el coste por tarea, la latencia, el número de intentos ni trayectorias completas. Los benchmarks tienen pruebas verificables, pero el resultado concreto sigue siendo una medición del proveedor bajo una configuración que otra persona aún no puede repetir de extremo a extremo.
Abierto no significa pequeño ni completo
El checkpoint sí permite una comprobación mucho más profunda que una API cerrada. Su índice de pesos enumera 48 fragmentos que ocupan aproximadamente 167 GB; el repositorio incluye además el codificador de mensajes y el módulo especulativo, y se distribuye bajo MIT. Un laboratorio puede inspeccionarlo, modificarlo y ejecutarlo sin depender de que DeepSeek conserve el endpoint. Pero no es un modelo de portátil: la receta destacada por la propia ficha usa un nodo con cuatro GPU GB300, y las recetas de vLLM muestran cómo memoria, longitud de contexto y paralelismo condicionan qué modos son viables.
La API elimina esa barrera operativa. La documentación de precios fija actualmente 0,14 dólares por millón de tokens de entrada sin caché y 0,28 por millón de salida, con una salida máxima de 384.000 tokens. Son tarifas muy bajas para experimentar con agentes largos. No equivalen al coste de una tarea resuelta: el modo max puede deliberar mucho, repetir acciones o fallar al final, y DeepSeek no acompaña sus resultados con consumo y tiempo. Además, la página ya anuncia que las tarifas se duplicarán en ciertas horas punta en una fecha aún por determinar.
Para quien construye software, el cambio práctico es real. Se puede sustituir el backend de un agente compatible con Responses, probar el checkpoint en infraestructura propia o diseñar un harness que limite herramientas, permisos y presupuesto. Pero el lanzamiento también deja claro que «usar V4-Flash-0731» no identifica por sí solo un sistema reproducible. Hay que fijar al menos la versión de los pesos, el nivel de razonamiento, el formato de mensajes, las herramientas, el bucle de ejecución, los límites de contexto y el evaluador.
Mi lectura es que ésta es la lección duradera del lanzamiento: el postentrenamiento y el harness se están convirtiendo en parte de la capacidad del modelo. Si la misma arquitectura salta veinte puntos en pruebas distintas, la pregunta útil ya no es sólo cuántos parámetros tiene, sino qué experiencias de acción recibió y qué sistema la acompaña al medirla. Para comparar agentes con honestidad, publicar el checkpoint es necesario, pero también hacen falta el andamiaje, las versiones, las trayectorias y el coste.
La apertura tampoco resuelve la seguridad por sí sola. La ficha de 0731 incluye una puntuación de capacidad cibernética, pero no presenta una evaluación específica de abuso, negativa, control de acciones o incidentes para este checkpoint reforzado. Con pesos MIT, cualquier salvaguarda del servicio de DeepSeek puede sustituirse. Eso no convierte el modelo en un ataque, pero sí traslada al operador la obligación de aislar herramientas, reducir privilegios y probar conductas que una tabla de finalización no mide.
V4-Flash-0731 merece atención aunque sus cifras resulten menos portables de lo que sugiere el anuncio. Los pesos existen, la API está activa y el salto atribuido al postentrenamiento es grande en tareas con resultados comprobables. La siguiente prueba importante no será otro número de DeepSeek: será que el laboratorio publique su harness y permita averiguar qué parte de esa capacidad viaja realmente con el modelo.
Fuentes
- DeepSeek, registro de cambios de DeepSeek-V4-Flash, 31 de julio de 2026.
- DeepSeek, checkpoint y ficha de DeepSeek-V4-Flash-0731, consultados el 4 de agosto de 2026.
- DeepSeek-AI, DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, 26 de abril de 2026.
- DeepSeek, modelos y precios de la API, consultados el 4 de agosto de 2026.
- Terminal-Bench, Terminal-Bench 2.1, 6 de mayo de 2026.
- HKUST NLP, Toolathlon-Verified, 30 de junio de 2026.
- vLLM, recetas de despliegue para DeepSeek-V4-Flash, consultadas el 4 de agosto de 2026.