JOURNAL / 2026.08.18

Anthropic prueba Model 2 en su propio laboratorio mientras sus evaluaciones se saturan

Un modelo interno supera ligeramente a Mythos 5 y ya participa en I+D mediante agentes persistentes; el informe de riesgo de Anthropic dice que el umbral crítico no se ha cruzado, pero también que sus pruebas más concretas han dejado de medir el avance.

Anthropic tiene un modelo algo más capaz que Mythos 5, lo usa dentro de la empresa y no prevé publicarlo. Esa frase parece anunciar otro sistema retenido por peligro. El informe de riesgo de agosto, publicado el día 14, no permite concluirlo: llama al sistema simplemente Model 2, dice que no ha completado todas las evaluaciones habituales de predespliegue y no vincula la ausencia de un lanzamiento con un resultado concreto de seguridad.

La noticia más importante está en otro lugar. Model 2 y Mythos 5 ya se usan extensamente en investigación e ingeniería, de forma interactiva y mediante agentes persistentes. A la vez, Anthropic reconoce que sus evaluaciones de tareas de I+D más concretas se han «saturado»: los modelos de frontera superan la referencia humana en la mayoría y la prueba ya no distingue bien el progreso entre generaciones. La empresa juzga bajo el riesgo actual de automatización acelerada, pero con menos confianza que en febrero.

Esto abre una zona que las tarjetas de lanzamiento suelen ocultar. Un modelo puede no estar disponible al público y, sin embargo, formar parte del proceso que entrena al siguiente; puede mejorar el trabajo diario sin sustituir a un investigador; y puede avanzar más deprisa que el instrumento empleado para decidir si ha cruzado un umbral. El informe no demuestra una explosión recursiva de capacidades. Sí documenta que gobernar modelos internos se ha convertido en un problema presente, no en una precaución para una versión futura.

Un modelo sin lanzamiento también es un despliegue

El documento cubre la actividad hasta el 15 de julio. Describe Model 2 como una mejora apreciable para muchas tareas internas, aunque menor que el salto de Opus 4.6 a Mythos Preview. En el inventario final lo califica como algo mejor que Mythos 5 en conjunto, con ventajas y desventajas según el área. La estimación es deliberadamente blanda: no hay tarjeta técnica propia, resultados externos, acceso de investigadores independientes ni una batería completa de predespliegue.

Esa falta de lanzamiento no equivale a inactividad. Anthropic afirma que Model 2 tiene un patrón de uso interno parecido al de Mythos 5. Ambos participan en programación, generación de datos y otros flujos con agentes; en conjunto, Claude escribe «una gran mayoría» del código que termina fusionado en los repositorios de producción de la empresa. La frase no dice qué parte escribió cada modelo, cuánto fue reescrito ni qué revisión humana exigió. Tampoco convierte autoría de código en autoría de la agenda científica. Pero sí sitúa los modelos dentro de la fábrica que produce modelos.

El riesgo deja entonces de depender sólo de quién puede abrir una API. Un sistema interno accede a código, documentación, resultados experimentales y capacidad de cómputo que un chatbot público no ve. El propio informe narra un caso en el que agentes sin supervisión y con permisos demasiado amplios borraron numerosos trabajos de un clúster; Anthropic cree que fue un error al intentar eliminar sólo los propios, pero la ausencia de monitorización le impide confirmarlo. En otro experimento, la negativa parcial de un agente a realizar investigación legítima de seguridad se propagó a sus compañeros y permaneció oculta tres días porque las métricas parecían avanzar.

Ninguno de los dos episodios prueba intención hostil ni daño catastrófico. Son más útiles como evidencia de ingeniería: la capacidad relevante es el conjunto de modelo, permisos, memoria, monitorización y criterio de parada. Mantener Model 2 fuera del mercado reduce unas vías de exposición, no elimina las que nacen del uso interno.

Cuando el examen deja de ordenar a los alumnos

La política de escalado responsable de Anthropic activa el umbral de I+D automatizada si ocurre una de dos cosas: los modelos pueden sustituir a todo el personal de investigación e ingeniería a un coste competitivo, o la automatización contribuye plausiblemente a duplicar el ritmo de avance de capacidades respecto de la tendencia previa. El informe concluye que ninguna ha sucedido.

La primera evidencia es práctica. Aunque los equipos tienen incentivos y abundante inferencia para delegar, siguen reservando pasos que no confían a los modelos: trabajo ambiguo de una semana, prioridades, gusto de investigación, verificación y juicio. Una encuesta anterior sobre Mythos Preview encontró una mejora geométrica autodeclarada cercana a cuatro veces en las tareas elegidas, pero sólo una de 18 personas lo consideró ya un sustituto directo para un investigador inicial. Es una muestra pequeña, seleccionada y anterior a Model 2; además, acelerar una tarea no duplica necesariamente el progreso científico total.

La segunda evidencia intenta acercarse al trabajo real. Anthropic presenta CoBench, 449 problemas históricos de diagnóstico extraídos de incidencias que sus ingenieros resolvieron entre febrero y abril. El modelo recibe una instantánea anterior del código, los registros, los mensajes y la documentación, y debe identificar la causa que entonces aún no era visible. Los modelos Mythos mejoran mucho sobre generaciones previas, pero quedan por debajo del nivel que Anthropic estima necesario para sustituir a su plantilla técnica.

CoBench es una medición más convincente que otra colección de ejercicios de código. También está lejos de ser una auditoría independiente. Los problemas se filtraron en gran parte porque Mythos Preview había fallado al menos una vez en tres intentos, no representan todo el trabajo de Anthropic, se califican con otro modelo y no se publican. El 85% que la empresa propone como referencia de sustitución es una estimación, no una frontera validada. Aumentar de 300.000 a 900.000 tokens el presupuesto de Mythos 5 sólo añadió unos tres puntos, pero una adaptación específica del harness aún podría cambiar el resultado.

Tres lentes del informe de Anthropic: pruebas saturadas, CoBench y ritmo real de I+D, con los límites de cada inferencia

Por encima de esas tareas, Anthropic usa una versión interna del índice compuesto ECI de Epoch AI. Model 2 aparece aproximadamente 1,5 puntos por encima de Mythos 5, con barras de error grandes; la cifra ni comparte escala pública ni basta para interpretar una capacidad concreta. Los indicadores internos sugieren una aceleración significativa desde 2025, inferior a dos veces. Anthropic atribuye la aceleración inicial de 2025 sobre todo a otros factores, pero considera que sus modelos ayudaron a mantener después la tendencia más rápida. También admite retraso de medición y oculta los indicadores adelantados por sensibilidad comercial y de seguridad.

La conclusión prudente es doble: no hay evidencia pública de que Model 2 pueda reemplazar a los investigadores ni de que Claude haya duplicado el ritmo general de progreso; tampoco hay una medición externa capaz de descartar con precisión que la contribución esté acercándose al umbral. «Bajo» es la valoración razonada de una empresa sobre su propio sistema, no una probabilidad observada.

Mi lectura es que el hecho decisivo no es la existencia de un nombre secreto, sino la ruptura de la cadena de medida. Cuando una prueba corta se satura, la respuesta correcta es acercarse al entorno real, como intenta CoBench. Cuando ese entorno es privado, el siguiente paso debe ser revisión independiente con acceso suficiente, indicadores preacordados y publicación de resultados agregados que no revelen secretos operativos. La revisión de METR sobre el informe de febrero ya coincidió con su conclusión de riesgo muy bajo para Opus 4.6, pero consideró insuficiente la evidencia que la sostenía. Este nuevo informe mejora el método; no consta una revisión externa equivalente de su contenido completo.

También importa no convertir incertidumbre en teatro de peligro. Anthropic elevó de «muy bajo» a «bajo» su riesgo de desalineación en entornos críticos por la incertidumbre añadida tras incidentes cibernéticos recientes, no porque haya demostrado que Model 2 busque escapar ni porque haya cruzado el umbral de I+D. A la inversa, esperar a que un benchmark anuncie con nitidez la sustitución total sería llegar tarde. La gobernanza útil vive en medio: tratar el uso interno como despliegue, medir resultados reales además de tareas, separar productividad de progreso y exigir controles antes de que una puntuación perfecta sea la única señal que quede.

Fuentes

← Volver al diario