Google search engine
Inicio Noticias y Actualidad Modelos Anthropic reserva Model 2: su mejor IA no será pública

Anthropic reserva Model 2: su mejor IA no será pública

0
27
Anthropic reserva Model 2

Llevo dos años construyendo encima de una premisa que nunca me molesté en cuestionar: que el mejor modelo de inteligencia artificial que Anthropic sabe entrenar es, más o menos, el mejor modelo al que yo puedo llamar por API. Que la distancia entre el laboratorio y el curl era cuestión de unas semanas de pruebas de seguridad y de que se estabilizara el precio por token. Esta semana esa premisa se ha caído, y no por una filtración ni por un rumor de foro: la ha tirado la propia compañía en un documento oficial.

En su informe de riesgo de agosto describe un modelo interno, Model 2, de la clase Mythos, que supera a Claude Mythos 5 en muchas tareas internas —con mejoras destacadas en codificación, generación de datos y tareas de agentes— y añade, sin demasiado énfasis, que no hay planes de lanzarlo públicamente.

No tengo una postura indignada al respecto. Tengo una postura incómoda, que es peor, porque no se resuelve escribiendo un tuit enfadado. Lo que ha cambiado no es que existan secretos: los tiene todo el mundo. Lo que ha cambiado es que ahora sé el nombre del secreto, sé en qué me gana y sé que la decisión de no dármelo es deliberada y de duración indefinida.

«No hay planes de lanzarlo»: Un cambio de paradigma en el desarrollo de LLMs

Hasta ahora, cuando un laboratorio hablaba de un modelo sin publicar, lo hacía en modo anticipo: mira lo que viene, apúntate a la lista de espera. La formulación de agosto es distinta y conviene leerla despacio. No dice «más adelante». No dice «en acceso anticipado para Enterprise». Dice que no hay planes. Es una frase que solo se escribe cuando la decisión no depende del calendario de producto, sino de otra cosa.

Y ahí está lo que me hace ruido. Durante toda la era de los modelos frontera, capacidad y disponibilidad han ido de la mano: lo mejor que existía era, con retraso, lo mejor que podías usar. Si esa correlación se rompe, la pregunta que todos los que facturamos con esto nos hemos hecho —«¿qué voy a poder hacer el año que viene que hoy no pueda?»— deja de deducirse del estado del arte y pasa a depender de una decisión interna que no vas a ver venir.

El techo de lo que puedo ofrecer a mis clientes ya no lo fija el estado del arte, sino la política comercial de un proveedor.

Que conste: entiendo que un laboratorio se guarde herramientas para uso propio. Un modelo interno que ayuda a entrenar al siguiente o a auditar sus propios sistemas es una ventaja competitiva legítima. Lo que me interesa no es el hecho, sino lo que implica para quien planifica un negocio encima.

Evaluación de riesgos en Anthropic: Desalineación y seguridad en IA

Hay un segundo dato que ayuda a entender la decisión. En ese documento, la compañía eleva su calificación de riesgo de desalineación catastrófica de «muy bajo» a «bajo», y afirma que ahora opera como si sus modelos actuales pudieran asistir de forma significativa a actores maliciosos. Es un cambio de una sola categoría, en la parte baja de la escala, y aun así es la primera vez que ese indicador se mueve hacia arriba.

Leídos juntos, el modelo que no se publica y la subida del nivel de riesgo forman una explicación coherente: se lo quedan porque todavía no les parece prudente servirlo. Me inclino a tomármelo en serio. La postura lleva años sosteniéndose de forma bastante consistente, y subir públicamente tu propio indicador de riesgo semanas antes de una salida a bolsa (IPO) no es precisamente el movimiento de quien busca el titular cómodo.

⚠️ Lo que no se puede comprobar desde fuera
Quien decide qué es demasiado capaz para publicarse es la misma organización a la que le conviene no publicarlo. Ese solapamiento existe aunque la decisión se tome de buena fe, y es la razón por la que conviene planificar sobre lo que puedes usar hoy y no sobre lo que se supone que llegará.

Impacto en automatización: Codificación, generación de datos y agentes

Si el modelo interno destacara en poesía o en traducción literaria, esto sería una curiosidad. Pero las tres áreas que menciona el informe —codificación, generación de datos y tareas de agentes— son, casi literalmente, la descripción de mi trabajo. Claude Code sobre repositorios de clientes. Flujos de n8n que generan y transforman datos. Cadenas de agentes que hacen mantenimiento de WordPress sin que yo esté delante.

Lo que eso significa en la práctica: el techo de lo que puedo automatizar para un cliente no lo marca mi habilidad montando el flujo, ni mi presupuesto de tokens. Lo marca una decisión de producto que se toma en un edificio al que no tengo acceso. Puedo optimizar mis instrucciones, afinar mis archivos de contexto, partir mejor las tareas, y aun así estar trabajando con una versión deliberadamente inferior de la herramienta que existe.

Estrategia para desarrolladores ante el estancamiento de modelos

No voy a irme de Claude. Sería una reacción emocional y además equivocada: Mythos 5 sigue siendo excelente para lo que hago y el ecosistema de Claude Code no tiene hoy sustituto real en mi flujo. Pero sí cambio tres cosas, y las tres son aburridas y baratas.

  • Dejar de prometer capacidades futuras: He hecho propuestas donde la frase «esto en seis meses lo hará solo» era parte del argumento. Ahora es una apuesta sobre decisiones ajenas, no sobre una tendencia. Fuera de las propuestas.
  • Separar el valor del modelo del valor del andamiaje: Conocer el negocio del cliente, saber qué se puede automatizar sin romper nada y tener el flujo montado y auditable es mío, y no depende de qué versión me sirvan. Cuanto más peso tenga esa parte, menos me afecta el techo del proveedor.
  • Planificar el estancamiento como escenario: Nunca había construido un supuesto de «el modelo no mejora en dieciocho meses». Ahora sé que es un escenario posible y merece su columna en la hoja de cálculo.

Lo que me llevo del informe de agosto no es miedo a un modelo peligroso encerrado en un laboratorio. Es algo más mundano y más útil: la confirmación de que la capacidad disponible puede estancarse a propósito. Si tu plan de negocio para el año que viene daba por hecho que las herramientas iban a mejorar solas, esta semana toca reescribirlo.

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí