ztzoff.tech

24 jun 2026

Un modelo no puede corregir su propia tarea

Los loops que se automejoran generan sus propios datos y derivan si el modelo también los juzga. Lo que sí funciona añade un verificador externo, no un modelo más grande.

La promesa de un modelo que se automejora es seductora: genera problemas más difíciles, los resuelve, aprende de sus propias soluciones y vuelve a empezar. Sin etiquetado humano, con datos prácticamente infinitos y con ganancias que se acumulan solas. El modo de fallo es igual de nítido. Un modelo que genera sus propios datos de entrenamiento y además los juzga va a reforzar sus errores con total confianza. El loop no mejora: deriva, rápido, hacia un sitio que nadie eligió.

Entre uno y otro desenlace hay un solo componente: un verificador al que el modelo no pueda convencer hablando.

Generar nunca fue el cuello de botella

La línea de trabajo de Evol-Instruct —MMEvol y parientes— hace evolucionar un pequeño conjunto semilla de instrucciones hasta convertirlo en un dataset más grande, más difícil y más variado. Funciona, y es genuinamente útil. Pero fíjate en qué produce: más datos. Y más datos nunca fue la restricción. La restricción es saber cuáles de esos datos son correctos. Un montón de problemas evolucionados con respuestas equivocadas y seguras de sí mismas no le enseña nada a un modelo, salvo a equivocarse con aplomo y a escala.

El verificador es lo que hace funcionar el loop

Las versiones que de verdad mejoran un modelo añaden una señal externa de corrección. WizardMath usa aprendizaje por refuerzo sobre el feedback de Evol-Instruct: premia al modelo según una señal de si el razonamiento estuvo bien, no de si al modelo le gustó su propia respuesta. El resultado que reportan es llamativo: un WizardMath de 70B por delante de GPT-3.5-Turbo, Claude 2 y Gemini Pro en matemáticas. No por generar más, sino porque algo distinto del modelo decidía qué contaba.

El punto estructural aguanta aunque ignores el leaderboard: generar y verificar tienen que ser cosas separadas. En cuanto el generador es también el juez, el gate es decorativo —siempre va a aprobar, porque el candidato lo produjo él. Autocorregirse no es control de calidad; es un amplificador de confianza.

La lección de producción, disfrazada de loop de entrenamiento

Es la misma forma a la que llegamos una y otra vez, solo que en el entrenamiento en lugar del runtime. El slop de IA es lo que sale de publicar sin un gate; un loop que se automejora sin verificador independiente es ese mismo fallo con un ciclo de feedback atornillado encima: se vuelve más seguro de sí mismo, no más correcto. Los sistemas de agentes más sólidos aplican la misma disciplina en el runtime, con un verificador que revisa la acción antes de dejar que cuente.

Sean datos de entrenamiento o salida en vivo, la regla no cambia: el modelo produce candidatos infinitos y todo el valor vive en lo que decide cuáles se quedan. Esa decisión es también lo que convierte «generamos un montón» en «el modelo más barato que pasa»: un eval, no una intuición.

Generar es barato y cada día lo es más. El juicio es la parte escasa, y no puede salir de aquello que está siendo juzgado. Construye el verificador aparte, o tu loop de automejora será solo una forma más rápida de memorizar tus propios errores.

Agenda una llamada