IA en la práctica

Qué es un harness: la infra que hace que la IA rinda de verdad

Qué es un harness: la infra que hace que la IA rinda de verdad

En el primer texto de la serie conté la incomodidad que me hizo empezar a reconstruir tech en Prolog. Al final, prometí abrir cada parte. Empiezo por la que más me costó entender: el harness.

Aviso de entrada, no hay fórmula mágica acá. Es lo que leí, lo que vi a otras empresas hacer y lo que estamos tratando de hacer, con aciertos y con errores.

Pasé meses buscando un nombre para algo que sentía y no sabía decir.

La palabra que faltaba

Yo veía empresas de tres personas entregando lo que antes pedía treinta. Y veía que la ganancia no estaba en el modelo, porque el modelo todo el mundo lo usa parecido. Estaba en otro lugar, y yo no tenía la palabra.

En febrero de 2026 OpenAI publicó un texto llamado Harness Engineering y me dio la palabra.

Su definición abre con dos líneas cortas: “Los humanos dirigen. Los agentes ejecutan.” Y lo que viene después cambia la forma de pensar: el trabajo principal de un equipo de ingeniería deja de ser escribir código, y pasa a ser diseñar entornos, especificar la intención y construir loops de feedback que dejen a los agentes hacer trabajo confiable.

Cada pedazo ahí es trabajo de verdad. Diseñar el entorno donde el agente corre. Dejar claro qué hay que hacer, la intención, en vez del paso a paso. Y armar los loops que le dicen a la IA si acertó, para que se corrija sola.

Fíjate en lo que desapareció de la frase: escribir el código. No es OpenAI diciendo que el código no importa. Es OpenAI diciendo que, cuando la IA escribe la mayor parte, el trabajo humano sube una capa. Y cuando algo se rompe, la pregunta cambia con eso. Deja de ser “prueba de nuevo, esfuérzate más” y pasa a ser “qué capacidad faltó en el entorno para que la IA acertara”. El bug deja de ser culpa de la IA (“es tonta”) y pasa a ser una pregunta sobre qué faltó a su alrededor.

El harness, entonces, es organizar código, proceso y trabajo para que la IA vea, entienda y ejecute. No es una herramienta que se compra. Es una forma nueva de pensar lo que el equipo entrega.

El modelo es una cosa, el harness es otra

La frase más económica que encontré para fijar esto vino de Vivek Trivedy, ingeniero de LangChain: “si no es un modelo, entonces es el harness”.

El modelo es el LLM crudo. Opus, GPT, lo que sea. Entra texto, sale texto, fin. Y el modelo lo tiene prácticamente todo el mundo. Es commodity. La diferencia entre quien gana 10% y quien gana 5x no está en el modelo.

Está en el harness. El harness es todo lo demás: el código, las herramientas que la IA puede llamar, el contexto que ella ve, los hooks, la orquestación, el sandbox donde corre, la memoria, las reglas de negocio. Todo lo que envuelve al modelo en el flujo, antes de que el trabajo llegue hasta ti terminado.

Harness no tiene buena traducción al español. Arnés, atadura, pierde el sentido. Yo lo llamo “la infraestructura del agente” y listo.

Quizás ya escuchaste “ingeniería de contexto”. Es parte de esto, la parte de organizar lo que la IA ve. El harness es más grande: incluye el contexto, pero también las herramientas, los hooks, el sandbox, la persistencia, la orquestación. El contexto es un pedazo; el harness es el todo.

Si no es un modelo, entonces es el harness

Modelo vs. harness

Harness · todo lo que envuelve al modelo
Código
Contexto
Herramientas
Hooks
Modelo el LLM crudo entra texto, sale texto
Orquestación
Sandbox
Memoria
Reglas de negocio

El modelo es un commodity, casi todos usan el mismo. Lo que separa la ganancia del 10% de la de 5x es lo que lo envuelve.

El modelo es el núcleo. El harness es todo lo que envuelve al modelo en el flujo de entrega.

El harness es hacer que todo sea legible para la IA

Si tuviera que resumir el harness en un solo principio, sería este: hacer que todo sea legible para la IA.

En el texto anterior conté el diagnóstico que me pegó. El contexto de Prolog vivía desparramado. Un pedazo en Notion, otro en Drive, otro en Jira, en Figma. No había una fuente única. Cada conversación nueva con la IA empezaba de cero, porque la información que ella necesitaba estaba en cinco lugares y curada en ninguno.

Cuando relees eso por la lente del harness, el problema queda obvio. La IA no veía. Y lo que no ve, no lo usa.

Peter Pang, CTO de CREAO, contó una decisión que parece radical y tiene todo el sentido: juntó todo el código en un único monorepo. El motivo no fue orden. Fue para que la IA pudiera ver todo de una vez.

Ese es el trabajo. No es un prompt inteligente, no es un truco. Es agarrar lo que está desparramado, implícito, vivo solo en la cabeza de las personas, y dejarlo legible en un lugar, escrito, accesible para el agente. Aburrido a veces. Pero es exactamente eso lo que separa la ganancia de 10% de la ganancia de 5x.

Te aviso por correo cada vez que sale contenido nuevo. Sin spam.

La prueba: 3 ingenieros, 1 millón de líneas

Desconfío del hype por naturaleza. Así que lo que me convenció de que esto no era una moda fue un caso con número.

El equipo de OpenAI que construyó el Codex CLI, su herramienta de línea de comandos, era de tres ingenieros. En cuestión de semanas, entregaron cerca de un millón de líneas de código: aplicación, infra, tooling, documentación. Y cero líneas escritas a mano. La filosofía del equipo, dicha por ellos, era “nada de código escrito manualmente”. Fueron cerca de mil quinientos pull requests, todos integrados, ninguno tipeado por una persona. Los tres dirigían, la IA construía.

Para que no se confunda: OpenAI tiene Codex, que es el modelo entrenado para código, y el Codex CLI, que es la herramienta. Los tres usaron el modelo, a través de la herramienta, para construir la propia herramienta. La cosa construyéndose con ella misma.

Y no termina ahí. Dentro de toda OpenAI, Codex revisa el 100% de los pull requests de la empresa.

Lo que lo cerró para mí no fue el número de OpenAI solo. Fue que Peter Pang, en CREAO, llegó a la misma conclusión por un camino separado, sin coordinar con nadie. Dos lugares distintos describiendo la misma cosa. Cuando eso pasa, en general no es moda. Es patrón.

OpenAI · el equipo que construyó el Codex CLI

Tres personas dirigiendo, la IA construyendo. Cero código escrito a mano.

3
ingenieros dirigiendo al agente
~1M
líneas de código en pocas semanas: app, infra, tooling, docs
~1.5k
pull requests integrados, ninguno tecleado por una persona

no manually-written code la filosofía declarada del equipo. Y dentro de toda OpenAI, el Codex revisa el 100% de los pull requests.

El caso que hizo que el término dejara de sonar a hype: 3 personas dirigiendo, la IA construyendo.

AI-assisted no es lo mismo que AI-first

Acá necesito ser honesto sobre dónde está Prolog.

Hay una diferencia que casi nadie percibe entre usar IA para asistir el trabajo y poner la IA en el centro de él.

AI-assisted es el humano en el centro y la IA enchufada en las puntas. Mismo sprint, mismo board, misma reunión, mismo flujo. La IA ayuda dentro del proceso que ya existía. La ganancia es real y es chica: 10, 20%. Es donde está la mayoría de las empresas. Es donde está Prolog hoy, y no voy a fingir lo contrario.

AI-first es la IA en el centro y el humano dirigiendo. Asumes que el agente es el constructor primario y rehaces el proceso, la arquitectura y hasta la organización alrededor de eso. El humano critica, valida, juzga. La ganancia es de otro orden: 5x, 10x. Es lo que están haciendo Codex, CREAO y Anthropic.

La diferencia, como la resume Peter Pang, es multiplicativa, no incremental. Y es por eso que el harness importa tanto. No llegas al AI-first enchufando IA en lo que ya existe. Llegas reconstruyendo para que la IA vea, entienda y ejecute. O sea, haciendo harness.

Y esto no es solo un problema de ingeniería

La frase de OpenAI, “el trabajo principal ya no es escribir código”, fue escrita pensando en ingeniería. Pero cuando la releí cambiando el sujeto, entró en todo cargo de tech.

Producto ya no escribe solo el documento; capacita al agente a proponer la solución. Diseño ya no dibuja solo la pantalla; capacita al agente a generar interfaz dentro del sistema. QA ya no corre solo el test a mano; capacita al agente a validar. Datos ya no corre solo la query; capacita al agente a responder la pregunta de negocio.

En todos ellos la pregunta se vuelve la misma: qué capacidad le falta al agente para hacer esto, y cómo lo hago visible y controlable para él.

Lo que me llevo de esto

El harness no es una herramienta que se compra ni un modelo mejor que se suscribe. Es trabajo. El trabajo de agarrar lo que está en la cabeza de las personas y desparramado en diez sistemas y dejarlo legible, en un solo lugar, para que una máquina lo pueda usar.

La parte aburrida es que no hay atajo. La parte buena es que, al ser trabajo, se puede hacer. Estamos en el medio de él: lejos del AI-first, más cerca de lo que estábamos hace dos meses. Voy a seguir contando cómo vaya yendo.

Fuentes

Te aviso por correo cada vez que sale contenido nuevo. Sin spam.

Protegido contra spam.