Learn Harness Engineering — Índice

Por: Artiko
harnessagentesclaude-codecodexloop-engineeringgraph-engineeringia

Learn Harness Engineering

Curso sobre harness engineering: la disciplina de diseñar el entorno, el estado, la verificación y los sistemas de control que hacen que un agente de programación como Codex o Claude Code pase de “poco fiable” a “fiable”.

Agent = Model + Harness

Si no son pesos del modelo, es harness. El modelo aporta la capacidad bruta; el harness determina cuánta de esa capacidad se convierte en trabajo terminado y verificado.

Este curso es una adaptación al español del material de Learn Harness Engineering, sintetizado a partir de las fuentes primarias de OpenAI, Anthropic, Thoughtworks y la comunidad.


Por qué existe este curso

Le entregás un proyecto real a un agente. Agrega una función pero rompe los tests, corrige un bug e introduce dos, corre veinte minutos y anuncia con orgullo “terminado”. Mirás el código y no es lo que pediste.

El instinto es culpar al modelo y pagar por uno más caro. Casi siempre es el harness: la tarea nunca se definió con claridad, las convenciones del proyecto viven en la cabeza de alguien, el entorno está incompleto, no hay forma de verificar nada y la sesión anterior no dejó rastro.

Los números lo respaldan. Anthropic corrió el mismo prompt con el mismo modelo dos veces: sin harness, 20 minutos, 9 dólares, el juego no funcionaba; con harness completo de tres agentes, 6 horas, 200 dólares, el juego era jugable. El modelo no cambió. Cambió el equipo de monta.


Mapa del curso

flowchart TD
    A["Lecciones 1-2<br/>Diagnóstico y definición"] --> B["Lecciones 3-4<br/>Instrucciones y repositorio"]
    B --> C["Lecciones 5-6<br/>Estado e inicialización"]
    C --> D["Lecciones 7-8<br/>Alcance y feature list"]
    D --> E["Lecciones 9-10<br/>Verificación real"]
    E --> F["Lecciones 11-12<br/>Observabilidad y handoff"]
    F --> G["Lección 13<br/>Loop Engineering"]
    G --> H["Lección 14<br/>Graph Engineering"]
    H --> I["Capítulos 15-18<br/>Análisis, plantillas y práctica"]

Las doce primeras lecciones construyen el harness. La 13 te saca del loop. La 14 convierte el loop en un grafo. Los capítulos finales aterrizan todo en archivos que podés copiar hoy.


Contenido

Parte I — Fundamentos

#CapítuloFoco
1Los modelos fuertes no significan ejecución fiableBrecha de capacidad, cinco capas de fallo, bucle diagnóstico
2Qué significa realmente harnessLos cinco subsistemas, ablación de componentes

Parte II — Instrucciones y contexto

#CapítuloFoco
3El repositorio como fuente única de verdadPrueba de arranque en frío, ACID para estado de agentes
4Divide las instrucciones entre archivosInstruction bloat, lost in the middle, archivo de enrutamiento

Parte III — Estado y ciclo de vida

#CapítuloFoco
5Mantené vivo el contexto entre sesionesAnsiedad de contexto, artefactos de continuidad, compaction vs reset
6Inicializá antes de cada sesiónContrato de bootstrap, arranque en frío vs caliente

Parte IV — Alcance y verificación

#CapítuloFoco
7Definí límites claros para las tareasSobrealcance, WIP=1, evidencia de completitud
8Listas de funciones como primitivas del harnessTriple conductual, máquina de estados, pass-state gating
9Evitá que el agente declare victoria antes de tiempoSesgo de calibración, validación en tres capas, generador/evaluador
10Solo las pruebas end-to-end son verificación realDefectos de límite, reglas arquitectónicas ejecutables

Parte V — Operación

#CapítuloFoco
11Hacé observable el runtime del agenteSprint contracts, rúbricas, trazas de tarea
12Dejá un handoff limpio al final de cada sesiónCinco dimensiones del clean state, simplificación del harness

Parte VI — Más allá del harness

#CapítuloFoco
13Del prompting manual a los loops autónomos/goal, seis primitivas del loop, cuatro costes silenciosos
14De los loops únicos a la ingeniería de grafosNodos, aristas, routing, orchestration tax

Parte VII — Aplicación

#CapítuloFoco
15Análisis de harnesses realesPi, Claude Code, Codex y DeepSeek Harness
16Biblioteca de plantillasAGENTS.md, init.sh, feature_list.json, handoff, rúbricas
17Proyectos prácticosOcho proyectos progresivos con criterios de medición
18El skill harness-creator y la biblioteca de referenciaAutomatizar la construcción del harness, fuentes primarias

Cómo recorrerlo

  • Si tu agente falla y no sabés por qué: leé las lecciones 1 y 2. Te dan el vocabulario para atribuir cada fallo a una capa concreta en lugar de decir “el modelo es malo”.
  • Si querés el retorno más rápido: lecciones 3, 4 y 16. Un AGENTS.md bien escrito de 80 líneas más los comandos de verificación explícitos suele mover más la aguja que cambiar de modelo.
  • Si las tareas largas se te desarman: lecciones 5, 6 y 12. Continuidad, inicialización y handoff son un mismo problema visto desde tres momentos del ciclo de vida.
  • Si el agente dice “listo” y no está listo: lecciones 8, 9 y 10. La cura es externalizar el juicio de finalización, no pedirle al agente que sea más humilde.
  • Si ya tenés un harness sólido y querés dejar de apretar “enter”: lecciones 13 y 14.
  • Si querés practicar: capítulo 17. Cada proyecto se corre dos veces —sin harness y con harness— y la comparación es el aprendizaje.

Fuentes primarias