Learn Harness Engineering — Índice
Learn Harness Engineering
Curso sobre harness engineering: la disciplina de diseñar el entorno, el estado, la verificación y los sistemas de control que hacen que un agente de programación como Codex o Claude Code pase de “poco fiable” a “fiable”.
Agent = Model + Harness
Si no son pesos del modelo, es harness. El modelo aporta la capacidad bruta; el harness determina cuánta de esa capacidad se convierte en trabajo terminado y verificado.
Este curso es una adaptación al español del material de Learn Harness Engineering, sintetizado a partir de las fuentes primarias de OpenAI, Anthropic, Thoughtworks y la comunidad.
Por qué existe este curso
Le entregás un proyecto real a un agente. Agrega una función pero rompe los tests, corrige un bug e introduce dos, corre veinte minutos y anuncia con orgullo “terminado”. Mirás el código y no es lo que pediste.
El instinto es culpar al modelo y pagar por uno más caro. Casi siempre es el harness: la tarea nunca se definió con claridad, las convenciones del proyecto viven en la cabeza de alguien, el entorno está incompleto, no hay forma de verificar nada y la sesión anterior no dejó rastro.
Los números lo respaldan. Anthropic corrió el mismo prompt con el mismo modelo dos veces: sin harness, 20 minutos, 9 dólares, el juego no funcionaba; con harness completo de tres agentes, 6 horas, 200 dólares, el juego era jugable. El modelo no cambió. Cambió el equipo de monta.
Mapa del curso
flowchart TD
A["Lecciones 1-2<br/>Diagnóstico y definición"] --> B["Lecciones 3-4<br/>Instrucciones y repositorio"]
B --> C["Lecciones 5-6<br/>Estado e inicialización"]
C --> D["Lecciones 7-8<br/>Alcance y feature list"]
D --> E["Lecciones 9-10<br/>Verificación real"]
E --> F["Lecciones 11-12<br/>Observabilidad y handoff"]
F --> G["Lección 13<br/>Loop Engineering"]
G --> H["Lección 14<br/>Graph Engineering"]
H --> I["Capítulos 15-18<br/>Análisis, plantillas y práctica"]
Las doce primeras lecciones construyen el harness. La 13 te saca del loop. La 14 convierte el loop en un grafo. Los capítulos finales aterrizan todo en archivos que podés copiar hoy.
Contenido
Parte I — Fundamentos
| # | Capítulo | Foco |
|---|---|---|
| 1 | Los modelos fuertes no significan ejecución fiable | Brecha de capacidad, cinco capas de fallo, bucle diagnóstico |
| 2 | Qué significa realmente harness | Los cinco subsistemas, ablación de componentes |
Parte II — Instrucciones y contexto
| # | Capítulo | Foco |
|---|---|---|
| 3 | El repositorio como fuente única de verdad | Prueba de arranque en frío, ACID para estado de agentes |
| 4 | Divide las instrucciones entre archivos | Instruction bloat, lost in the middle, archivo de enrutamiento |
Parte III — Estado y ciclo de vida
| # | Capítulo | Foco |
|---|---|---|
| 5 | Mantené vivo el contexto entre sesiones | Ansiedad de contexto, artefactos de continuidad, compaction vs reset |
| 6 | Inicializá antes de cada sesión | Contrato de bootstrap, arranque en frío vs caliente |
Parte IV — Alcance y verificación
| # | Capítulo | Foco |
|---|---|---|
| 7 | Definí límites claros para las tareas | Sobrealcance, WIP=1, evidencia de completitud |
| 8 | Listas de funciones como primitivas del harness | Triple conductual, máquina de estados, pass-state gating |
| 9 | Evitá que el agente declare victoria antes de tiempo | Sesgo de calibración, validación en tres capas, generador/evaluador |
| 10 | Solo las pruebas end-to-end son verificación real | Defectos de límite, reglas arquitectónicas ejecutables |
Parte V — Operación
| # | Capítulo | Foco |
|---|---|---|
| 11 | Hacé observable el runtime del agente | Sprint contracts, rúbricas, trazas de tarea |
| 12 | Dejá un handoff limpio al final de cada sesión | Cinco dimensiones del clean state, simplificación del harness |
Parte VI — Más allá del harness
| # | Capítulo | Foco |
|---|---|---|
| 13 | Del prompting manual a los loops autónomos | /goal, seis primitivas del loop, cuatro costes silenciosos |
| 14 | De los loops únicos a la ingeniería de grafos | Nodos, aristas, routing, orchestration tax |
Parte VII — Aplicación
| # | Capítulo | Foco |
|---|---|---|
| 15 | Análisis de harnesses reales | Pi, Claude Code, Codex y DeepSeek Harness |
| 16 | Biblioteca de plantillas | AGENTS.md, init.sh, feature_list.json, handoff, rúbricas |
| 17 | Proyectos prácticos | Ocho proyectos progresivos con criterios de medición |
| 18 | El skill harness-creator y la biblioteca de referencia | Automatizar la construcción del harness, fuentes primarias |
Cómo recorrerlo
- Si tu agente falla y no sabés por qué: leé las lecciones 1 y 2. Te dan el vocabulario para atribuir cada fallo a una capa concreta en lugar de decir “el modelo es malo”.
- Si querés el retorno más rápido: lecciones 3, 4 y 16. Un
AGENTS.mdbien escrito de 80 líneas más los comandos de verificación explícitos suele mover más la aguja que cambiar de modelo. - Si las tareas largas se te desarman: lecciones 5, 6 y 12. Continuidad, inicialización y handoff son un mismo problema visto desde tres momentos del ciclo de vida.
- Si el agente dice “listo” y no está listo: lecciones 8, 9 y 10. La cura es externalizar el juicio de finalización, no pedirle al agente que sea más humilde.
- Si ya tenés un harness sólido y querés dejar de apretar “enter”: lecciones 13 y 14.
- Si querés practicar: capítulo 17. Cada proyecto se corre dos veces —sin harness y con harness— y la comparación es el aprendizaje.
Fuentes primarias
- OpenAI: Harness engineering — leveraging Codex in an agent-first world (2026-02-11)
- Anthropic: Effective harnesses for long-running agents (2025-11-26)
- Anthropic: Harness design for long-running application development (2026-03-24)
- Thoughtworks / Martin Fowler: Harness engineering for coding agent users (2026-04-02)
- Addy Osmani: Loop Engineering (2026-06)
- Learn Harness Engineering (walkinglabs) — material base de este curso