Capítulo 18 — El skill harness-creator y la biblioteca de referencia
Capítulo 18 — El skill harness-creator y la biblioteca de referencia
Llegado este punto tenés el marco conceptual (lecciones 1-14), los archivos concretos (capítulo 16) y la secuencia práctica (capítulo 17). Falta el último paso: empaquetar todo eso para no volver a construirlo a mano cada vez.
Qué es un skill de harness
Un skill es una plantilla de prompt autocontenida que un agente de programación —Claude Code, Codex, Cursor, Windsurf— puede cargar para realizar tareas especializadas. Es una carpeta con un SKILL.md que contiene instrucciones y metadatos, más scripts, referencias y assets opcionales.
harness-creator es un skill de nivel producción que ayuda a crear, evaluar y mejorar los cinco subsistemas centrales de un harness: instrucciones, estado, verificación, alcance y ciclo de vida de la sesión.
flowchart TD
S["SKILL.md<br/>instrucciones y metadatos"] --> A["Crear harnesses desde cero<br/>AGENTS.md, feature lists,<br/>flujos de verificación"]
S --> B["Mejorar harnesses existentes<br/>evaluación de 5 subsistemas<br/>con mejoras priorizadas"]
S --> C["Diseñar continuidad de sesión<br/>memoria persistente, progreso,<br/>procedimientos de handoff"]
S --> D["Aplicar patrones de producción<br/>memoria, context engineering,<br/>seguridad de herramientas"]
Instalación
npx skills add walkinglabs/learn-harness-engineering --skill harness-creator
Para usarlo con Claude Code, copiá el directorio harness-creator/ a la ruta de skills de tu proyecto (.claude/skills/), o apuntá tu agente al archivo SKILL.md.
Los siete patrones de referencia
El skill incluye siete documentos de referencia enfocados. Cada uno resuelve un modo de fallo específico:
| Patrón | Cuándo usarlo | Lección relacionada |
|---|---|---|
| Memory Persistence | El agente olvida entre sesiones | 5, 12 |
| Skill Runtime | Empaquetar workflows reutilizables como skills | 13 |
| Context Engineering | Gestión del presupuesto de contexto, carga just-in-time | 4, 5 |
| Tool Registry | Seguridad de herramientas, control de concurrencia | 2, 15 |
| Multi-Agent Coordination | Paralelismo, flujos de especialización | 9, 13, 14 |
| Lifecycle & Bootstrap | Hooks, tareas en segundo plano, inicialización | 6, 12 |
| Gotchas | 15 modos de fallo no obvios con sus correcciones | Todas |
Plantillas incluidas
El skill trae versiones listas para usar de los archivos del capítulo 16: agents.md (scaffold con reglas de trabajo), feature-list.json (JSON Schema y ejemplo), init.sh (script estándar de inicialización), progress.md (registro de progreso de sesión) y session-handoff.md.
También incluye scripts en Node.js puro para scaffolding, validación, informes HTML de evaluación y benchmarks estructurales.
Cómo se construyó: la metodología skill-creator
harness-creator se desarrolló usando skill-creator, el metaskill oficial de Anthropic para crear, probar e iterar skills de agentes. Ofrece un flujo estructurado de borrador → prueba → evaluación → iteración, con runners de evaluación, graders y un visor de benchmarks.
Vale la pena notar el bucle: es el mismo bucle diagnóstico de la lección 1, aplicado al harness mismo. Escribís el skill, lo corrés contra un conjunto de tareas, medís dónde falla, atribuís el fallo a una capa y corregís esa capa.
Construirlo vos mismo
Si preferís no instalar nada, el skill mínimo es un solo archivo. Esta es la estructura:
---
name: harness-creator
description: Crea, evalúa y mejora el harness de un proyecto. Usar cuando el usuario
pida "armá el harness", "por qué falla el agente en este repo", "auditá mi AGENTS.md"
o cuando un proyecto vaya a usarse con agentes de larga duración.
---
# Constructor de harness
## Paso 1 — Diagnóstico
Recorré el repositorio y respondé la prueba de arranque en frío:
1. ¿Qué es este sistema? 2. ¿Cómo está organizado? 3. ¿Cómo se ejecuta?
4. ¿Cómo se verifica? 5. ¿Cuál es el progreso actual?
Registrá cuáles NO podés responder solo con el contenido del repo.
## Paso 2 — Auditoría de los cinco subsistemas
Calificá de 1 a 5: instrucciones, herramientas, entorno, estado, retroalimentación.
Justificá cada nota con evidencia del repositorio.
## Paso 3 — Generación
Creá los archivos faltantes según el paquete mínimo:
AGENTS.md (≤200 líneas, router), init.sh, feature_list.json, claude-progress.md.
Extraé los comandos reales del repo (package.json, Makefile, pyproject.toml).
NO inventes comandos: si no encontrás uno, dejá un TODO explícito.
## Paso 4 — Verificación
Ejecutá init.sh. Si la verificación falla, arreglá la línea base antes de continuar.
Confirmá que una sesión nueva podría responder las cinco preguntas.
## Paso 5 — Informe
Entregá: notas de los cinco subsistemas, archivos creados, brechas restantes
priorizadas y las tres mejoras de mayor retorno.
Biblioteca de referencia del campo
Esta lista es intencionalmente estrecha. Un harness es el sistema de ejecución alrededor del modelo: el bucle del agente, ejecución de herramientas, sandboxing, estado, contexto, verificación, terminación, orquestación y observabilidad. Los artículos generales de prompt engineering o de frameworks amplios no entran en la lista principal.
Las tres fuentes fundacionales
| Fuente | Fecha | Aporte |
|---|---|---|
| OpenAI: Harness engineering — leveraging Codex in an agent-first world | 2026-02-11 | Repositorios agent-first, contexto repo-local, linting personalizado, barreras estructurales |
| Anthropic: Effective harnesses for long-running agents | 2025-11-26 | Agente inicializador, agente de codificación, feature list, registro de progreso, handoff |
| Anthropic: Harness design for long-running application development | 2026-03-24 | Roles planner/generator/evaluator, resets de contexto, simplificación del harness |
Altamente relevantes de 2026
- OpenAI: Unrolling the Codex agent loop (2026-01-23) — el runtime de Codex, llamadas de herramientas, crecimiento de contexto y terminación del bucle.
- Anthropic: Demystifying evals for AI agents (2026-01-09) — evaluar el modelo y el harness juntos, y distinguir harnesses de evaluación de harnesses de agentes.
- LangChain: Improving Deep Agents with harness engineering (2026-02-17) — mantener el modelo fijo mientras se mejoran prompts, herramientas, middleware, trazabilidad y autoverificación, moviendo un agente del Top 30 al Top 5 en Terminal Bench 2.0.
- Thoughtworks / Martin Fowler: Harness engineering for coding agent users (2026-04-02) — harnesses como guías de feedforward y sensores de feedback, con controles deterministas e inferenciales.
- Cursor: Continually improving our agent harness (2026-04-30) — el harness como producto en mejora continua, con evals offline, métricas online, taxonomía de errores de herramientas y ajuste específico por modelo.
Referencias extendidas por área
Runtime y protocolo del harness
- OpenAI: Unlocking the Codex harness — how we built the App Server (2026-02-04)
- OpenAI Developers: Run long horizon tasks with Codex (2026-02-23) — memoria durable de proyecto, validación de hitos, ejemplos de done-when.
- Anthropic: Scaling Managed Agents — decoupling the brain from the hands (2026-04-08) — meta-harness que separa sesión, harness y sandbox como interfaces intercambiables.
- Microsoft: Agent Harness in Agent Framework (2026-03-12)
Gestión de contexto
- LangChain: Context Management for Deep Agents (2026-01-28) — descarga al filesystem, truncamiento de llamadas de herramientas, resumen y evals dirigidos.
- LangChain: Tuning Deep Agents to Work Well with Different Models (2026-04-29) — perfiles de harness específicos por modelo.
- Anthropic: An update on recent Claude Code quality reports (2026-04-23) — esfuerzo de razonamiento, poda de contexto y system prompts como cambios del harness que necesitan gobernanza de regresión.
Multiagente y orquestación
- Anthropic: Building a C compiler with a team of parallel Claudes (2026-02-05) — equipos paralelos, locks de tareas, sincronización de git, aislamiento en contenedores.
- Cognition: Multi-Agents — What’s Actually Working (2026-04-22) — bucles generador-verificador, revisores de contexto limpio, coordinación manager-child.
- OpenAI: An open-source spec for Codex orchestration — Symphony (2026-04-27)
- Addy Osmani: The Orchestration Tax (2026-05)
Loops y grafos
- Addy Osmani: Loop Engineering (2026-06-07)
- Karpathy: autoresearch (2026-03)
- Simon Willison: Designing Agentic Loops
- LangChain: 3 Years of Graph Engineering with LangGraph (2026-07-22)
- Eigent: Graph Engineering for AI Agents (2026-07)
- iii.dev: Loops, Graphs, and the Layer That Matters (2026-07)
Casos de producción
- Stripe: Minions — one-shot, end-to-end coding agents (2026-02-09) y Parte 2 — aislamiento en devbox, máquinas de estado de blueprint, curación de herramientas MCP, feedback pre-push y CI.
- Cognition: What We Learned Building Cloud Agents (2026-04-23)
- Replit: Decision-Time Guidance (2026-01-20) — un clasificador liviano inyecta guía situacional corta en el punto de decisión, en lugar de meter todas las reglas en el system prompt.
- Vercel: How we made v0 an effective coding agent (2026-01-07)
- GitHub: Automate repository tasks with GitHub Agentic Workflows (2026-02-13)
- AWS: AI agents in enterprises — best practices with Bedrock AgentCore (2026-02-03)
Orden de lectura sugerido
flowchart TD
A["1. OpenAI — Harness engineering"] --> B["2. Anthropic — Effective harnesses"]
B --> C["3. Anthropic — Harness design<br/>for long-running apps"]
C --> D["4. OpenAI — Codex agent loop"]
D --> E["5. Anthropic — Demystifying evals"]
E --> F["6. LangChain — Improving Deep Agents"]
F --> G["7. Thoughtworks / Fowler —<br/>Harness engineering for users"]
G --> H["8. Cursor — Continually improving<br/>our agent harness"]
H --> I["9. Osmani — Loop Engineering"]
I --> J["10. LangChain — 3 Years of<br/>Graph Engineering"]
Cierre del curso
Recorrimos catorce lecciones, cuatro productos reales, ocho plantillas y ocho proyectos. Si te quedás con una sola idea que resuma todo:
La fiabilidad no viene del modelo. Viene de lo que construiste alrededor del modelo.
Y el corolario práctico, que es lo que hace del harness engineering una disciplina y no una colección de trucos:
Cada fallo es un defecto estructural de tu harness. Atribuilo a una capa, corregí esa capa, y no lo repitas.
El resto —loops, grafos, flotas de agentes— son pisos que se construyen sobre esa base. Sin la base, son cajas negras ensambladas en una caja negra más grande.
Anterior: Capítulo 17 — Proyectos prácticos · Volver al Índice