Capítulo 18 — El skill harness-creator y la biblioteca de referencia

Por: Artiko
harnessskillsclaude-codereferenciasbibliografiaskill-creator

Capítulo 18 — El skill harness-creator y la biblioteca de referencia

Llegado este punto tenés el marco conceptual (lecciones 1-14), los archivos concretos (capítulo 16) y la secuencia práctica (capítulo 17). Falta el último paso: empaquetar todo eso para no volver a construirlo a mano cada vez.

Qué es un skill de harness

Un skill es una plantilla de prompt autocontenida que un agente de programación —Claude Code, Codex, Cursor, Windsurf— puede cargar para realizar tareas especializadas. Es una carpeta con un SKILL.md que contiene instrucciones y metadatos, más scripts, referencias y assets opcionales.

harness-creator es un skill de nivel producción que ayuda a crear, evaluar y mejorar los cinco subsistemas centrales de un harness: instrucciones, estado, verificación, alcance y ciclo de vida de la sesión.

flowchart TD
    S["SKILL.md<br/>instrucciones y metadatos"] --> A["Crear harnesses desde cero<br/>AGENTS.md, feature lists,<br/>flujos de verificación"]
    S --> B["Mejorar harnesses existentes<br/>evaluación de 5 subsistemas<br/>con mejoras priorizadas"]
    S --> C["Diseñar continuidad de sesión<br/>memoria persistente, progreso,<br/>procedimientos de handoff"]
    S --> D["Aplicar patrones de producción<br/>memoria, context engineering,<br/>seguridad de herramientas"]

Instalación

npx skills add walkinglabs/learn-harness-engineering --skill harness-creator

Para usarlo con Claude Code, copiá el directorio harness-creator/ a la ruta de skills de tu proyecto (.claude/skills/), o apuntá tu agente al archivo SKILL.md.

Los siete patrones de referencia

El skill incluye siete documentos de referencia enfocados. Cada uno resuelve un modo de fallo específico:

PatrónCuándo usarloLección relacionada
Memory PersistenceEl agente olvida entre sesiones5, 12
Skill RuntimeEmpaquetar workflows reutilizables como skills13
Context EngineeringGestión del presupuesto de contexto, carga just-in-time4, 5
Tool RegistrySeguridad de herramientas, control de concurrencia2, 15
Multi-Agent CoordinationParalelismo, flujos de especialización9, 13, 14
Lifecycle & BootstrapHooks, tareas en segundo plano, inicialización6, 12
Gotchas15 modos de fallo no obvios con sus correccionesTodas

Plantillas incluidas

El skill trae versiones listas para usar de los archivos del capítulo 16: agents.md (scaffold con reglas de trabajo), feature-list.json (JSON Schema y ejemplo), init.sh (script estándar de inicialización), progress.md (registro de progreso de sesión) y session-handoff.md.

También incluye scripts en Node.js puro para scaffolding, validación, informes HTML de evaluación y benchmarks estructurales.

Cómo se construyó: la metodología skill-creator

harness-creator se desarrolló usando skill-creator, el metaskill oficial de Anthropic para crear, probar e iterar skills de agentes. Ofrece un flujo estructurado de borrador → prueba → evaluación → iteración, con runners de evaluación, graders y un visor de benchmarks.

Vale la pena notar el bucle: es el mismo bucle diagnóstico de la lección 1, aplicado al harness mismo. Escribís el skill, lo corrés contra un conjunto de tareas, medís dónde falla, atribuís el fallo a una capa y corregís esa capa.

Construirlo vos mismo

Si preferís no instalar nada, el skill mínimo es un solo archivo. Esta es la estructura:

---
name: harness-creator
description: Crea, evalúa y mejora el harness de un proyecto. Usar cuando el usuario
  pida "armá el harness", "por qué falla el agente en este repo", "auditá mi AGENTS.md"
  o cuando un proyecto vaya a usarse con agentes de larga duración.
---

# Constructor de harness

## Paso 1 — Diagnóstico
Recorré el repositorio y respondé la prueba de arranque en frío:
1. ¿Qué es este sistema?  2. ¿Cómo está organizado?  3. ¿Cómo se ejecuta?
4. ¿Cómo se verifica?     5. ¿Cuál es el progreso actual?
Registrá cuáles NO podés responder solo con el contenido del repo.

## Paso 2 — Auditoría de los cinco subsistemas
Calificá de 1 a 5: instrucciones, herramientas, entorno, estado, retroalimentación.
Justificá cada nota con evidencia del repositorio.

## Paso 3 — Generación
Creá los archivos faltantes según el paquete mínimo:
AGENTS.md (≤200 líneas, router), init.sh, feature_list.json, claude-progress.md.
Extraé los comandos reales del repo (package.json, Makefile, pyproject.toml).
NO inventes comandos: si no encontrás uno, dejá un TODO explícito.

## Paso 4 — Verificación
Ejecutá init.sh. Si la verificación falla, arreglá la línea base antes de continuar.
Confirmá que una sesión nueva podría responder las cinco preguntas.

## Paso 5 — Informe
Entregá: notas de los cinco subsistemas, archivos creados, brechas restantes
priorizadas y las tres mejoras de mayor retorno.

Biblioteca de referencia del campo

Esta lista es intencionalmente estrecha. Un harness es el sistema de ejecución alrededor del modelo: el bucle del agente, ejecución de herramientas, sandboxing, estado, contexto, verificación, terminación, orquestación y observabilidad. Los artículos generales de prompt engineering o de frameworks amplios no entran en la lista principal.

Las tres fuentes fundacionales

FuenteFechaAporte
OpenAI: Harness engineering — leveraging Codex in an agent-first world2026-02-11Repositorios agent-first, contexto repo-local, linting personalizado, barreras estructurales
Anthropic: Effective harnesses for long-running agents2025-11-26Agente inicializador, agente de codificación, feature list, registro de progreso, handoff
Anthropic: Harness design for long-running application development2026-03-24Roles planner/generator/evaluator, resets de contexto, simplificación del harness

Altamente relevantes de 2026

Referencias extendidas por área

Runtime y protocolo del harness

Gestión de contexto

Multiagente y orquestación

Loops y grafos

Casos de producción

Orden de lectura sugerido

flowchart TD
    A["1. OpenAI — Harness engineering"] --> B["2. Anthropic — Effective harnesses"]
    B --> C["3. Anthropic — Harness design<br/>for long-running apps"]
    C --> D["4. OpenAI — Codex agent loop"]
    D --> E["5. Anthropic — Demystifying evals"]
    E --> F["6. LangChain — Improving Deep Agents"]
    F --> G["7. Thoughtworks / Fowler —<br/>Harness engineering for users"]
    G --> H["8. Cursor — Continually improving<br/>our agent harness"]
    H --> I["9. Osmani — Loop Engineering"]
    I --> J["10. LangChain — 3 Years of<br/>Graph Engineering"]

Cierre del curso

Recorrimos catorce lecciones, cuatro productos reales, ocho plantillas y ocho proyectos. Si te quedás con una sola idea que resuma todo:

La fiabilidad no viene del modelo. Viene de lo que construiste alrededor del modelo.

Y el corolario práctico, que es lo que hace del harness engineering una disciplina y no una colección de trucos:

Cada fallo es un defecto estructural de tu harness. Atribuilo a una capa, corregí esa capa, y no lo repitas.

El resto —loops, grafos, flotas de agentes— son pisos que se construyen sobre esa base. Sin la base, son cajas negras ensambladas en una caja negra más grande.


Anterior: Capítulo 17 — Proyectos prácticos · Volver al Índice