Biblioteca · Skills: enseña al agente a trabajar a tu manera

Creamos una skill (una instrucción reutilizable para Claude) desde cero, EN VIVO: Skill Creator + Eval Framework (eval: evaluación automática de calidad)

Creador80 minActualizado: octubre de 2026
30 de 105 en la biblioteca

Módulo: Skills: experiencia reutilizable | Tiempo: unos 20 min de teoría + 60 min de práctica


Lo esencial

Imagina que tienes un mentor experto que te hace las preguntas correctas, te ayuda a formular el proceso y luego él mismo prueba el resultado: te muestra qué funciona y qué no. Así funciona Skill Creator: tú describes lo que quieres, él lo estructura, lo construye y lo evalúa. Tú iteras.


Conceptos clave

  • Skill Creator: el plugin skill-creator para crear y revisar skills (del catálogo oficial de Anthropic)
  • Eval Framework: pruebas automáticas de una skill con pass rate (tasa de aprobación) y métricas
  • Trigger tuning: ajustar la descripción (description) con la que el agente (un ejecutor autónomo de tareas) reconoce cuándo usar la skill
  • Ejemplo en vivo: YouTube Weekly Roundup con 3 agentes en paralelo
  • Iteración: la calidad crece de versión en versión

Teoría

Skill Creator: la skill que crea skills

Es como contratar a un especialista en escribir instrucciones. Tú dices "quiero automatizar esto" y él hace las preguntas correctas, estructura el proceso, genera el frontmatter (los metadatos al inicio del archivo) y el workflow (flujo de trabajo), y después revisa la calidad por su cuenta.

🎨 Imagínalo así: Skill Creator es como un arquitecto con experiencia en la primera reunión con un cliente. Tú dices "quiero una casa". No se pone a dibujar de inmediato: pregunta cuántos cuartos, si hay niños, qué estilo, qué presupuesto. Solo después de las preguntas correctas viene el plano.

Instalación (comando de la documentación de Claude Code a octubre de 2026; el nombre exacto del catálogo te lo muestra el menú /plugin):

Escribe esto en el chat
/plugin install skill-creator@claude-plugins-official

Arranque:

Escribe esto en el chat
Crea una skill para el análisis semanal de un canal de YouTube

Skill Creator hace preguntas para aclarar:

  • "¿Qué métricas hay que seguir?"
  • "¿En qué formato necesitas el reporte?"
  • "¿Hay que compararse con la competencia?"
  • "¿Qué modelo prefieres?"

Tú respondes y él construye.


Ejemplo en vivo: YouTube Weekly Roundup

Creamos una skill que cada semana analiza un canal de YouTube y entrega un reporte estructurado.

Qué hace la skill:

  1. Pide los datos del canal de los últimos 7 días (vistas, suscriptores, ER)
  2. Analiza cada video: CTR, retención, sentimiento de los comentarios
  3. Análisis FODA del periodo actual
  4. Comparación con la competencia (los 3 canales principales del nicho)
  5. Contenido en tendencia en el nicho durante la semana
  6. Recomendaciones para la semana siguiente
  7. Reporte en PDF con tu marca

Arquitectura: 3 agentes en paralelo

En vez de un solo agente que lo hace todo en secuencia, tres trabajan al mismo tiempo:

Código
Agente coordinador
├── Agente 1: Recopilación de datos
│   ├── YouTube Analytics API
│   ├── Datos de todos los videos de 7 días
│   └── Devuelve: JSON con métricas
│
├── Agente 2: Análisis de la competencia
│   ├── Datos de los 3 competidores principales
│   ├── Benchmarking vs. nuestro canal
│   └── Devuelve: tabla comparativa
│
└── Agente 3: Contenido en tendencia
    ├── Búsqueda de tendencias en el nicho
    ├── Análisis de videos virales
    └── Devuelve: lista de ideas

→ El agente coordinador junta todo → genera el reporte → produce el PDF

🎨 Imagínalo así: tres agentes en paralelo son como tres cocineros en la misma cocina. Uno pica verduras, otro prepara el caldo, el tercero asa la carne. Al mismo tiempo. Un solo cocinero hace el mismo platillo, pero tarda tres veces más.

¿Por qué en paralelo? Recopilar datos de YouTube, analizar a la competencia y buscar tendencias son tareas independientes. A grandes rasgos: en secuencia 15 minutos, en paralelo 5 (cifras ilustrativas). Pero cada agente tiene su propio contexto, así que no se gastan menos tokens, normalmente se gastan más: el paralelismo ahorra tiempo, no dinero.


Eval Framework: evaluación automática de calidad

Cuando Skill Creator ya generó la skill, puedes pedirle que la revise (por ejemplo: "evaluate my youtube-weekly-roundup skill with skill-creator"). Esto es lo que hace:

🎨 Imagínalo así: el eval es la prueba de manejo de un auto recién armado. El ingeniero no solo lo mira por fuera: lo lleva por subidas, frena, acelera. Encuentra qué rechina en las curvas. Lo corrige. Vuelve a manejar.

Cómo está armado:

  • Los casos de prueba se guardan en el archivo evals/evals.json dentro de la carpeta de la skill
  • Cada prueba corre aislada, en un subagente aparte
  • El resultado se revisa con afirmaciones (assertions), y las calificaciones se escriben en grading.json
  • Puedes comparar el trabajo con la skill y sin ella (benchmark.json) y comparar versiones de la skill entre sí
  • La descripción se ajusta por separado: se eligen solicitudes con las que la skill debe activarse y con las que no

Qué se prueba:

  • 10 a 20 prompts distintos que deberían activar la skill
  • Si la skill se activa correctamente (trigger precision)
  • La calidad del output (según criterios definidos)
  • El tiempo de ejecución
  • El consumo de tokens

Métricas del eval (formato aproximado, cifras ilustrativas):

Código
Eval Results: YouTube Weekly Roundup v1.0
─────────────────────────────────────────
Trigger accuracy:    78% (7/9 activaciones correctas)
Output quality:      6.2/10
Avg tokens (tokens: unidades de texto para la IA):  3,847
Avg time:            47 segundos
Pass rate:           44% (4/9 pruebas aprobadas)
─────────────────────────────────────────
Problemas:
- La prueba "resumen rápido del canal" no activó la skill (78% trigger)
- La sección FODA es demasiado general (6.2 quality)
- El análisis de competencia no toma en cuenta la región (44% pass rate)

No es solo "funciona / no funciona". Son números concretos que muestran dónde falla.


Trigger Tuning: cómo el agente "escucha" la solicitud

🎨 Imagínalo así: el trigger tuning es como ajustar una cerradura. Si está demasiado dura, la llave correcta no entra. Si está demasiado floja, entra cualquier llave. Lo ideal: solo entra tu llave, de cualquier lado y con cualquier mano.

El problema: el usuario escribe "dame un resumen del canal de esta semana" y la skill no se activa. Escribe "youtube weekly roundup" y sí se activa. ¿Por qué?

Porque las condiciones de activación en la descripción están escritas de forma demasiado exacta. Una skill no tiene una lista aparte de triggers: el agente decide según el texto de description (y del campo opcional when_to_use). Hay que ampliar la descripción:

yaml
# Antes del tuning
description: >
  Análisis semanal de un canal de YouTube.
  Úsala para "youtube weekly roundup" y "reporte semanal de YouTube".

# Después del tuning
description: >
  Análisis semanal de un canal de YouTube: métricas, competencia, recomendaciones.
  Úsala para solicitudes como "youtube weekly roundup",
  "reporte semanal de YouTube", "resumen del canal de la semana",
  "cómo le fue al canal esta semana", "estadísticas de YouTube de 7 días",
  "analítica del canal". No la uses para analizar un solo video.

Con base en los resultados del eval, Skill Creator propone afinar la descripción. Recuerda el límite: en la lista de skills la descripción se corta alrededor de los 1,500 caracteres, así que pon lo más importante al principio.


El proceso de iteración

🎨 Imagínalo así: iterar una skill es como calibrar la mira de un tirador. El primer disparo rara vez da en el centro. Ves dónde cayó. Ajustas la mira. Disparas otra vez. Para el décimo disparo, das en el blanco.

Iteración 1 (pass rate 44%):

  • Ves que el trigger se salta solicitudes
  • Ves que el FODA es general
  • Ves que no se toma en cuenta la región

Qué haces:

Escribe esto en el chat
La skill mostró un pass rate de 44%. Problemas:
1. Amplía la descripción con variantes de la solicitud "resumen del canal"
2. En el FODA agrega números concretos, no palabras generales
3. Agrega un parámetro region: por defecto "global", se puede indicar un país

Skill Creator actualiza la skill y vuelve a correr el eval.

Abajo, una trayectoria ilustrativa (las cifras son un ejemplo, no una promesa de resultado: en tu caso todo depende de la tarea).

Iteración 5 (pass rate 71%): Mejor, pero la calidad sigue en 7.1/10. El reporte es aburrido, no tiene visualizaciones.

Iteración 10 (pass rate 89%, quality 8.4/10): La skill funciona de forma estable. Reporte con gráficas, región correcta, triggers precisos.

Para la iteración 20-30: la skill se vuelve tu herramienta personal ya afinada.


El frontmatter y la carpeta de la skill después de Skill Creator

yaml
---
name: youtube-weekly-roundup
description: >
  Análisis semanal de un canal de YouTube con benchmarking de la competencia
  y reporte en PDF. Úsala para solicitudes como "resumen del canal de la semana",
  "youtube weekly roundup", "analítica del canal".
argument-hint: "[channel_id] [region]"
---

Y la estructura de la carpeta:

Código
youtube-weekly-roundup/
  SKILL.md                      # instrucciones: pasos, reglas, formato del reporte
  brand/guidelines.md           # marca para el diseño
  reports/weekly-template.html  # plantilla del reporte
  data/competitors.json         # lista de competidores
  evals/evals.json              # casos de prueba para revisar la skill

Los parámetros (channel_id, region, competitors), el conjunto de subagentes, el formato del reporte y las referencias a archivos se describen con palabras normales en el texto de SKILL.md. En el frontmatter de Claude Code no existen campos aparte como parameters, subagents, output, references, eval, model_invocation, tags ni version: aparecían en versiones viejas del curso, pero no funcionan.


Práctica

Tarea: crear tu propia skill con Skill Creator

  1. Elige una tarea que hagas con regularidad (al menos 1 vez por semana):
    • Ejemplos: "análisis de ventas de la semana", "preparar el calendario de contenido", "monitorear menciones de la marca"
  2. Instala Skill Creator: /plugin install skill-creator@claude-plugins-official (o busca el plugin skill-creator en el menú /plugin)
  3. Arranca: describe tu tarea
  4. Responde todas las preguntas: entre más detalle, mejor
  5. Obtén la primera versión de la skill
  6. Pídele a Skill Creator que revise la skill ("evaluate my skill with skill-creator") y mira el pass rate y los resultados de las pruebas
  7. Haz al menos 3 iteraciones de mejora
  8. Anota: ¿qué cambió entre la versión 1 y la versión 3?

Herramientas y recursos

  • skill-creator: plugin para crear y revisar skills (/plugin install skill-creator@claude-plugins-official)
  • Eval Framework: parte de Skill Creator, se ejecuta cuando lo pides (las pruebas viven en evals/evals.json)
  • Documentación de Skills en Claude Code: la guía oficial sobre skills
  • .claude/skills/<nombre>/SKILL.md: la carpeta donde se guardan las skills que creas
  • YouTube Data API v3 (API: interfaz de programación de aplicaciones): para obtener datos reales del canal (necesitas una clave de API)

Ideas clave

Skill Creator hace las preguntas correctas, mejor de lo que tú inventarías una estructura desde cero. Confía en el proceso.

Un pass rate bajo en la primera versión es normal. Una skill se construye con iteraciones, no a la primera. En el ejemplo de arriba, para la décima iteración el pass rate subió a ~90% (cifras ilustrativas).

3 agentes en paralelo en vez de 1 en secuencia = notablemente más rápido. Pero los tokens no son gratis: cada agente tiene su propio contexto, así que el gasto suele ser mayor. El paralelismo acelera, pero no abarata.


Lecciones relacionadas


Siguiente lección

→ Arquitectura de skills: 2 arquetipos

La marca se guarda solo en este navegador y no se envía a ningún sitio. Mi progreso