Библиотека · Навыки: научить агента работать по-твоему

Создаём скилл (переиспользуемая инструкция для Claude) с нуля LIVE — Skill Creator + Eval (эвал — автоматическая оценка качества) Framework

Строитель80 минОбновлено: октябрь 2026
30 из 105 в библиотеке

Модуль: Skills — переиспользуемая экспертиза | Время: ~20 мин теории + 60 мин практики


Суть урока

Представь что у тебя есть мастер-наставник который задаёт правильные вопросы, помогает сформулировать процесс, а потом сам тестирует результат — показывает что работает, что нет. Именно так работает Skill Creator: ты описываешь что хочешь, он структурирует, строит, оценивает. Ты итерируешь.


Ключевые концепции

  • Skill Creator — плагин skill-creator для создания и проверки скиллов (из официального каталога Anthropic)
  • Eval Framework: автоматическое тестирование скилла с pass rate и метриками
  • Trigger tuning: настройка описания (description), по которому агент (автономный исполнитель задач) распознаёт когда использовать скилл
  • Живой пример: YouTube Weekly Roundup с 3 параллельными агентами
  • Итерация: качество растёт от версии к версии

Теория

Skill Creator — скилл который создаёт скиллы

Это как нанять специалиста по написанию инструкций. Ты говоришь "хочу автоматизировать вот это" — он задаёт правильные вопросы, структурирует процесс, генерирует frontmatter (фронтматтер — метаданные в начале файла) и воркфлоу (рабочий процесс), а потом сам проверяет качество.

🎨 Образ: Skill Creator — как опытный архитектор на первой встрече с клиентом. Ты говоришь "хочу дом". Он не сразу чертит — спрашивает: сколько комнат, есть ли дети, какой стиль, бюджет. Только после правильных вопросов — план.

Установка (команда из документации Claude Code на октябрь 2026; точное имя каталога покажет меню /plugin):

Напиши в чат
/plugin install skill-creator@claude-plugins-official

Запуск:

Напиши в чат
Создай скилл для еженедельного анализа YouTube канала

Skill Creator задаёт уточняющие вопросы:

  • "Какие метрики нужно отслеживать?"
  • "В каком формате нужен отчёт?"
  • "Нужно ли сравнивать с конкурентами?"
  • "Какая модель предпочтительна?"

Ты отвечаешь — он строит.


Живой пример: YouTube Weekly Roundup

Создаём скилл который каждую неделю анализирует YouTube канал и выдаёт структурированный отчёт.

Что делает скилл:

  1. Запрашивает данные канала за 7 дней (просмотры, подписчики, ER)
  2. Анализирует каждое видео: CTR, retention, comments sentiment
  3. SWOT анализ текущего периода
  4. Сравнение с конкурентами (топ-3 канала в нише)
  5. Трендовый контент в нише за неделю
  6. Рекомендации на следующую неделю
  7. PDF отчёт с брендом

Архитектура: 3 параллельных агента

Вместо одного агента делающего всё последовательно — три работают одновременно:

Код
Координирующий агент
├── Агент 1: Сбор данных
│   ├── YouTube Analytics API
│   ├── Данные всех видео за 7 дней
│   └── Возвращает: JSON с метриками
│
├── Агент 2: Конкурентный анализ
│   ├── Данные топ-3 конкурентов
│   ├── Бенчмаркинг vs наш канал
│   └── Возвращает: сравнительная таблица
│
└── Агент 3: Трендовый контент
    ├── Поиск трендов в нише
    ├── Анализ вирусных видео
    └── Возвращает: список идей

→ Координирующий агент собирает всё → генерирует отчёт → рендерит PDF

🎨 Образ: три параллельных агента — как три повара на одной кухне. Один режет овощи, второй варит бульон, третий жарит мясо. Одновременно. Один повар — то же блюдо, но в три раза дольше.

Почему параллельно? Сбор данных YouTube, анализ конкурентов и поиск трендов — независимые задачи. Условно: последовательно 15 минут, параллельно 5 (цифры иллюстрация). Но у каждого агента свой контекст, поэтому токенов уходит не меньше, а обычно больше: параллелизм экономит время, а не деньги.


Eval Framework — автоматическая оценка качества

После того как Skill Creator сгенерировал скилл, можно попросить его проверить скилл (например: "evaluate my youtube-weekly-roundup skill with skill-creator"). Что он делает:

🎨 Образ: eval — это тест-драйв автомобиля после сборки. Инженер не просто смотрит внешне — едет по горкам, тормозит, разгоняется. Находит что скрипит на поворотах. Исправляет. Едет снова.

Как это устроено:

  • Тестовые случаи хранятся в файле evals/evals.json внутри папки скилла
  • Каждый тест запускается изолированно, отдельным субагентом
  • Результат проверяется по утверждениям (assertions), оценки записываются в grading.json
  • Можно сравнить работу с скиллом и без него (benchmark.json) и сравнить версии скилла между собой
  • Отдельно настраивается описание: подбираются запросы, на которые скилл должен и не должен срабатывать

Что тестируется:

  • 10-20 разных промптов которые должны активировать скилл
  • Правильно ли скилл активируется (trigger precision)
  • Качество output (по заданным критериям)
  • Время выполнения
  • Потребление токенов

Метрики eval (формат условный, цифры иллюстрация):

Код
Eval Results: YouTube Weekly Roundup v1.0
─────────────────────────────────────────
Trigger accuracy:    78% (7/9 правильных активаций)
Output quality:      6.2/10
Avg tokens (токены — единицы текста для AI):  3,847
Avg time:            47 секунд
Pass rate:           44% (4/9 тестов прошли)
─────────────────────────────────────────
Проблемы:
- Тест "быстрый обзор канала" не активировал скилл (78% trigger)
- SWOT секция слишком общая (6.2 quality)
- Конкурентный анализ не учитывает регион (44% pass rate)

Это не просто "работает / не работает". Это конкретные числа где провалы.


Trigger Tuning — как агент "слышит" запрос

🎨 Образ: trigger tuning — как настройка дверного замка. Слишком тугой — нужный ключ не заходит. Слишком разболтанный — заходит любой ключ. Идеально — только твой ключ, с любой стороны и любой рукой.

Проблема: пользователь пишет "дай мне обзор канала за неделю" — скилл не активируется. Пишет "youtube weekly roundup" — активируется. Почему?

Потому что условия срабатывания в описании прописаны слишком точно. У скилла нет отдельного списка triggers: агент решает по тексту description (и необязательного when_to_use). Нужно расширить описание:

yaml
# До tuning
description: >
  Еженедельный анализ YouTube канала.
  Используй для "youtube weekly roundup" и "еженедельный YouTube отчёт".

# После tuning
description: >
  Еженедельный анализ YouTube канала: метрики, конкуренты, рекомендации.
  Используй для запросов вроде "youtube weekly roundup",
  "еженедельный YouTube отчёт", "обзор канала за неделю",
  "как канал провёл неделю", "статистика YouTube за 7 дней",
  "аналитика канала". Не используй для разбора одного видео.

Skill Creator на основе eval результатов предлагает уточнить описание. Помни про лимит: в списке скиллов описание обрезается примерно на 1 500 знаков, самое важное пиши в начале.


Процесс итерации

🎨 Образ: итерация скилла — как пристрелка снайпера. Первый выстрел редко попадает в центр. Смотришь куда упал. Корректируешь прицел. Стреляешь снова. К десятому выстрелу — в яблочко.

Итерация 1 (pass rate 44%):

  • Видишь что trigger пропускает запросы
  • Видишь что SWOT общий
  • Видишь что регион не учитывается

Что делаешь:

Напиши в чат
Скилл показал pass rate 44%. Проблемы:
1. Расширь описание вариациями запроса "обзор канала"
2. В SWOT добавь конкретные числа, не общие слова
3. Добавь параметр region: по умолчанию "global", можно указать страну

Skill Creator обновляет скилл и снова запускает eval.

Ниже условная траектория (цифры иллюстрация, а не обещание результата: у тебя всё будет зависеть от задачи).

Итерация 5 (pass rate 71%): Лучше, но quality всё ещё 7.1/10. Отчёт скучный, нет visualizations.

Итерация 10 (pass rate 89%, quality 8.4/10): Скилл стабильно работает. Отчёт с графиками, правильный регион, точные triggers.

К итерации 20-30: скилл становится твоим личным настроенным инструментом.


Frontmatter и папка скилла после Skill Creator

yaml
---
name: youtube-weekly-roundup
description: >
  Еженедельный анализ YouTube канала с конкурентным бенчмаркингом
  и PDF отчётом. Используй для запросов "обзор канала за неделю",
  "youtube weekly roundup", "аналитика канала".
argument-hint: "[channel_id] [region]"
---

И структура папки:

Код
youtube-weekly-roundup/
  SKILL.md                      # инструкции: шаги, правила, формат отчёта
  brand/guidelines.md           # бренд для оформления
  reports/weekly-template.html  # шаблон отчёта
  data/competitors.json         # список конкурентов
  evals/evals.json              # тестовые случаи для проверки скилла

Параметры (channel_id, region, competitors), набор субагентов, формат отчёта и ссылки на файлы описываются в тексте SKILL.md обычными словами. Отдельных полей parameters, subagents, output, references, eval, model_invocation, tags и version во frontmatter Claude Code нет: в старых версиях курса они встречались, но не работают.


Практика

Задание: Создать свой скилл с помощью Skill Creator

  1. Выбери задачу которую делаешь регулярно (минимум 1 раз в неделю):
    • Примеры: "анализ продаж за неделю", "подготовка контент-плана", "мониторинг упоминаний бренда"
  2. Установи Skill Creator: /plugin install skill-creator@claude-plugins-official (или найди плагин skill-creator через меню /plugin)
  3. Запусти: опиши свою задачу
  4. Ответь на все уточняющие вопросы — чем подробнее, тем лучше
  5. Получи первую версию скилла
  6. Попроси Skill Creator проверить скилл ("evaluate my skill with skill-creator") — посмотри на pass rate и результаты проверок
  7. Сделай минимум 3 итерации улучшений
  8. Зафиксируй: что изменилось между версией 1 и версией 3?

Инструменты и ресурсы

  • skill-creator — плагин для создания и проверки скиллов (/plugin install skill-creator@claude-plugins-official)
  • Eval Framework — часть Skill Creator, запускается по просьбе (тесты в evals/evals.json)
  • Claude Code Skills документация — официальное руководство по скиллам
  • .claude/skills/<имя>/SKILL.md — папка где хранятся созданные скиллы
  • YouTube Data API v3 (API — эй-пи-ай — интерфейс программирования) — для получения реальных данных канала (нужен API ключ)

Ключевые выводы

Skill Creator задаёт правильные вопросы — лучше чем ты сам бы придумал структуру с нуля. Доверяй процессу.

Низкий pass rate на первой версии — это норма. Скилл строится итерациями, не с первого раза. В примере выше к десятой итерации pass rate вырос до ~90% (цифры условные).

3 параллельных агента вместо 1 последовательного = заметно быстрее. Но токены не бесплатны: у каждого агента свой контекст, так что расход обычно выше. Параллелизм ускоряет, но не удешевляет.


Связанные уроки


Следующий урок

→ Архитектура скиллов: 2 архетипа

Отметка хранится только в этом браузере и никуда не отправляется. Мой прогресс