コーディングエージェントがスキル、ルール、またはエージェント定義を実際に遵守しているかを以下の方法で測定する:
claude -p を実行し、stream-json 経由でツール呼び出しトレースを取得するskills/*/SKILL.md):検索優先、TDDガイドなどのワークフロースキルrules/common/*.md):testing.md、security.md、git-workflow.md などの強制的なルールagents/*.md):エージェントが期待される場面で呼び出されるか(内部ワークフロー検証は未サポート)/skill-comply <path> を実行する# Full run
uv run python -m scripts.run ~/.claude/rules/common/testing.md
# Dry run (no cost, spec + scenarios only)
uv run python -m scripts.run --dry-run ~/.claude/skills/search-first/SKILL.md
# Custom models
uv run python -m scripts.run --gen-model haiku --model sonnet <path>
プロンプトが明示的にサポートしていない場合でも、スキル/ルールが遵守されるかどうかを測定する。
レポートは自己完結型で、以下を含む:
フックに精通したユーザー向けに、レポートには遵守率が低いステップに対するフック強化の推奨事項も含まれる。これは参考情報——主要な価値は遵守性自体の可視化にある。