Loading skill
Install any skill in seconds. Free to start, no credit card required.
Get Started Free →スキル、ルール、エージェント定義が実際に遵守されているかを可視化する——3種類のプロンプト厳格度レベルのシナリオを自動生成し、エージェントを実行し、動作シーケンスを分類し、完全なツール呼び出しタイムラインの遵守率をレポートする
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | -32% | 0% |
| case-02 | ✗→✓ | ▲ Improved | -50% | 0% |
| case-05 | ✗→✓ | ▲ Improved | -33% | 0% |
| case-06 | ✗→✓ | ▲ Improved | -25% | 0% |
| case-07 | ✗→✓ | ▲ Improved | -55% | 0% |
通过以下方式测量编码代理是否实际遵循技能、规则或代理定义:
claude -p 并通过 stream-json 捕获工具调用轨迹skills/*/SKILL.md):工作流技能,如搜索优先、TDD 指南rules/common/*.md):强制性规则,如 testing.md、security.md、git-workflow.mdagents/*.md):代理是否在预期时被调用(内部工作流验证尚不支持)/skill-comply <path>bash# Full run uv run python -m scripts.run ~/.claude/rules/common/testing.md # Dry run (no cost, spec + scenarios only) uv run python -m scripts.run --dry-run ~/.claude/skills/search-first/SKILL.md # Custom models uv run python -m scripts.run --gen-model haiku --model sonnet <path>
测量技能/规则是否在提示未明确支持时仍被遵循。
报告是自包含的,包括:
对于熟悉钩子的用户,报告还包含针对合规性较低的步骤的钩子提升建议。此为参考信息——主要价值在于合规性本身的可见性。
Other measured skills in the registry, with their headline benchmark lift.