Loading skill
Install any skill in seconds. Free to start, no credit card required.
Get Started Free →Show quality metrics for Bernstein runs - success rates per model, lint/test pass rates, completion time distributions. Use when the user asks about quality, reliability, which model performs best, or pass rates.
| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-21 | ✗→✓ | ▲ Improved | -10% | 0% |
| case-10 | ✓→✗ | ▼ Worse | -70% | 0% |
| case-12 | ✓→✗ | ▼ Worse | -4% | 0% |
| case-04 | ✓→✓ | = Same ✓ | -16% | 0% |
| case-05 | ✓→✓ | = Same ✓ | -21% | 0% |
Analyze quality and reliability of agent-generated code.
scripts/quality.sh metrics for overall quality metrics.scripts/quality.sh pass-rates for lint/typecheck/test pass rates by model.scripts/quality.sh times for completion time distributions.## Quality Dashboard
### Success Rate by Model
| Model | Tasks | Success | Fail | Rate |
|-------|-------|---------|------|------|
| claude-sonnet-4 | 24 | 22 | 2 | 91.7% |
| gpt-4.1 | 12 | 10 | 2 | 83.3% |
### Pass Rates
| Check | Overall | claude-sonnet-4 | gpt-4.1 |
|-------|---------|-----------------|---------|
| Lint | 96% | 98% | 92% |
| Type-check | 88% | 91% | 83% |
| Tests | 85% | 89% | 75% |
### Completion Times
| Percentile | Time |
|------------|------|
| p50 | 3m 20s |
| p90 | 8m 45s |
| p99 | 15m 12s |Other measured skills in the registry, with their headline benchmark lift.