Install any skill in seconds. Free to start, no credit card required.
Get Started Free →Verify the final deliverable meets all quality criteria before delivery. Use as the final validation step to ensure the output meets the user's quality standards across all 6 dimensions.
.claude/skills/aiskillstore-quality-verify/SKILL.md| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | 8% | 0% |
| case-02 | ✗→✓ | ▲ Improved | 17% | 0% |
| case-03 | ✗→✓ | ▲ Improved | 22% | 0% |
| case-04 | ✗→✓ | ▲ Improved | 86% | 0% |
| case-06 | ✗→✓ | ▲ Improved | 37% | 0% |
Final validation that the formatted deliverable meets ALL quality standards before delivery. This is the last gate - if it passes here, it's ready to go.
The system checks against 6 quality dimensions. Evaluate each:
Rate each dimension:
Overall Score = Average of all applicable dimensions
0 Critical Issues = Base score
- 10 points per critical issue (e.g., code doesn't run, major security flaw)
- 5 points per major issue (e.g., missing section, formatting inconsistent)
- 2 points per minor issue (e.g., typo, minor inconsistency)
Final Score = Base score - deductions
80+ = Ready to Deliver ✓
60-79 = Minor fixes recommended
<60 = Major revision neededUse StandardsRepository to access quality criteria:
javascriptconst standards = standardsRepository.getStandards(context.projectType) if (standards && standards.qualityCriteria) { // Check against their quality criteria definitions const criteria = standards.qualityCriteria // Verify deliverable meets: completeness, correctness, consistency, etc. verifyAgainstCriteria(deliverable, criteria) } else { // Use general quality best practices verifyAgainstBestPractices(deliverable) }
See .claude/lib/standards-repository.md for interface details.
json{ "qualityScore": 92, "readyToDeliver": true, "dimensionScores": { "completeness": 95, "correctness": 90, "consistency": 88, "performance": 85, "security": 90, "maintainability": 95 }, "issuesFound": [ "list of specific issues (if any)" ], "issuesSeverity": { "critical": [], "major": [], "minor": ["Missing one edge case test"] }, "notes": "One minor issue found - everything else excellent quality", "summary": "Ready to deliver. Recommend adding edge case test.", "recommendations": [ "Add test for empty array edge case" ] }
✓ Quality score above 85 ✓ No critical issues ✓ Ready to deliver immediately
⚠ Good quality, minor issues ⚠ Should fix minor issues before delivery ⚠ Ask user: "Fix these, or deliver as-is?"
✗ Significant issues found ✗ Should not deliver in current state ✗ Recommend major revision
Deliverable: React dropdown component
Checks:
Score: 94/100 Issues: None Recommendation: Ready to deliver
Deliverable: API endpoint documentation
Checks:
Score: 82/100 Issues: "Missing examples for error responses"] Recommendation: Add error response examples, then deliver
Score 85+ → Ready to Deliver ✓
Score 70-84 → Ask about minor issues
Score <70 → Recommend major revision| Case | Status | Duration (ms) | Turns | Tokens | Tool calls | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Without | With | Δ | Without | With | Δ | Without | With | Δ | Without | With | Δ | ||
case-01 | fail→pass | 13,844 | 8,038 | -42% | 1 | 1 | 0% | 2,605 | 2,820 | +8% | 0 | 0 | — |
case-02 | fail→pass | 11,700 | 7,246 | -38% | 1 | 1 | 0% | 2,203 | 2,586 | +17% | 0 | 0 | — |
case-03 | fail→pass | 11,760 | 7,681 | -35% | 1 | 1 | 0% | 2,260 | 2,754 | +22% | 0 | 0 | — |
case-04 | fail→pass | 6,653 | 3,802 | -43% | 1 | 1 | 0% | 1,120 | 2,086 | +86% | 0 | 0 | — |
case-05 | fail→fail | 6,619 | 4,452 | -33% | 1 | 1 | 0% | 1,003 | 2,106 | +110% | 0 | 0 | — |
case-06 | fail→pass | 10,457 | 6,182 | -41% | 1 | 1 | 0% | 1,806 | 2,474 | +37% | 0 | 0 | — |
case-07 | fail→pass | 10,940 | 5,850 | -47% | 1 | 1 | 0% | 1,803 | 2,504 | +39% | 0 | 0 | — |
case-22 | fail→pass | 11,828 | 7,240 | -39% | 1 | 1 | 0% | 2,130 | 2,584 | +21% | 0 | 0 | — |
case-08 | fail→pass | 7,300 | 2,645 | -64% | 1 | 1 | 0% | 1,336 | 1,793 | +34% | 0 | 0 | — |
case-09 | fail→pass | 7,886 | 4,951 | -37% | 1 | 1 | 0% | 1,415 | 2,341 | +65% | 0 | 0 | — |
case-10 | fail→pass | 9,121 | 3,747 | -59% | 1 | 1 | 0% | 1,596 | 1,999 | +25% | 0 | 0 | — |
case-11 | fail→pass | 15,479 | 5,223 | -66% | 1 | 1 | 0% | 2,946 | 2,276 | -23% | 0 | 0 | — |
case-12 | fail→pass | 10,651 | 7,026 | -34% | 1 | 1 | 0% | 1,909 | 2,581 | +35% | 0 | 0 | — |
case-13 | fail→pass | 6,869 | 2,701 | -61% | 1 | 1 | 0% | 1,186 | 1,892 | +60% | 0 | 0 | — |
case-14 | pass→fail | 6,871 | 5,692 | -17% | 1 | 1 | 0% | 1,233 | 2,274 | +84% | 0 | 0 | — |
case-15 | fail→pass | 6,439 | 3,904 | -39% | 1 | 1 | 0% | 1,151 | 2,057 | +79% | 0 | 0 | — |
case-16 | pass→pass | 5,224 | 2,852 | -45% | 1 | 1 | 0% | 910 | 1,836 | +102% | 0 | 0 | — |
case-17 | fail→pass | 8,184 | 3,794 | -54% | 1 | 1 | 0% | 1,341 | 1,984 | +48% | 0 | 0 | — |
case-18 | pass→pass | 10,511 | 8,510 | -19% | 1 | 1 | 0% | 2,052 | 2,900 | +41% | 0 | 0 | — |
case-19 | pass→fail | 4,232 | 7,671 | +81% | 1 | 1 | 0% | 649 | 2,610 | +302% | 0 | 0 | — |
case-20 | pass→fail | 10,095 | 7,347 | -27% | 1 | 1 | 0% | 2,160 | 2,821 | +31% | 0 | 0 | — |
case-21 | fail→fail | 1,517 | 6,475 | +327% | 1 | 1 | 0% | 202 | 2,468 | +1122% | 0 | 0 | — |
DecimalAI ran this skill against gemini-3.6-flash twice over the same eval suite — once with the skill loaded and once without — and compared the two runs case by case. 22 cases were attempted. The headline lift of +55 percentage points is the difference between those two pass rates over the 22 comparable cases. 3 cases got worse with the skill loaded, and they are included in that figure.
Without the skill loaded, the model failed this case. With it loaded, the same prompt on the same model passed. This is one improved case from the latest verified run; every case, including any that regressed, is in the table above.
Other measured skills in the registry, with their headline benchmark lift.