Install any skill in seconds. Free to start, no credit card required.
Get Started Free →Strategy for linking evidence to claims — find supporting/contradicting evidence, create typed edges, assess evidence quality, identify gaps in evidential coverage.
.claude/skills/yogsoth-ai-evidence-linking-arg/SKILL.md| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | 570% | 0% |
| case-02 | ✗→✓ | ▲ Improved | 776% | 0% |
| case-03 | ✗→✓ | ▲ Improved | 573% | 0% |
| case-04 | ✗→✓ | ▲ Improved | 19% | 0% |
| case-05 | ✗→✓ | ▲ Improved | 77% | 0% |
Link evidence to claims with typed relationships. Searches for supporting and contradicting evidence, creates structured edges, assesses evidence quality, and identifies claims lacking sufficient evidential support.
| Metric | Small | Medium | Large | |--------|-------|--------|-------| | Evidence links created | 15 | 40 | 80 | | Claims with evidence | 8 | 20 | 40 | | Contradictions found | 2 | 6 | 12 |
<HARD-GATE> Print before every iteration:
| Metric | Target | Current | % | |--------|--------|---------|---| | Evidence links created | — | — | — | | Claims with evidence | — | — | — | | Contradictions found | — | — | — | </HARD-GATE>
Cannot exit until 80% of budget targets met.
After budget gate passes, self-check:
Max 2 extra iterations if gaps found.
<!-- BEGIN available-tables (generated) -->
Optional, no fixed order; the final leaf is always a sop.
| Tactic | When to use | | --- | --- | | strength-assessment | Tactic for assessing argument strength — evaluate evidence quality, count independent sources, check for defeaters, assign calibrated confidence scores. |
Optional, no fixed order; the final leaf is always a sop.
| SOP | When to use | | --- | --- | | evidence-attachment | SOP for attaching evidence to a claim — create typed edge (supported_by, contradicts, qualifies) with evidence quality metadata. | | strength-scoring | SOP for assigning calibrated strength scores to claims — evaluate evidence weight, count independent sources, check defeaters, produce scored assessment. |
<!-- END available-tables (generated) -->
| Case | Status | Duration (ms) | Turns | Tokens | Tool calls | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Without | With | Δ | Without | With | Δ | Without | With | Δ | Without | With | Δ | ||
case-13 | pass→pass | 9,238 | 3,926 | -58% | 1 | 1 | 0% | 1,407 | 1,175 | -16% | 0 | 0 | — |
case-01 | fail→pass | 5,744 | 31,944 | +456% | 1 | 1 | 0% | 917 | 6,141 | +570% | 0 | 0 | — |
case-02 | fail→pass | 4,632 | 33,893 | +632% | 1 | 1 | 0% | 766 | 6,710 | +776% | 0 | 0 | — |
case-03 | fail→pass | 6,440 | 32,420 | +403% | 1 | 1 | 0% | 996 | 6,699 | +573% | 0 | 0 | — |
case-04 | fail→pass | 9,612 | 8,460 | -12% | 1 | 1 | 0% | 1,566 | 1,859 | +19% | 0 | 0 | — |
case-05 | fail→pass | 7,970 | 10,805 | +36% | 1 | 1 | 0% | 1,286 | 2,270 | +77% | 0 | 0 | — |
case-06 | pass→pass | 8,392 | 25,197 | +200% | 1 | 1 | 0% | 1,374 | 4,830 | +252% | 0 | 0 | — |
case-07 | pass→pass | 7,824 | 31,762 | +306% | 1 | 1 | 0% | 1,155 | 6,358 | +450% | 0 | 0 | — |
case-08 | pass→pass | 13,792 | 3,850 | -72% | 1 | 1 | 0% | 2,042 | 1,113 | -45% | 0 | 0 | — |
case-09 | pass→pass | 11,583 | 8,807 | -24% | 1 | 1 | 0% | 1,785 | 2,183 | +22% | 0 | 0 | — |
case-10 | pass→pass | 8,704 | 12,148 | +40% | 1 | 1 | 0% | 1,481 | 2,571 | +74% | 0 | 0 | — |
case-11 | fail→pass | 5,407 | 3,999 | -26% | 1 | 1 | 0% | 1,014 | 1,236 | +22% | 0 | 0 | — |
case-12 | pass→pass | 12,984 | 5,926 | -54% | 1 | 1 | 0% | 1,914 | 1,614 | -16% | 0 | 0 | — |
case-14 | pass→pass | 14,042 | 2,606 | -81% | 1 | 1 | 0% | 2,163 | 976 | -55% | 0 | 0 | — |
case-15 | fail→pass | 16,143 | 2,425 | -85% | 1 | 1 | 0% | 2,360 | 914 | -61% | 0 | 0 | — |
case-16 | fail→pass | 12,281 | 3,503 | -71% | 1 | 1 | 0% | 1,963 | 1,165 | -41% | 0 | 0 | — |
case-17 | fail→pass | 14,461 | 6,229 | -57% | 1 | 1 | 0% | 2,371 | 1,640 | -31% | 0 | 0 | — |
case-18 | pass→pass | 7,259 | 4,536 | -38% | 1 | 1 | 0% | 1,070 | 1,287 | +20% | 0 | 0 | — |
case-19 | fail→pass | 6,153 | 1,804 | -71% | 1 | 1 | 0% | 914 | 766 | -16% | 0 | 0 | — |
case-20 | pass→fail | 12,559 | 29,629 | +136% | 1 | 1 | 0% | 1,771 | 5,590 | +216% | 0 | 0 | — |
case-21 | pass→fail | 13,861 | 19,560 | +41% | 1 | 1 | 0% | 2,639 | 4,487 | +70% | 0 | 0 | — |
case-22 | pass→fail | 17,202 | 31,694 | +84% | 1 | 1 | 0% | 3,446 | 6,567 | +91% | 0 | 0 | — |
case-23 | pass→pass | 11,458 | 29,414 | +157% | 1 | 1 | 0% | 1,904 | 5,532 | +191% | 0 | 0 | — |
DecimalAI ran this skill against gemini-3.6-flash twice over the same eval suite — once with the skill loaded and once without — and compared the two runs case by case. 23 cases were attempted. The headline lift of +30 percentage points is the difference between those two pass rates over the 23 comparable cases. 3 cases got worse with the skill loaded, and they are included in that figure.
Without the skill loaded, the model failed this case. With it loaded, the same prompt on the same model passed. This is one improved case from the latest verified run; every case, including any that regressed, is in the table above.
Other measured skills in the registry, with their headline benchmark lift.