{"slug":"archive228-eval-harness","source_name":"archive228/eval-harness","name":"Archive228/Eval Harness","description":"Build a repeatable eval loop that grades agent output with an LLM judge, so prompt/skill changes get scored against a baseline instead of eyeballed. Reuses loopkit's verifier subagent as the grader — do not build a new one.","version":1,"lift":{"pass_rate_delta_pts":54.17,"pass_rate_pct":95.8,"total_cases":24,"passed_cases":23,"tokens_delta_pct":1.1,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-16T00:40:42.178857+00:00"},"skill_score":null,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":54.17,"with_pass_pct":95.8,"without_pass_pct":41.7,"tokens_delta_pct":1.1,"turns_delta_pct":0,"total_cases":24,"cases_aggregated":23,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-16T00:40:42.178857+00:00","run_id":"b0b70707-f9b7-4e72-95f6-62624d83b2e9","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"698ea33c190cda4104ae3967e79cff01ca7c5c66e92d99c5fc26ce4f5759f5d6","raw_url":"https://app.decimal.ai/s/archive228-eval-harness/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/archive228-eval-harness"}