{"slug":"sickn33-advanced-evaluation","source_name":"sickn33/advanced-evaluation","name":"Sickn33/Advanced Evaluation","description":"This skill should be used when the user asks to \"implement LLM-as-judge\", \"compare model outputs\", \"create evaluation rubrics\", \"mitigate evaluation bias\", or mentions direct scoring, pairwise comparison, position bias, evaluation pipelines, or automated quality assessment.","version":1,"lift":{"pass_rate_delta_pts":13.64,"pass_rate_pct":100,"total_cases":22,"passed_cases":22,"tokens_delta_pct":167.6,"turns_delta_pct":0,"verdict":"pass","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-06T23:27:11.735077+00:00"},"skill_score":1,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":13.64,"with_pass_pct":100,"without_pass_pct":86.4,"tokens_delta_pct":167.6,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"pass","never_hurt":true,"completed_at":"2026-08-06T23:27:11.735077+00:00","run_id":"423aa0d3-818b-4bb8-9e1b-2064596f8c85","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"ce5e8dac9aa5dc5442b10edd45fbcf0b115bcdde81ac713535bff853f930867b","raw_url":"https://app.decimal.ai/s/sickn33-advanced-evaluation/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/sickn33-advanced-evaluation"}