{"slug":"aperivue-design-ai-benchmarking","source_name":"aperivue/design-ai-benchmarking","name":"Aperivue/Design AI Benchmarking","description":"Design and validity review for studies that benchmark one or more AI systems against a human-expert panel as the reference. Covers the evaluation question and arm definition, decoupled multi-dimensional rubrics with anchors, planted calibration probes, reviewer-panel construction, inter-rater reliability targets, LLM-as-judge versus human-as-judge adjudication, construct-independence guards, and a structured rating-export schema. Use before data collection on an AI-vs-expert evaluation.","version":1,"lift":{"pass_rate_delta_pts":40.91,"pass_rate_pct":86.4,"total_cases":22,"passed_cases":19,"tokens_delta_pct":64.5,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-24T22:26:38.194838+00:00"},"skill_score":0.8636,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":40.91,"with_pass_pct":86.4,"without_pass_pct":45.5,"tokens_delta_pct":64.5,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":21,"verdict":"mixed","never_hurt":false,"completed_at":"2026-08-24T22:26:38.194838+00:00","run_id":"00826d85-de62-4504-9c16-6315319d7e15","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"a93b6c4b6cbb74ab1a739eee4e90af3e9f295277802d5515721623bca462639b","raw_url":"https://app.decimal.ai/s/aperivue-design-ai-benchmarking/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/aperivue-design-ai-benchmarking"}