{"slug":"agentsope-agentsop-domain-eval-set","source_name":"agentsope/agentsop-domain-eval-set","name":"Agentsope/Agentsop Domain Eval Set","description":"Build and govern a 50-200 example domain-specific held-out benchmark sampled from real traffic. Distinct from public benchmarks (MMLU/HumanEval/GSM8K via lm-evaluation-harness) which measure GENERAL capability. Only a held-out domain set predicts whether THIS system works on YOUR data. Collect real examples, label, hold out (never train/prompt on it), size 50-200, version it, refresh on drift.","version":1,"lift":{"pass_rate_delta_pts":27.27,"pass_rate_pct":90.9,"total_cases":22,"passed_cases":20,"tokens_delta_pct":239,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-24T13:59:27.329422+00:00"},"skill_score":0.9091,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":27.27,"with_pass_pct":90.9,"without_pass_pct":63.6,"tokens_delta_pct":239,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":20,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-24T13:59:27.329422+00:00","run_id":"1e244e25-4d59-4de4-abfd-8bc22cba999e","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"b0103a19259e20e9268eda1dae5cee9791802f9555b92d3de77cb1e3d345702d","raw_url":"https://app.decimal.ai/s/agentsope-agentsop-domain-eval-set/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/agentsope-agentsop-domain-eval-set"}