{"slug":"alirezarezvani-eval","source_name":"alirezarezvani/eval","name":"Alirezarezvani/Eval","description":"Evaluate and rank agent results by metric or LLM judge for an AgentHub session. Use when the user runs /hub:eval or asks to score, compare, or pick a winner among completed AgentHub agents.","version":1,"lift":{"pass_rate_delta_pts":63.64,"pass_rate_pct":81.8,"total_cases":22,"passed_cases":18,"tokens_delta_pct":-13.5,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-10T03:49:35.667607+00:00"},"skill_score":0.8182,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":63.64,"with_pass_pct":81.8,"without_pass_pct":18.2,"tokens_delta_pct":-13.5,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":19,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-10T03:49:35.667607+00:00","run_id":"4cf7fcf9-b161-45ee-92d9-5216fd57b7d5","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"8da4362b71310eee325752f72c17947b94e4d729408619dbad3d7067fdfcb42a","raw_url":"https://app.decimal.ai/s/alirezarezvani-eval/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/alirezarezvani-eval"}