{"slug":"refoundai-ai-evals","source_name":"refoundai/ai-evals","name":"Refoundai/AI Evals","description":"Help users build robust infrastructure for measuring, monitoring, and iterating on AI product performance using human, code-based, and LLM-as-a-judge methodologies.","version":1,"lift":{"pass_rate_delta_pts":13.64,"pass_rate_pct":86.4,"total_cases":22,"passed_cases":19,"tokens_delta_pct":38.3,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-14T07:50:09.625369+00:00"},"skill_score":null,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":13.64,"with_pass_pct":86.4,"without_pass_pct":72.7,"tokens_delta_pct":38.3,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"mixed","never_hurt":false,"completed_at":"2026-08-14T07:50:09.625369+00:00","run_id":"05a07cc7-a714-4db1-93b8-5c55657f8f13","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"54db53af809ff14b355a62d716f3c2749eb9970e5310c812d8bfca3a4ba1a77e","raw_url":"https://app.decimal.ai/s/refoundai-ai-evals/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/refoundai-ai-evals"}