{"slug":"jpoindexter-llm-evals-and-retrieval-quality","source_name":"jpoindexter/llm-evals-and-retrieval-quality","name":"Jpoindexter/LLM Evals And Retrieval Quality","description":"Reference-grade guide to evaluating LLM and RAG systems — golden/regression/adversarial eval sets, LLM-as-judge and its biases, retrieval metrics (recall@k, MRR, nDCG), grounding/faithfulness/attribution, RAGAS-style scoring, eval-set construction from production traces, and the CI gates that stop silent regressions.","version":1,"lift":{"pass_rate_delta_pts":13.64,"pass_rate_pct":90.9,"total_cases":22,"passed_cases":20,"tokens_delta_pct":260.2,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-03T12:50:34.062510+00:00"},"skill_score":0.9091,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":13.64,"with_pass_pct":90.9,"without_pass_pct":77.3,"tokens_delta_pct":260.2,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-03T12:50:34.062510+00:00","run_id":"ce858ccc-1b57-4844-ac0f-f9b0a28c2103","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":null,"install_count":2,"manifest_hash":"62557147ebeb37142ee8d014de7dff9bf7c549da8cbae1fa0ffa70f52125d6d5","raw_url":"https://app.decimal.ai/s/jpoindexter-llm-evals-and-retrieval-quality/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/jpoindexter-llm-evals-and-retrieval-quality"}