{"slug":"davila7-llm-evaluation","source_name":"davila7/llm-evaluation","name":"Davila7/LLM Evaluation","description":"Master comprehensive evaluation strategies for LLM applications, from automated metrics to human evaluation and A/B testing.","version":1,"lift":{"pass_rate_delta_pts":9.09,"pass_rate_pct":90.9,"total_cases":22,"passed_cases":20,"tokens_delta_pct":113.1,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-11T20:55:23.889447+00:00"},"skill_score":null,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":9.09,"with_pass_pct":90.9,"without_pass_pct":81.8,"tokens_delta_pct":113.1,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"mixed","never_hurt":false,"completed_at":"2026-08-11T20:55:23.889447+00:00","run_id":"1116f197-fe85-4e55-a845-9e0bf13d3a7f","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"658b6a687cb36c0cd8921a310cb734cce04a8661dffdfae5ab4ce00ac96dd48f","raw_url":"https://app.decimal.ai/s/davila7-llm-evaluation/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/davila7-llm-evaluation"}