{"slug":"brycewang-stanford-llm-evaluation-guide","source_name":"brycewang-stanford/llm-evaluation-guide","name":"Brycewang Stanford/LLM Evaluation Guide","description":"Evaluate and benchmark large language models for research applications","version":1,"lift":{"pass_rate_delta_pts":4.35,"pass_rate_pct":82.6,"total_cases":23,"passed_cases":19,"tokens_delta_pct":53,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-29T00:13:31.857827+00:00"},"skill_score":0.8261,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":4.35,"with_pass_pct":82.6,"without_pass_pct":78.3,"tokens_delta_pct":53,"turns_delta_pct":0,"total_cases":23,"cases_aggregated":23,"verdict":"mixed","never_hurt":false,"completed_at":"2026-08-29T00:13:31.857827+00:00","run_id":"7238399f-b636-4af4-a7de-27a165358c99","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"NOASSERTION","install_count":0,"manifest_hash":"b866464fbb028d98244756f6a262bddfd617aeb6c9a69f7acc87b6ae57e1bfcc","raw_url":"https://app.decimal.ai/s/brycewang-stanford-llm-evaluation-guide/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/brycewang-stanford-llm-evaluation-guide"}