{"slug":"mkurman-lm-evaluation-harness","source_name":"mkurman/lm-evaluation-harness","name":"Mkurman/Lm Evaluation Harness","description":"LLM evaluation framework (EleutherAI lm-evaluation-harness). Unified benchmark evaluation for language models with 200+ tasks, support for HuggingFace transformers, vLLM, SGLang, OpenAI API, GGUF, and custom models. Used by HuggingFace Open LLM Leaderboard. Covers MMLU, HellaSwag, ARC, GSM8K, HumanEval, BBH, TruthfulQA, and more.","version":1,"lift":{"pass_rate_delta_pts":16.67,"pass_rate_pct":91.7,"total_cases":24,"passed_cases":22,"tokens_delta_pct":80.2,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-21T09:57:32.512832+00:00"},"skill_score":0.9167,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":16.67,"with_pass_pct":91.7,"without_pass_pct":75,"tokens_delta_pct":80.2,"turns_delta_pct":0,"total_cases":24,"cases_aggregated":24,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-21T09:57:32.512832+00:00","run_id":"05a8b861-757a-4d01-81e0-31b2613e580e","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT license","install_count":0,"manifest_hash":"fb803972fd00499ab5b7930b8efb2cc7ebbbb40e9f5a78463465f0c9eb4190c0","raw_url":"https://app.decimal.ai/s/mkurman-lm-evaluation-harness/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/mkurman-lm-evaluation-harness"}