{"slug":"openlair-speculative-decoding","source_name":"openlair/speculative-decoding","name":"Openlair/Speculative Decoding","description":"Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies.","version":1,"lift":{"pass_rate_delta_pts":13.64,"pass_rate_pct":81.8,"total_cases":22,"passed_cases":18,"tokens_delta_pct":176.5,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-07T19:20:48.967378+00:00"},"skill_score":0.8182,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":13.64,"with_pass_pct":81.8,"without_pass_pct":68.2,"tokens_delta_pct":176.5,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-07T19:20:48.967378+00:00","run_id":"13fee27e-0b73-48b2-9775-c643e67380f8","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"5c13ad50ab24ee981d8517b7bdaf9f812b89c26597c9e2ba2b8a5c3ce096cb12","raw_url":"https://app.decimal.ai/s/openlair-speculative-decoding/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/openlair-speculative-decoding"}