{"slug":"graniet-vllm","source_name":"graniet/vllm","name":"Graniet/Vllm","description":"Serves LLMs with high throughput using vLLM's PagedAttention and continuous batching. Use when deploying production LLM APIs, optimizing inference latency/throughput, or serving models with limited GPU memory. Supports OpenAI-compatible endpoints, quantization (GPTQ/AWQ/FP8), and tensor parallelism.","version":1,"lift":{"pass_rate_delta_pts":27.27,"pass_rate_pct":90.9,"total_cases":22,"passed_cases":20,"tokens_delta_pct":85.3,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-23T05:13:30.044926+00:00"},"skill_score":0.9091,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":27.27,"with_pass_pct":90.9,"without_pass_pct":63.6,"tokens_delta_pct":85.3,"turns_delta_pct":0,"total_cases":22,"cases_aggregated":22,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-23T05:13:30.044926+00:00","run_id":"68b8e515-da11-45bf-ae27-615a2a789903","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"f5df326f89c72f4cee766a0cfff1d5e0bf4d0e4a62ffba77855a697d29048875","raw_url":"https://app.decimal.ai/s/graniet-vllm/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/graniet-vllm"}