{"slug":"mkurman-trl","source_name":"mkurman/trl","name":"Mkurman/Trl","description":"Transformer Reinforcement Learning library (TRL). Supervised fine-tuning (SFT), reward modeling, PPO, DPO, KTO, GRPO for RLHF. Process reward models and language model alignment.","version":1,"lift":{"pass_rate_delta_pts":-11.11,"pass_rate_pct":64,"total_cases":25,"passed_cases":16,"tokens_delta_pct":-8.1,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-21T17:34:35.775125+00:00"},"skill_score":null,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":-11.11,"with_pass_pct":44.4,"without_pass_pct":55.6,"tokens_delta_pct":-8.1,"turns_delta_pct":0,"total_cases":25,"cases_aggregated":25,"verdict":"mixed","never_hurt":false,"completed_at":"2026-08-21T17:34:35.775125+00:00","run_id":"165b0474-67db-46da-91f2-03fedd7b32fe","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"9295e71c2dc4a94a72a2c535d937783c1bf930c7acd225a40c601f16a56f8ff7","raw_url":"https://app.decimal.ai/s/mkurman-trl/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/mkurman-trl"}