{"slug":"graniet-trl-fine-tuning","source_name":"graniet/trl-fine-tuning","name":"Graniet/Trl Fine Tuning","description":"Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.","version":1,"lift":{"pass_rate_delta_pts":4.35,"pass_rate_pct":73.9,"total_cases":23,"passed_cases":17,"tokens_delta_pct":107.2,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-23T05:24:52.822826+00:00"},"skill_score":0.7391,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":4.35,"with_pass_pct":73.9,"without_pass_pct":69.6,"tokens_delta_pct":107.2,"turns_delta_pct":0,"total_cases":23,"cases_aggregated":22,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-23T05:24:52.822826+00:00","run_id":"cf184bfb-940c-4f86-833c-4981018a9332","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"7c696d29bd23bf94ec20d2f26703db85de49220dc426b2c8b58f25ec03a10c3d","raw_url":"https://app.decimal.ai/s/graniet-trl-fine-tuning/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/graniet-trl-fine-tuning"}