{"slug":"nousresearch-fine-tuning-with-trl","source_name":"nousresearch/fine-tuning-with-trl","name":"Nousresearch/Fine Tuning With Trl","description":"TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.","version":1,"lift":{"pass_rate_delta_pts":8.7,"pass_rate_pct":95.7,"total_cases":23,"passed_cases":22,"tokens_delta_pct":190.7,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-08T12:40:15.383413+00:00"},"skill_score":0.9565,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":8.7,"with_pass_pct":95.7,"without_pass_pct":87,"tokens_delta_pct":190.7,"turns_delta_pct":0,"total_cases":23,"cases_aggregated":22,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-08T12:40:15.383413+00:00","run_id":"34707eaa-36a7-4de7-a2c3-effefb4aa05f","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"ade0f8af74ff367ceaca466010b1ab089a33035687acc6b093685c8ae8a79311","raw_url":"https://app.decimal.ai/s/nousresearch-fine-tuning-with-trl/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/nousresearch-fine-tuning-with-trl"}