skillrank_skill Orchestra-Research/fine-tuning-with-trlMIT · open registry

skill detail

← registry

fine-tuning-with-trl

Orchestra-Research/fine-tuning-with-trl

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training.

communityprovisionalaiaiai-research

skillrank score

█████████░░░░░░░55

SkillRank score blends community stars, real usage, and our eval lift; provisional until a skill is evaluated -- so popularity alone can't reach the top tier.

source

10.5k

Orchestra-Research/AI-Research-SKILLs

06-post-training/trl-fine-tuning

open on GitHub ▸

eval status

eval pending

Success delta, token delta, and trial count are not available yet. No eval number is shown until this skill has measured results.

install

$ skillrank install Orchestra-Research/fine-tuning-with-trl
$ curl -fsSL skillrank.dev | sh