models-research
TRL v1.14.0 drops six experimental trainers, adds Triton kernel for log-probs and entropy.
The v1.14.0 release of TRL removes six experimental trainers, including GRPOWithReplayBufferTrainer and BCOTrainer.
1 sources · 1 verified claims