Aperta
SFT+GRPO推理性能与训练过程中val精度不一致
help wanted
Perché consigliataNessun assegnatario · Ha una label adatta ai principianti
Nessun assegnatarioHa una label adatta ai principiantiGuida alla contribuzione disponibile
11 commenti0 reazioni0 assegnatari
Issue del repository
EasyR1: An Efficient, Scalable, Multi-Modality RL Training Framework based on veRL