InternLM/xtuner

About RLHF need

開放

#93 建立於 2023年9月4日

 (3 則留言) (1 個反應) (1 位負責人)Python (443 個分叉)github user discovery
feature requestgood first issue

倉庫指標

星標
 (5,179 顆星)
PR 合併指標
 (平均合併 2天 22小時) (30 天內合併 65 個 PR)

描述

需要实现几种对齐算法 1.PPO 这个没的说,比较传统和通用,但是训练的开销会大一点 2. RAFT LMFLOW社区有做 https://optimalscale.github.io/LMFlow/examples/raft.html 3.pangu-coder2 RRTF (Rank Responses to align Test&Teacher Feedback) 总结一下是说,他们是用了代码单元测试,然后把单元测试的结果作为标签合并Loss微调LLM https://arxiv.org/abs/2307.14936 image image RRTF华为他们这部分没有开源。RAFT是开源了,RRTF可以的话可以一起讨论一起实现一下。

貢獻者指南