PKU-Alignment/safe-rlhf
Safe RLHF: Constrained Value Alignment via Safe Reinforcement Learning from Human Feedback
⭐ 1.6k
⑂ 133
Python
Apache-2.0
· 2025-11-24推送
1.6k
Watchers
0
贡献者
0
Commits
0
Releases
18
Open Issues
2025-11-24
最近推送
原文
中文
暂无 README