anshupriyan/AI-Examiner-Reinforcemnt_learning-fine_tunning
Adversarial LLM arena using GRPO + SFT to train a model that generates questions hard LLMs can't solve
⭐ 12
⑂ 0
Python
MIT
· 2026-05-22推送
12
Watchers
0
贡献者
0
Commits
0
Releases
0
Open Issues
2026-05-22
最近推送
原文
中文
暂无 README