avnlp

avnlp/llm-finetuning

Advanced LLM fine-tuning techniques: SFT (LoRA, QLoRA, DoRA, P-/Prefix-Tuning), GRPO, DPO, ORPO, KTO & PPO; composable correctness/format rewards + LLM-as-a-Judge evals (DeepEval, Evidently AI) across math, multi-hop, medical & general QA on Llama 3, Mistral, Phi-4, Gemma & Qwen3. Built on TRL, PEFT & Unsloth.

⭐ 10 ⑂ 5 Python MIT · 16 天前推送
10
Watchers
0
贡献者
0
Commits
0
Releases
0
Open Issues
16 天前
最近推送
原文 中文
暂无 README