Hugging Face Blog·· 27 天前精选AI 评分63
Hugging Face 用 TRL GRPO 100 步微调 LFM2.5-350M 提升结构化输出,IFStruct 从 22.6% 升至 29.7%
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 发布完整教程,用 TRL 库的 GRPO 结合 LoRA 微调 LiquidAI/LFM2.5-350M,仅需约 500 样本和 100 步训练即可在免费级 Colab 或 Kaggle 16 GB GPU 上完成。
推荐理由
完整开源了小模型 GRPO 结构化输出微调的配方和评测对比,资源门槛低,方法可直接迁移到其他小模型任务。
来源:Hugging Face Blog · huggingface.co