用100步GRPO微调350M模型,IFStruct结构化输出从22.6%提升至29.7%
Hugging Face 发布公开教程,用 TRL 库对 LFM2.5-350M 做约500样本、100步的 GRPO 微调,在 IFStruct 基准上从22.6%提升至29.7%,其中 JSON 通过率从18.0%升至31.9%。整套流程可在免费版 Colab 或 Kaggle GPU 上运行,评估可在 MacBook 上通过 llama.cpp 完成,代码已开源在 GitHub。
推荐理由:给出了一套约500样本、100步的轻量GRPO微调配方,读者可据此低成本提升小模型的结构化输出合规率。