跳到正文
原文
Hugging Face Blog·· 26 天前精选AI 评分62

用100步GRPO微调350M模型,IFStruct结构化输出从22.6%提升至29.7%

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face 发布公开教程,用 TRL 库对 LFM2.5-350M 做约500样本、100步的 GRPO 微调,在 IFStruct 基准上从22.6%提升至29.7%,其中 JSON 通过率从18.0%升至31.9%。整套流程可在免费版 Colab 或 Kaggle GPU 上运行,评估可在 MacBook 上通过 llama.cpp 完成,代码已开源在 GitHub。

推荐理由

给出了一套约500样本、100步的轻量GRPO微调配方,读者可据此低成本提升小模型的结构化输出合规率。

来源:Hugging Face Blog · huggingface.co