跳到正文
原文
AWS Machine Learning Blog· Ashvin Nihalani·· 4 天前AI 评分38

AWS 如何用 EKS、EFA 与 DeepEP 将 MoE 强化学习吞吐提升 40%

Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput

AI 导读

AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。

来源:AWS Machine Learning Blog · aws.amazon.com