Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 支撑 Papers with Code 搜索
Hugging Face 在 Papers with Code 上构建了混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 向量检索,并用 RRF 融合排序。
Hugging Face 在 Papers with Code 上构建了混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 向量检索,并用 RRF 融合排序。
Dharma AI 构建了约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权输出平均提升 52%。分配器将实时推理需求视为曲线而非峰值预留,按优先级跨整个时间轴放置批处理作业,并在 1 到 2 毫秒内完成调度。文章还介绍了训练、量化等负载的专用预测器,以及 24 小时优化、每 30 到 60 分钟重跑的机制。
推荐理由:原文给出了约束感知 GPU 分配器相对 FIFO 的实测收益和实现思路,读者可据此评估调度顺序优化对集群利用率的实际影响。