跳到正文
评测来源

Mercor APEX-Agents 1.1

Mercor / 专业办公 · 投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。

官方评测
在 openhot 中参与排名
证据预算4%
上游数据时间09/08 08:00
最近成功同步09/29 08:55

它测什么,怎么测

固定 1.1 数据集和官方 Loop 环境,采用 Pass@1 及其对应误差,按预先固定的推理档位选配置。Mean Score 是评分项平均完成度,不混作任务完成率。

如何使用这份证据

固定 1.1 版官方 Loop 的 Pass@1,独占工具与办公预算中的 4%;另 2% 用于统一环境的银行业务任务。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-sonnet-5-5—75.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-opus-5-5Anthropic73.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-fable-5.1Anthropic68.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4gemini-3.7-flashGoogle67.8%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5claude-opus-5Anthropic65.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6grok-4-6-xhighxAI65.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7gpt-6-astra-maxOpenAI64.7%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gemini-3.8-flashGoogle64.3%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9claude-fable-5Anthropic63.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10qwen-3-8-max-xhighAlibaba63.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-5.6-terra-maxOpenAI58.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
13muse-spark-1-3Meta57.8%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14glm-5-3Z.ai56.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15grok-4-5xAI56.2%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16deepseek-v4-flashDeepSeek55.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17gpt-5.5-xhighOpenAI55.1%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18grok-4.7xAI54.6%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19claude-sonnet-5-maxAnthropic54.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20gpt-6-solOpenAI54.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21glm-5-3-flashZ.ai52.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23responses/gpt-5.4OpenAI52.4%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
24gpt-5-6-sol-max-proOpenAI51.4%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25kimi-k3Moonshot AI50.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26claude-opus-4-7Anthropic49.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27claude-opus-4-8Anthropic48.9%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28qwen-3-8-27bAlibaba47.5%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29deepseek-v4-pro-08-13DeepSeek47.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30gemini-3.6-flashGoogle46.9%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31claude-opus-4-6-maxAnthropic46.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32glm-5-2Z.ai45.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
评测局限与数据署名

限投行、咨询、法律任务;原页未提供逐型号评测日期,少量运行缺失的原因尚未公开。不能将此分数解释为所有办公工作的可靠性。

数据许可:官方公开结果;数据与代码许可不等于榜单再分发授权

成绩由 Mercor 发布,原始分数与 openhot 共识分使用不同尺度,不能直接相加。