评测来源官方评测
Creative Writing v3
EQ-Bench · 短篇创作与表达
在 openhot 中参与排名
证据预算3.6%
上游数据时间09/24 15:57
最近成功同步09/29 08:54
它测什么,怎么测
官方 CSV 内嵌于数据脚本,采用 Elo;Sonnet 4.6 判胜负,风格、重复率和 rubric 不重复计票。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,173.3 | 来源默认配置 |
| 2 | claude-fable-5-1Anthropic | 2,162 | 来源默认配置 |
| 3 | claude-opus-5Anthropic | 2,132.6 | 来源默认配置 |
| 4 | gpt-6-solOpenAI | 2,124.7 | 来源默认配置 |
| 5 | kimi-k3Moonshot AI | 2,082.3 | 来源默认配置 |
| 6 | GLM-5.3Z.ai | 2,075 | 来源默认配置 |
| 7 | claude-opus-5-5Anthropic | 2,050.1 | 来源默认配置 |
| 8 | grok-4.7xAI | 2,006.7 | 来源默认配置 |
| 9 | ox-alpha— | 1,971.7 | 来源默认配置 |
| 10 | gpt-5.6-solOpenAI | 1,971.6 | 来源默认配置 |
| 11 | claude-fable-5Anthropic | 1,943.1 | 来源默认配置 |
| 12 | aion-3.5aion-labs | 1,929.3 | 来源默认配置 |
| 13 | muse-spark-1.1Meta | 1,927.1 | 来源默认配置 |
| 14 | claude-opus-4-7Anthropic | 1,914.3 | 来源默认配置 |
| 15 | Altworld/Hemmingway-1— | 1,906.4 | 来源默认配置 |
| 16 | muse-spark-1.3Meta | 1,905.9 | 来源默认配置 |
| 17 | gpt-5.6-terraOpenAI | 1,854.9 | 来源默认配置 |
| 18 | gpt-5.5OpenAI | 1,843.9 | 来源默认配置 |
| 19 | Qwen/Qwen3.8-2.4T-A95BAlibaba | 1,842.5 | 来源默认配置 |
| 20 | muse-spark-1.2Meta | 1,840.4 | 来源默认配置 |
| 21 | claude-opus-4-8Anthropic | 1,839.8 | 来源默认配置 |
| 22 | gpt-5.4OpenAI | 1,839.7 | 来源默认配置 |
| 23 | gpt-5.6-lunaOpenAI | 1,828.7 | 来源默认配置 |
| 24 | claude-sonnet-4-6Anthropic | 1,810.4 | 来源默认配置 |
| 25 | claude-opus-4-6Anthropic | 1,809.1 | 来源默认配置 |
| 26 | meta-models/Muse-Glimmer-30BMeta | 1,798.3 | 来源默认配置 |
| 27 | claude-sonnet-5Anthropic | 1,794 | 来源默认配置 |
| 28 | space-bunny-alphastealth | 1,784.3 | 来源默认配置 |
| 29 | zai-org/GLM-5.2Z.ai | 1,756.5 | 来源默认配置 |
| 30 | gemini-3.8-flashGoogle | 1,747.9 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 openhot 共识分使用不同尺度,不能直接相加。