评测来源官方评测
Longform Writing
EQ-Bench · 长篇故事的连贯性与完整性
在 小意 AI 热榜 中参与排名
证据预算2.4%
上游数据时间09/24 15:57
最近成功同步09/29 09:55
它测什么,怎么测
采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5Anthropic | 86.3 | 来源默认配置 |
| 2 | claude-fable-5-1Anthropic | 85.3 | 来源默认配置 |
| 3 | claude-opus-5-5Anthropic | 84.6 | 来源默认配置 |
| 4 | grok-4.7xAI | 83 | 来源默认配置 |
| 4 | claude-fable-5Anthropic | 83 | 来源默认配置 |
| 6 | gpt-6-astraOpenAI | 82.8 | 来源默认配置 |
| 6 | gpt-6-solOpenAI | 82.8 | 来源默认配置 |
| 6 | muse-spark-1.3Meta | 82.8 | 来源默认配置 |
| 9 | aion-3.5aion-labs | 82.1 | 来源默认配置 |
| 10 | claude-opus-4-7Anthropic | 81.8 | 来源默认配置 |
| 10 | GLM-5.3Z.ai | 81.8 | 来源默认配置 |
| 12 | gpt-5.6-solOpenAI | 81.7 | 来源默认配置 |
| 13 | muse-spark-1.2Meta | 81.5 | 来源默认配置 |
| 14 | claude-opus-4-8Anthropic | 80.8 | 来源默认配置 |
| 15 | ox-alpha— | 79.9 | 来源默认配置 |
| 15 | claude-sonnet-4-6Anthropic | 79.9 | 来源默认配置 |
| 17 | kimi-k3Moonshot AI | 79.6 | 来源默认配置 |
| 18 | moonshotai/Kimi-K2.6Moonshot AI | 78.5 | 来源默认配置 |
| 19 | claude-sonnet-5Anthropic | 78.3 | 来源默认配置 |
| 19 | gpt-5.4OpenAI | 78.3 | 来源默认配置 |
| 21 | gpt-5.5OpenAI | 78.2 | 来源默认配置 |
| 22 | gpt-5.6-terraOpenAI | 78 | 来源默认配置 |
| 23 | zai-org/GLM-5.2Z.ai | 77.9 | 来源默认配置 |
| 24 | claude-opus-4-6Anthropic | 77.7 | 来源默认配置 |
| 25 | gemini-3.8-flashGoogle | 76.8 | 来源默认配置 |
| 26 | deepseek-ai/DeepSeek-V4-ProDeepSeek | 75.6 | 来源默认配置 |
| 27 | gpt-5.6-lunaOpenAI | 75.5 | 来源默认配置 |
| 28 | moonshotai/Kimi-K2.5Moonshot AI | 74.9 | 来源默认配置 |
| 29 | Altworld/Hemmingway-1— | 74.2 | 来源默认配置 |
| 30 | deepseek-v4.1-flashDeepSeek | 74 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 小意 AI 热榜 共识分使用不同尺度,不能直接相加。