数据来源:LMSYS Chatbot Arena · GitHub,
每日自动更新
Elo 是国际象棋界发明的评分系统,用来衡量选手的相对实力。放到大模型上,衡量的就是「哪个模型更会聊天、更能干活」。
怎么算出来的:LMSYS Chatbot Arena 把两个模型匿名摆在一起回答同一个问题,真人用户在不看名字的情况下投票选出更好的那个——赢一局加分、输一局扣分,对手越强、赢得越多,和棋类评级是同一个逻辑。
为什么用它排名:这是真人盲测的结果,不是厂商自吹的跑分、也不是纸面参数。分数越高,代表在成百上千场「对决」里越常被真人选为更优;分差越大,实力差距越明显。
后面的「±」是置信区间:投票样本越少、误差越大,会随样本累积逐步收紧。
| # | 模型 | 厂商 | Elo 分 | 投票 |
|---|---|---|---|---|
| 🥇1 | hy4-preview | Tencent | 1624.0 ±13.0 | 2.3k |
| 🥈2 | glm-5.3-max | Z.ai | 1614.0 ±11.0 | 3.7k |
| 🥉3 | deepseek-v4.1-flash-max | DeepSeek | 1614.0 ±17.0 | 1.4k |
| 4 | glm-5.3-flash | Z.ai | 1607.0 ±12.0 | 2.9k |
| 5 | qwen3.8-27b | Alibaba | 1593.0 ±9.0 | 4.9k |
| 6 | glm-5.2-max | Z.ai | 1592.0 ±7.0 | 10.5k |
| # | 模型 | 厂商 | Elo 分 | 投票 |
|---|---|---|---|---|
| 🥇1 | claude-fable-5-high | Anthropic | 1506.0 ±5.0 | 30.1k |
| 🥈2 | claude-opus-4-6-high | Anthropic | 1505.0 ±4.0 | 72.0k |
| 🥉3 | claude-opus-4-7-high | Anthropic | 1502.0 ±4.0 | 60.0k |
| 4 | muse-spark-1.2 (xHigh) | Meta | 1500.0 ±11.0 | 3.2k |
| 5 | claude-fable-5.1-max | Anthropic | 1498.0 ±8.0 | 5.8k |
| 6 | claude-opus-4-6 | Anthropic | 1497.0 ±3.0 | 75.9k |
| 7 | claude-opus-4-7 | Anthropic | 1494.0 ±4.0 | 61.1k |
| 8 | muse-spark-1.3-max | Meta | 1493.0 ±9.0 | 4.7k |
| 9 | gemini-3.8-flash-high | 1493.0 ±9.0 | 5.1k | |
| 10 | claude-opus-5-high | Anthropic | 1493.0 ±4.0 | 42.6k |
| # | 模型 | 厂商 | Net Improvement | 会话数 |
|---|---|---|---|---|
| 🥇1 | Claude Fable 5.1 (Max) | Anthropic | 13.71 ±1.72 | 13.3k |
| 🥈2 | GPT 6 Astra (Max) | OpenAI | 11.54 ±2.10 | 10.4k |
| 🥉3 | Claude Opus 5 (High) | Anthropic | 10.25 ±1.41 | 24.8k |
| 4 | Claude Opus 5 (Max) | Anthropic | 10.16 ±1.55 | 19.9k |
| 5 | Claude Fable 5 (High) | Anthropic | 8.81 ±1.25 | 38.3k |
| 6 | Claude Opus 4.8 (High) | Anthropic | 8.19 ±1.27 | 39.7k |
| 7 | GPT 5.6 Sol (xHigh) | OpenAI | 7.10 ±1.28 | 32.2k |
| 8 | Kimi K3 (Max) | Moonshot | 6.22 ±0.62 | 108.6k |
| 9 | Claude Sonnet 5 (High) | Anthropic | 5.97 ±1.62 | 30.6k |
| 10 | GPT 5.5 (xHigh) | OpenAI | 5.03 ±0.92 | 53.1k |
| # | 模型 | 厂商 | Elo 分 | 投票 |
|---|---|---|---|---|
| 🥇1 | gemini-omni-1.1-flash | 1515.0 ±15.0 | 1.8k | |
| 🥈2 | gemini-omni-flash | 1511.0 ±10.0 | 21.9k | |
| 🥉3 | wan3.0 | Alibaba | 1494.0 ±19.0 | 1.2k |
| 4 | flux-3-video | Black Forest Labs | 1494.0 ±17.0 | 1.3k |
| 5 | grok-imagine-video-1.5-agent | SpaceXAI | 1491.0 ±19.0 | 1.2k |
| 6 | dreamina-seedance-2.5-720p | Bytedance | 1482.0 ±12.0 | 4.1k |
| 7 | dreamina-seedance-2.0-720p | Bytedance | 1479.0 ±8.0 | 52.9k |
| 8 | minimax-h3 | MiniMax | 1462.0 ±10.0 | 7.6k |
| 9 | muse-video | Meta | 1456.0 ±15.0 | 2.2k |
| 10 | happyhorse-1.0 | Alibaba-ATH | 1427.0 ±13.0 | 22.1k |
| # | 模型 | 厂商 | Elo 分 | 投票 |
|---|---|---|---|---|
| 🥇1 | gpt-image-2.5-sunburst | OpenAI | 1421.0 ±13.0 | 3.1k |
| 🥈2 | gpt-image-2.5-flare | OpenAI | 1399.0 ±13.0 | 2.9k |
| 🥉3 | gpt-image-2 (medium) | OpenAI | 1381.0 ±4.0 | 78.7k |
| 4 | mai-image-2.6 | Microsoft AI | 1331.0 ±7.0 | 11.2k |
| 5 | grok-imagine-image-2.0 (low) | SpaceXAI | 1315.0 ±12.0 | 2.7k |
| 6 | reve-2.1 | Reve | 1301.0 ±8.0 | 7.6k |
| 7 | muse-image | Meta | 1277.0 ±6.0 | 26.0k |
| 8 | reve-2.0 | Reve | 1270.0 ±6.0 | 14.6k |
| 9 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1261.0 ±5.0 | 42.0k | |
| 10 | seedream-5.0-pro | Bytedance | 1257.0 ±4.0 | 62.4k |
| # | 模型 | 厂商 | Elo 分 | 投票 |
|---|---|---|---|---|
| 🥇1 | claude-fable-5-high | Anthropic | 1310.0 ±8.0 | 11.3k |
| 🥈2 | qwen3.8-max | Alibaba | 1302.0 ±8.0 | 8.7k |
| 🥉3 | claude-opus-4-7-high | Anthropic | 1301.0 ±7.0 | 21.1k |
| 4 | claude-opus-4-7 | Anthropic | 1300.0 ±7.0 | 21.4k |
| 5 | claude-opus-4-6-high | Anthropic | 1299.0 ±7.0 | 20.8k |
| 6 | muse-spark-1.3-max | Meta | 1294.0 ±15.0 | 1.8k |
| 7 | muse-spark | Meta | 1294.0 ±9.0 | 5.6k |
| 8 | claude-opus-4-6 | Anthropic | 1293.0 ±7.0 | 25.1k |
| 9 | muse-spark-1.2 (xHigh) | Meta | 1292.0 ±15.0 | 1.8k |
| 10 | claude-opus-5-high | Anthropic | 1289.0 ±8.0 | 11.6k |
| # | 项目 | 描述 | Star | 语言 |
|---|---|---|---|---|
| 🥇1 | openclaw/openclaw | The AI that really does things. Any OS. Any Platform. The lo | ⭐ 389.8k | TypeScript |
| 🥈2 | obra/superpowers | An agentic skills framework & software development methodolo | ⭐ 287.2k | Shell |
| 🥉3 | NousResearch/hermes-agent | The agent that grows with you | ⭐ 245.9k | Python |
| 4 | n8n-io/n8n | Fair-code workflow automation platform with native AI capabi | ⭐ 204.4k | TypeScript |
| 5 | Significant-Gravitas/AutoGPT | AutoGPT is the vision of accessible AI for everyone, to use | ⭐ 187.4k | Python |
| 6 | firecrawl/firecrawl | The context API to search, scrape, and interact with the web | ⭐ 180.9k | TypeScript |
| 7 | f/prompts.chat | f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect | ⭐ 170.4k | HTML |
| 8 | AUTOMATIC1111/stable-diffusion-webui | Stable Diffusion web UI | ⭐ 165.0k | Python |
| 9 | Snailclimb/JavaGuide | Java 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发 | ⭐ 158.6k | JavaScript |
| 10 | langgenius/dify | Build Agentic workflows, RAG pipelines, with rich AI model a | ⭐ 155.9k | TypeScript |