大模型排行榜
数据更新于 2026-09-01
(每月滚动复核,非实时拉取)
厂商
参考价 = 公开定价(输入 / 输出,每 1M tokens),编辑整理、以官方为准;视频模型按生成计费未列入。
综合榜
🥇
#1
Claude Fable 5
Anthropic
1507分
$15 / $75
🥈
#2
Claude Opus 4.7
Anthropic
1502分
$15 / $75
| 排名 | 模型 | 评分 | 参考价 | 上下文 | 特性 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic |
1507 | $15 / $75 | 1M | 对话推理多模态 | 综合体验与长上下文领先 |
| 2 | Claude Opus 4.7 Anthropic |
1502 | $15 / $75 | 1M | 推理Agent | Agent 与复杂推理标杆 |
| 3 | 月之暗面 |
1489 | ¥1 / ¥4 | 200万 | 长文本推理 | 超长上下文,开源权重可选 |
| 4 | Gemini 3.1 Pro Google |
1487 | $1.25 / $10 | 1M | 多模态长上下文 | 原生多模态与超长上下文 |
| 5 | GPT-5.5 OpenAI |
1482 | $10 / $30 | 1.1M | 通用编码 | 复杂推理与编码强劲 |
| 6 | 智谱 AI |
1484 | ¥1 / ¥5 | 1M | 推理开源 | 国产推理强项,开源友好 |
| 7 | 阿里巴巴 |
1478 | ¥3.6 / ¥12 | 1M | 中文开源 | 中文理解顶级,生态完善 |
| 8 | 百度 |
1476 | ¥0.8 / ¥3.2 | 256K | 中文全模态 | 中文第一梯队,原生全模态 |
| 9 | Grok 4.2 xAI |
1480 | $5 / $25 | 1M | 实时多智能体 | 实时信息与多智能体协作 |
| 10 | DeepSeek |
1467 | $0.55 / $2.19 | 128K | 推理开源性价比 | 开源旗舰,价格仅闭源零头 |
| 11 | 腾讯 |
1450 | ¥0.8 / ¥2 | 256K | 中文多模态 | 中文与多模态均衡 |
| 12 | MiniMax M2.7 MiniMax |
1455 | ¥1 / ¥4 | 1M | 性价比长程 | 低成本长程任务高分 |
国产榜
| 排名 | 模型 | 评分 | 参考价 | 上下文 | 特性 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | 月之暗面 |
1489 | ¥1 / ¥4 | 200万 | 长文本推理 | 超长上下文,逼近闭源旗舰 |
| 2 | 智谱 AI |
1484 | ¥1 / ¥5 | 1M | 推理开源 | HLE/GPQA 国产第一 |
| 3 | 阿里巴巴 |
1478 | ¥3.6 / ¥12 | 1M | 中文开源 | 中文理解顶级,生态完善 |
| 4 | 百度 |
1476 | ¥0.8 / ¥3.2 | 256K | 中文全模态 | 原生全模态统一建模 |
| 5 | DeepSeek |
1467 | $0.55 / $2.19 | 128K | 推理开源 | 开源性价比之王 |
| 6 | MiniMax M2.7 MiniMax |
1455 | ¥1 / ¥4 | 1M | 性价比长程 | Lightning Attention 长程高分 |
| 7 | 腾讯 |
1450 | ¥0.8 / ¥2 | 256K | 多模态中文 | 多模态与中文均衡 |
| 8 | 字节跳动 |
1445 | ¥0.8 / ¥2 | 256K | 多模态端侧 | 多模态与端侧部署 |
| 9 | 阶跃星辰 |
1440 | ¥1 / ¥4 | 128K | 多模态推理 | 多模态与推理并进 |
| 10 | 昆仑万维 |
1435 | ¥1 / ¥4 | 200K | 搜索增强 | 搜索增强型对话 |
| 11 | 百川 |
1430 | ¥1 / ¥4 | 128K | 中文 | 中文场景稳健 |
| 12 | 科大讯飞 |
1425 | ¥1 / ¥4 | 128K | 中文语音 | 语音与中文场景见长 |
编码榜
🥇
#1
Claude Opus 4.7
Anthropic
87.6分
$15 / $75
🥈
#2
GPT-5.4 Codex
OpenAI
85分
$20 / $80
| 排名 | 模型 | 评分 | 参考价 | 上下文 | 特性 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.7 Anthropic |
87.6 | $15 / $75 | 1M | Agent重构 | 跨文件理解与重构领先 |
| 2 | GPT-5.4 Codex OpenAI |
85 | $20 / $80 | 1.1M | 自主修复 | 自主修复 PR 能力强 |
| 3 | DeepSeek |
80.6 | $0.55 / $2.19 | 128K | 开源低成本 | 开源中编码第一梯队 |
| 4 | Gemini 3.1 Pro Google |
78.8 | $1.25 / $10 | 1M | 多语言 | 多语言工程均衡 |
| 5 | 智谱 AI |
77.8 | ¥1 / ¥5 | 1M | 推理 | 推理赋能编码 |
| 6 | 月之暗面 |
78 | ¥1 / ¥4 | 200万 | 长上下文 | 超长上下文利于大库理解 |
| 7 | 阿里巴巴 |
76.4 | ¥3.6 / ¥12 | 1M | 开源 | 开源编码生态完善 |
| 8 | 百度 |
72 | ¥0.8 / ¥3.2 | 256K | 中文 | 中文业务代码友好 |
| 9 | 腾讯 |
70 | ¥0.8 / ¥2 | 256K | 工程 | 工程实践适配 |
| 10 | 阿里巴巴 |
68 | 订阅制 | IDE | IDE 集成 | IDE 内编码助手 |
多模态榜
🥇
#1
Gemini 3.1 Pro
Google
1492分
$1.25 / $10
🥈
#2
GPT-5.5
OpenAI
1470分
$10 / $30
🥉
#3
Claude Opus 4.7
Anthropic
1458分
$15 / $75
| 排名 | 模型 | 评分 | 参考价 | 上下文 | 特性 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Google |
1492 | $1.25 / $10 | 1M | 图像视频 | 图像与视频理解领先 |
| 2 | GPT-5.5 OpenAI |
1470 | $10 / $30 | 1.1M | 图像语音 | 跨模态生成均衡 |
| 3 | Claude Opus 4.7 Anthropic |
1458 | $15 / $75 | 1M | 视觉理解 | 视觉理解稳健 |
| 4 | 百度 |
1440 | ¥0.8 / ¥3.2 | 256K | 全模态 | 原生全模态统一建模 |
| 5 | 腾讯 |
1430 | ¥0.8 / ¥2 | 256K | 多模态 | 多模态生成均衡 |
| 6 | 阿里巴巴 |
1420 | ¥3.6 / ¥12 | 1M | 视觉语言 | 视觉语言开源强 |
| 7 | 字节跳动 |
1415 | ¥0.8 / ¥2 | 256K | 图像视频 | 图像与视频生成 |
| 8 | 阶跃星辰 |
1405 | ¥1 / ¥4 | 128K | 视觉 | 视觉理解见长 |
| 9 | 月之暗面 |
1395 | ¥1 / ¥4 | 200万 | 文本为主 | 文本见长,多模态跟进 |
| 10 | 海螺 MiniMax |
1390 | ¥1 / ¥4 | 1M | 语音视频 | 语音与视频生成 |
视频榜
| 排名 | 模型 | 评分 | 参考价 | 规格 | 特性 | 亮点 |
|---|---|---|---|---|---|---|
| 1 | Veo 3.1 Google |
95 | — | 4K / 8s / 原生音频同步 | 4K原生音频多镜头 | 4K + 原生音频,提示词遵循最佳 |
| 2 | 快手 |
92 | — | 4K / 最长 2 分钟 / 多镜头一致 | 电影感多镜头性价比 | 最便宜的 premium,多镜头一致性强 |
| 3 | Sora 2 OpenAI |
90 | — | 1080p / 20s / 原生音频 | 电影感物理真实 | 物理仿真与提示词遵循强;Web/App 已于 2026-04 停运,API 至 2026-09 |
| 4 | Runway Gen-4.5 Runway |
88 | — | 图/文生视频 / Motion Brush | 创作控制导演工作流 | Video Arena 榜首,控制力最强 |
| 5 | 字节跳动 |
87 | — | 15s / 原生音频 | 电影级原生音频 | 电影级画质 + 原生音频同步 |
| 6 | 阿里巴巴 |
85 | — | 开源 / 720p-1080p | 开源自部署 | 开源可自部署,性价比无限 |
| 7 | Luma Ray 3.14 Luma AI |
82 | — | 订阅制 / 快速 | 速度独立友好 | 快速实验,独立创作者友好 |
| 8 | MiniMax |
80 | — | 长片实验 / 性价比 | 性价比长片 | 每美元产出高,长片实验友好 |
| 9 | Pika 2.2 Pika |
78 | — | 短视频 / 特效 | 社媒特效 | 短视频与特效快速迭代 |
| 10 | Midjourney Video V1 Midjourney |
75 | — | 订阅制 / 新晋 | 订阅新晋 | 新晋视频能力,艺术风格强 |
| 11 | SD 2.5(Stable Diffusion) Stability AI |
68 | — | 图像生成为主 / 可图生视频 | 图像开源 | 开源图像生成奠基者,社区衍生大量图生视频工作流 |
数据说明:综合 LMArena 文本/编程/视觉竞技场、Artificial Analysis 智能指数、OpenCompass 司南及厂商官方公布的基准,由编辑交叉整理。评分为相对指数,仅供选型参考,非实时拉取,实际以各官方榜单为准。