提交工具
首页/大模型排行榜

大模型排行榜

数据更新于 2026-09-01 (每月滚动复核,非实时拉取)
厂商

参考价 = 公开定价(输入 / 输出,每 1M tokens),编辑整理、以官方为准;视频模型按生成计费未列入。

综合榜

评分口径:综合竞技场 Elo 综合对话、推理、写作与多模态体验的整体排名
🥇
#1
Claude Fable 5
Anthropic
1507
$15 / $75
🥈
#2
Claude Opus 4.7
Anthropic
1502
$15 / $75
🥉
#3
Kimi K3
月之暗面
1489
¥1 / ¥4
排名 模型 评分 参考价 上下文 特性 亮点
1
Claude Fable 5
Anthropic
1507 $15 / $75 1M 对话推理多模态 综合体验与长上下文领先
2
Claude Opus 4.7
Anthropic
1502 $15 / $75 1M 推理Agent Agent 与复杂推理标杆
3
月之暗面
1489 ¥1 / ¥4 200万 长文本推理 超长上下文,开源权重可选
4
Gemini 3.1 Pro
Google
1487 $1.25 / $10 1M 多模态长上下文 原生多模态与超长上下文
5
GPT-5.5
OpenAI
1482 $10 / $30 1.1M 通用编码 复杂推理与编码强劲
6
智谱 AI
1484 ¥1 / ¥5 1M 推理开源 国产推理强项,开源友好
7
阿里巴巴
1478 ¥3.6 / ¥12 1M 中文开源 中文理解顶级,生态完善
8
百度
1476 ¥0.8 / ¥3.2 256K 中文全模态 中文第一梯队,原生全模态
9
Grok 4.2
xAI
1480 $5 / $25 1M 实时多智能体 实时信息与多智能体协作
10
DeepSeek
1467 $0.55 / $2.19 128K 推理开源性价比 开源旗舰,价格仅闭源零头
11
腾讯
1450 ¥0.8 / ¥2 256K 中文多模态 中文与多模态均衡
12
MiniMax M2.7
MiniMax
1455 ¥1 / ¥4 1M 性价比长程 低成本长程任务高分

国产榜

评分口径:综合竞技场 Elo 中国厂商自研大模型排名(含开源与闭源)
🥇
#1
Kimi K3
月之暗面
1489
¥1 / ¥4
🥈
#2
GLM-5.3
智谱 AI
1484
¥1 / ¥5
🥉
#3
Qwen3-Max
阿里巴巴
1478
¥3.6 / ¥12
排名 模型 评分 参考价 上下文 特性 亮点
1
月之暗面
1489 ¥1 / ¥4 200万 长文本推理 超长上下文,逼近闭源旗舰
2
智谱 AI
1484 ¥1 / ¥5 1M 推理开源 HLE/GPQA 国产第一
3
阿里巴巴
1478 ¥3.6 / ¥12 1M 中文开源 中文理解顶级,生态完善
4
百度
1476 ¥0.8 / ¥3.2 256K 中文全模态 原生全模态统一建模
5
DeepSeek
1467 $0.55 / $2.19 128K 推理开源 开源性价比之王
6
MiniMax M2.7
MiniMax
1455 ¥1 / ¥4 1M 性价比长程 Lightning Attention 长程高分
7
腾讯
1450 ¥0.8 / ¥2 256K 多模态中文 多模态与中文均衡
8
字节跳动
1445 ¥0.8 / ¥2 256K 多模态端侧 多模态与端侧部署
9
阶跃星辰
1440 ¥1 / ¥4 128K 多模态推理 多模态与推理并进
10
昆仑万维
1435 ¥1 / ¥4 200K 搜索增强 搜索增强型对话
11
百川
1430 ¥1 / ¥4 128K 中文 中文场景稳健
12
科大讯飞
1425 ¥1 / ¥4 128K 中文语音 语音与中文场景见长

编码榜

评分口径:SWE-bench Verified 通过率 真实 GitHub 问题自主修复通过率,衡量工程编码能力
🥇
#1
Claude Opus 4.7
Anthropic
87.6
$15 / $75
🥈
#2
GPT-5.4 Codex
OpenAI
85
$20 / $80
🥉
#3
DeepSeek V4 Pro
DeepSeek
80.6
$0.55 / $2.19
排名 模型 评分 参考价 上下文 特性 亮点
1
Claude Opus 4.7
Anthropic
87.6 $15 / $75 1M Agent重构 跨文件理解与重构领先
2
GPT-5.4 Codex
OpenAI
85 $20 / $80 1.1M 自主修复 自主修复 PR 能力强
3
DeepSeek
80.6 $0.55 / $2.19 128K 开源低成本 开源中编码第一梯队
4
Gemini 3.1 Pro
Google
78.8 $1.25 / $10 1M 多语言 多语言工程均衡
5
智谱 AI
77.8 ¥1 / ¥5 1M 推理 推理赋能编码
6
月之暗面
78 ¥1 / ¥4 200万 长上下文 超长上下文利于大库理解
7
阿里巴巴
76.4 ¥3.6 / ¥12 1M 开源 开源编码生态完善
8
百度
72 ¥0.8 / ¥3.2 256K 中文 中文业务代码友好
9
腾讯
70 ¥0.8 / ¥2 256K 工程 工程实践适配
10
阿里巴巴
68 订阅制 IDE IDE 集成 IDE 内编码助手

多模态榜

评分口径:视觉/多模态竞技场 Elo 图像理解、视频与跨模态生成的综合能力排名
🥇
#1
Gemini 3.1 Pro
Google
1492
$1.25 / $10
🥈
#2
GPT-5.5
OpenAI
1470
$10 / $30
🥉
#3
Claude Opus 4.7
Anthropic
1458
$15 / $75
排名 模型 评分 参考价 上下文 特性 亮点
1
Gemini 3.1 Pro
Google
1492 $1.25 / $10 1M 图像视频 图像与视频理解领先
2
GPT-5.5
OpenAI
1470 $10 / $30 1.1M 图像语音 跨模态生成均衡
3
Claude Opus 4.7
Anthropic
1458 $15 / $75 1M 视觉理解 视觉理解稳健
4
百度
1440 ¥0.8 / ¥3.2 256K 全模态 原生全模态统一建模
5
腾讯
1430 ¥0.8 / ¥2 256K 多模态 多模态生成均衡
6
阿里巴巴
1420 ¥3.6 / ¥12 1M 视觉语言 视觉语言开源强
7
字节跳动
1415 ¥0.8 / ¥2 256K 图像视频 图像与视频生成
8
阶跃星辰
1405 ¥1 / ¥4 128K 视觉 视觉理解见长
9
Kimi
月之暗面
1395 ¥1 / ¥4 200万 文本为主 文本见长,多模态跟进
10
海螺
MiniMax
1390 ¥1 / ¥4 1M 语音视频 语音与视频生成

视频榜

评分口径:视频质量综合分(相对指数) 文生视频 / 图生视频模型的画质、时长与音频能力排名(参考 Video Arena、各厂商基准与第三方实测)。末尾另列以图像生成为主、可衔接图生视频工作流的参考模型(如 SD 2.5)。
🥇
#1
Veo 3.1
Google
95
🥈
#2
Kling 3.0(可灵)
快手
92
🥉
#3
Sora 2
OpenAI
90
排名 模型 评分 参考价 规格 特性 亮点
1
Veo 3.1
Google
95 4K / 8s / 原生音频同步 4K原生音频多镜头 4K + 原生音频,提示词遵循最佳
2
快手
92 4K / 最长 2 分钟 / 多镜头一致 电影感多镜头性价比 最便宜的 premium,多镜头一致性强
3
Sora 2
OpenAI
90 1080p / 20s / 原生音频 电影感物理真实 物理仿真与提示词遵循强;Web/App 已于 2026-04 停运,API 至 2026-09
4
Runway Gen-4.5
Runway
88 图/文生视频 / Motion Brush 创作控制导演工作流 Video Arena 榜首,控制力最强
5
字节跳动
87 15s / 原生音频 电影级原生音频 电影级画质 + 原生音频同步
6
阿里巴巴
85 开源 / 720p-1080p 开源自部署 开源可自部署,性价比无限
7
Luma Ray 3.14
Luma AI
82 订阅制 / 快速 速度独立友好 快速实验,独立创作者友好
8
MiniMax
80 长片实验 / 性价比 性价比长片 每美元产出高,长片实验友好
9
Pika 2.2
Pika
78 短视频 / 特效 社媒特效 短视频与特效快速迭代
10
Midjourney Video V1
Midjourney
75 订阅制 / 新晋 订阅新晋 新晋视频能力,艺术风格强
11
SD 2.5(Stable Diffusion)
Stability AI
68 图像生成为主 / 可图生视频 图像开源 开源图像生成奠基者,社区衍生大量图生视频工作流

数据说明:综合 LMArena 文本/编程/视觉竞技场、Artificial Analysis 智能指数、OpenCompass 司南及厂商官方公布的基准,由编辑交叉整理。评分为相对指数,仅供选型参考,非实时拉取,实际以各官方榜单为准。