提交工具

多模态榜

数据更新于 2026-09-01 (每月滚动复核,非实时拉取)
厂商

参考价 = 公开定价(输入 / 输出,每 1M tokens),编辑整理、以官方为准;视频模型按生成计费未列入。

评分口径:视觉/多模态竞技场 Elo 图像理解、视频与跨模态生成的综合能力排名
🥇
#1
Gemini 3.1 Pro
Google
1492
$1.25 / $10
🥈
#2
GPT-5.5
OpenAI
1470
$10 / $30
🥉
#3
Claude Opus 4.7
Anthropic
1458
$15 / $75
排名 模型 评分 参考价 上下文 特性 亮点
1
Gemini 3.1 Pro
Google
1492 $1.25 / $10 1M 图像视频 图像与视频理解领先
2
GPT-5.5
OpenAI
1470 $10 / $30 1.1M 图像语音 跨模态生成均衡
3
Claude Opus 4.7
Anthropic
1458 $15 / $75 1M 视觉理解 视觉理解稳健
4
百度
1440 ¥0.8 / ¥3.2 256K 全模态 原生全模态统一建模
5
腾讯
1430 ¥0.8 / ¥2 256K 多模态 多模态生成均衡
6
阿里巴巴
1420 ¥3.6 / ¥12 1M 视觉语言 视觉语言开源强
7
字节跳动
1415 ¥0.8 / ¥2 256K 图像视频 图像与视频生成
8
阶跃星辰
1405 ¥1 / ¥4 128K 视觉 视觉理解见长
9
Kimi
月之暗面
1395 ¥1 / ¥4 200万 文本为主 文本见长,多模态跟进
10
海螺
MiniMax
1390 ¥1 / ¥4 1M 语音视频 语音与视频生成

数据说明:综合 LMArena 文本/编程/视觉竞技场、Artificial Analysis 智能指数、OpenCompass 司南及厂商官方公布的基准,由编辑交叉整理。评分为相对指数,仅供选型参考,非实时拉取,实际以各官方榜单为准。