2024 年的稠密旗舰,如今是兼容性最好的老基座:几乎所有推理框架、量化方案与微调脚本都优先支持它,稳定压倒一切时仍值得选。
开源模型专区
大语言模型 (LLM)
16 个中文能力领先的开源系列,覆盖端侧小模型到 72B,配套 Chat/Code/Math/VL 多版本。
极致性价比的 MoE 模型,R1 以强化学习激发推理能力,多项推理基准比肩顶级闭源模型。
以小而精著称的欧洲开源模型,Mixtral 用 8×7B 稀疏专家在远低于稠密模型的算力下取得高性能。
Google 基于 Gemini 同源研究开放的轻量系列,原生多模态且 128K 上下文,4B 量化后可跑在手机与单卡上。
用大量「教科书级」合成数据训练的小模型,参数少却能在常识与推理上越级打大模型。
智谱新一代开源旗舰,200K 上下文,编码与 Agent 能力对标一流闭源模型,MIT 协议对商用最友好。
完全开放的科研模型,连同训练数据、代码与日志一并公开,便于研究与复现。
Meta 第四代开源模型,原生多模态并首次大规模采用 MoE。Scout 主打千万级 token 超长上下文,Maverick 在推理与编码上更均衡。
通义千问 3.6 代,35B 模型只需 3B 激活即可推理,中文与工具调用能力强,Apache 2.0 可直接商用。
面向 Agent 化编码的开源旗舰,长上下文与工具调用针对真实仓库优化,SWE-bench Verified 成绩位居开源前列。
V4 代延续极致性价比:Pro 版支持百万级上下文,Flash 版用小激活量覆盖日常推理;MIT 协议是商用最省心的一类。
万亿参数级开源 MoE,主打 Agent 与工具调用,多轮编码任务表现突出,是开源阵营里最接近闭源前沿的通用模型之一。
激活量仅 10B 的稀疏模型,推理成本极低,长文本与 Agent 场景表现稳定,自建服务压成本时的热门选择。
OpenAI 自 GPT-2 后首次开放权重的推理模型,Apache 2.0 可商用;20b 版单张消费卡可跑,120b 版需 80GB 级显存。
Mistral 的最新开放权重旗舰,Apache 2.0 对商用最宽松,多语种与指令遵循稳定,是欧洲阵营的主力选择。
视觉语言模型 (VLM)
8 个支持图像与视频理解、文档解析与 GUI 操作的开源多模态模型,中文场景表现突出。
开源多模态标杆,对齐主流闭源 VLM 能力,支持超高分辨率与多图推理。
视觉指令微调的开创性工作,把视觉编码器与大语言模型对齐,是众多 VLM 的基石。
早期展示「看图对话」能力的轻量多模态模型,适合学习与二次开发。
端侧多模态的代表作,8B 级别即可在手机与单卡上跑出接近顶级闭源 VLM 的效果,OCR 与文档理解尤其扎实。
InternVL 2.5 的后续版本,改用原生多模态预训练,在多模态推理与图表、文档理解上进一步拉开同尺寸模型的差距。
小激活量的开源 MoE 多模态模型,长上下文与视频理解是亮点,适合搭建低成本的图文/视频理解服务。
智谱开放的多模态旗舰,覆盖图像、视频与 GUI 理解,中文场景与推理任务表现突出,MIT 协议商用友好。
图像生成
9 个扩散模型的事实标准,生态庞大、插件与上手资料最多,适合本地部署与定制。
画质与提示词遵循度领先的开源扩散模型,dev 版用于研究,schnell 版可商用。
中文提示词理解优秀的中英双语文生图模型,对中文生图场景特别友好。
当前开源画质天花板,排版文字、产品摄影与多参考图一致性最好;权重免费下载,但把权重跑在商业服务里需向 BFL 取得授权。
FLUX.2 的蒸馏小模型,四步出图、约 13GB 显存可跑,Apache 2.0 可商用,是低延迟商业出图场景的首选。
中英文图内文字渲染最强的开源模型,海报、招牌、信息图这类"图里要写字"的场景首选,Apache 2.0 可直接商用。
八步出图的蒸馏模型,16GB 显存即可全速运行,速度与画质平衡最好,Apache 2.0 适合批量生产。
参数量最大的开源图像模型,原生多模态自回归架构,会"先理解再画",复杂长提示词与知识类题材表现最好,需多卡环境。
社区微调生态最庞大的老将,LoRA 与 ControlNet 资源远超任何新模型,6–8GB 显存可跑,做风格化与可控构图仍是性价比之王。
视频生成
12 个开源视频生成的当前标杆,文生视频与图生视频双 14B MoE 架构,运动幅度与画面质感领先,Apache 2.0 可商用,社区 LoRA 生态最大。
从 13B 精简到 8.3B 后显存门槛大幅下降(约 14GB + offload),配合超分可到 1080p,官方配套 LoRA 与二次开发链路,适合本地批量出片。
最早开源的类 Sora 项目之一,2.0 起画质与时长明显提升;训练与推理流程完整公开,适合想搞懂视频模型是怎么训出来的团队。
Wan 2.2 的轻量版,文生视频与图生视频一体,GGUF 量化加 offload 最低 8GB 显存可跑,消费级显卡入门首选。
角色动画与角色替换专用版本:给一张人物图加一段驱动视频,即可生成表情、动作与场景一致的角色镜头,短剧里最常用。
目前唯一原生带同步音频的开源视频模型,10 秒以上 4K 输出,Q3 量化后约 12GB 显存可跑,做短视频成片最省事。
提示词遵循度在开源视频模型里长期领先,5B 版显存需求友好,官方配套微调与 LoRA 脚本齐全。
公认最容易微调的开源视频基座,官方提供单卡可跑的 LoRA 训练脚本,做风格化与角色定制时上手最快。
面向影视与短剧场景的开源视频模型,支持长时分镜续写与镜头控制,人物表演和场景连贯性针对剧情片做过优化。
金字塔式分分辨率流匹配,10 秒 768p 视频在消费卡上几分钟出片,训练与推理全按 Apache 2.0 开放。
给静态 SD 模型加"运动模块"的开创性方案,能直接复用 SD 生态的全部 LoRA 与画风,做风格化动态短片成本最低。
图生视频的经典基座,输入一张图生成短片段,大量二次开发与控制插件基于它构建,适合做镜头微动与素材延展。
数字人 / 口型同步
5 个实时高质量唇形同步,单张 256×256 人像即可驱动,推理速度快,是数字人播报与配音替换的常用方案。
让静态人像照跟着驱动视频做表情与头部动作,可控性强、生成快,是"让照片说话"最流行的开源方案之一。
从"只做脸"扩展到半身与手势,音频驱动全身动作更自然,Apache 2.0 协议对商用友好。
最早流行的"单图 + 音频 → 说话视频"方案,资料与教程最多,适合快速验证与低成本批量出片。
唇形同步领域的经典基座,模型极小、CPU 也能跑,至今仍是大量数字人项目内置的对齐模块。
语音 / 音频
12 个开源语音识别标杆,多语种转写准确、可本地离线运行,是字幕与会议记录首选。
面向对话场景的中文语音合成,自然度与韵律表现突出,适合配音与有声内容。
曾经的多语种声音克隆首选,至今仍被大量项目依赖;但 Coqui 公司已于 2024 年关停、仓库停止维护,新项目建议改用 Chatterbox 或 CosyVoice 2。
中文语音识别的工业级工具箱,含 Paraformer 非自回归模型与 VAD、标点、说话人分离,实时率高、适合长音频批量转写。
一个模型同时做多语种识别、语种判别、情感与声音事件检测,推理极快,适合字幕生成与情绪标注。
只有 8200 万参数却能输出自然旁白级语音,CPU 上就能跑且远快于实时,Apache 2.0 可商用,是"离线念稿"成本最低的方案。
商用声音克隆的务实选择:约 5 秒参考音频即可克隆,自带情绪夸张度旋钮,MIT 协议允许商用。
流式延迟低至 150ms,中文情感与方言(粤语、四川话等)可细粒度控制,比 1.0 发音错误减少 30–50%,适合实时配音。
零样本克隆的同时能精确控制时长,音色与情感解耦可分别调节——对口型严丝合缝的影视与短剧配音场景最实用。
英文自然度与韵律公认最好的开源零样本 TTS,十来秒样本即可复刻音色;注意协议为非商用。
直接生成带笑声、停顿的多人对话音频,输入脚本即可出双人对谈,适合播客、短剧对白与有声书。
2026 年新开源的语音合成家族,主打零样本克隆与多说话人对话生成,支持 31 种语言混合合成;商用前请先核对仓库 LICENSE。
向量与检索(RAG)
5 个中文检索的事实标准,一个模型同时支持稠密、稀疏与多向量三种检索方式,覆盖 100+ 语种、最长 8192 token。
与 BGE-M3 配套的精排模型,先粗召回再重排,能把 RAG 的最终准确率拉上一大截。
基于 Qwen3 基座的向量模型,多语种与长文本表现好,配套 Qwen3-Reranker,三种尺寸便于按成本取舍。
通用文本向量系列,中英文检索榜单常客,长上下文版本可以直接对整篇文档编码。
面向端侧的轻量向量模型,300M 参数可在手机或 CPU 上做本地检索,支持按需截断维度。
没有匹配的模型,换个关键词试试。
数据说明:模型信息以各项目官方仓库 / 许可证为准;许可证条款可能随版本调整,商用前请核对最新 LICENSE。