提交工具
首页/开源模型专区

开源模型专区

精选 67 个开源 / 开放权重 AI 模型,覆盖大语言模型、视觉语言模型、图像生成等 7 大类

大语言模型 (LLM)

16 个
Meta

2024 年的稠密旗舰,如今是兼容性最好的老基座:几乎所有推理框架、量化方案与微调脚本都优先支持它,稳定压倒一切时仍值得选。

参数 8B / 70B / 405B Llama 3.1 Community 2024
文本多语种生态成熟项目主页 ↗
阿里通义千问

中文能力领先的开源系列,覆盖端侧小模型到 72B,配套 Chat/Code/Math/VL 多版本。

参数 0.5B–72B Apache 2.0 2024
中文强端侧友好全系列项目主页 ↗
Google DeepMind

Google 基于 Gemini 同源研究开放的轻量系列,原生多模态且 128K 上下文,4B 量化后可跑在手机与单卡上。

参数 4B / 12B / 27B Gemma 术语 2025
端侧多模态轻量项目主页 ↗
智谱 AI(Z.ai)

智谱新一代开源旗舰,200K 上下文,编码与 Agent 能力对标一流闭源模型,MIT 协议对商用最友好。

参数 357B(MoE) MIT 2025
中文强AgentMIT项目主页 ↗
AllenAI

完全开放的科研模型,连同训练数据、代码与日志一并公开,便于研究与复现。

参数 7B / 32B Apache 2.0 2024
全开放可复现科研项目主页 ↗
Meta

Meta 第四代开源模型,原生多模态并首次大规模采用 MoE。Scout 主打千万级 token 超长上下文,Maverick 在推理与编码上更均衡。

参数 109B / 17B 激活;400B / 17B 激活 Llama 4 Community 2025
MoE多模态长上下文项目主页 ↗
阿里通义千问

通义千问 3.6 代,35B 模型只需 3B 激活即可推理,中文与工具调用能力强,Apache 2.0 可直接商用。

参数 35B / 3B 激活(MoE);27B 稠密 Apache 2.0 2026(待核实)
中文强MoEApache 2.0项目主页 ↗
阿里通义千问

面向 Agent 化编码的开源旗舰,长上下文与工具调用针对真实仓库优化,SWE-bench Verified 成绩位居开源前列。

参数 480B / 35B 激活 Apache 2.0 2025
代码Agent长上下文项目主页 ↗
月之暗面 Moonshot AI

万亿参数级开源 MoE,主打 Agent 与工具调用,多轮编码任务表现突出,是开源阵营里最接近闭源前沿的通用模型之一。

参数 1T / 32B 激活(MoE) Modified MIT 2025
Agent代码MoE项目主页 ↗
MiniMax(稀宇科技)

激活量仅 10B 的稀疏模型,推理成本极低,长文本与 Agent 场景表现稳定,自建服务压成本时的热门选择。

参数 230B / 10B 激活(MoE) Modified MIT 2025
低成本AgentMoE项目主页 ↗
OpenAI

OpenAI 自 GPT-2 后首次开放权重的推理模型,Apache 2.0 可商用;20b 版单张消费卡可跑,120b 版需 80GB 级显存。

参数 117B / 5.1B 激活;21B / 3.6B 激活 Apache 2.0 2025
推理Apache 2.0可商用项目主页 ↗
Mistral AI

Mistral 的最新开放权重旗舰,Apache 2.0 对商用最宽松,多语种与指令遵循稳定,是欧洲阵营的主力选择。

参数 141B / 39B 激活(MoE,待核实) Apache 2.0 2025
可商用多语种MoE项目主页 ↗

视觉语言模型 (VLM)

8 个
阿里通义千问

支持图像与视频理解、文档解析与 GUI 操作的开源多模态模型,中文场景表现突出。

参数 3B–72B Apache 2.0 2024
图文视频理解文档项目主页 ↗
UC Berkeley

视觉指令微调的开创性工作,把视觉编码器与大语言模型对齐,是众多 VLM 的基石。

参数 7B–34B Apache 2.0 2023
图文指令微调科研项目主页 ↗
面壁智能 OpenBMB

端侧多模态的代表作,8B 级别即可在手机与单卡上跑出接近顶级闭源 VLM 的效果,OCR 与文档理解尤其扎实。

参数 8B 级(多尺寸) Apache 2.0 2025
端侧OCR文档项目主页 ↗
上海 AI 实验室

InternVL 2.5 的后续版本,改用原生多模态预训练,在多模态推理与图表、文档理解上进一步拉开同尺寸模型的差距。

参数 1B–78B MIT 2025
图文高分辨率文档项目主页 ↗
月之暗面 Moonshot AI

小激活量的开源 MoE 多模态模型,长上下文与视频理解是亮点,适合搭建低成本的图文/视频理解服务。

参数 16B / 3B 激活(MoE) MIT 2025
MoE视频理解长上下文项目主页 ↗
智谱 AI(Z.ai)

智谱开放的多模态旗舰,覆盖图像、视频与 GUI 理解,中文场景与推理任务表现突出,MIT 协议商用友好。

参数 106B / 12B 激活(待核实) MIT 2025
中文强视频理解GUI项目主页 ↗

图像生成

9 个
Black Forest Labs

画质与提示词遵循度领先的开源扩散模型,dev 版用于研究,schnell 版可商用。

参数 12B FLUX.1-dev (非商用) 2024
画质高提示词遵循非商用项目主页 ↗
Black Forest Labs

当前开源画质天花板,排版文字、产品摄影与多参考图一致性最好;权重免费下载,但把权重跑在商业服务里需向 BFL 取得授权。

参数 32B(+24B 文本编码器) 非商用(商用需授权) 2025-11
画质高文字渲染非商用项目主页 ↗
Black Forest Labs

FLUX.2 的蒸馏小模型,四步出图、约 13GB 显存可跑,Apache 2.0 可商用,是低延迟商业出图场景的首选。

参数 4B / 9B Apache 2.0 2026-01
速度快可商用低显存项目主页 ↗
阿里通义千问

中英文图内文字渲染最强的开源模型,海报、招牌、信息图这类"图里要写字"的场景首选,Apache 2.0 可直接商用。

参数 20B Apache 2.0 2025-12
文字渲染中文强Apache 2.0项目主页 ↗
阿里通义 MAI

八步出图的蒸馏模型,16GB 显存即可全速运行,速度与画质平衡最好,Apache 2.0 适合批量生产。

参数 6B Apache 2.0 2025-11
速度快Apache 2.0批量项目主页 ↗
腾讯混元

参数量最大的开源图像模型,原生多模态自回归架构,会"先理解再画",复杂长提示词与知识类题材表现最好,需多卡环境。

参数 80B / 13B 激活(MoE) Tencent Community 2025
MoE提示词推理多卡项目主页 ↗
Stability AI

社区微调生态最庞大的老将,LoRA 与 ControlNet 资源远超任何新模型,6–8GB 显存可跑,做风格化与可控构图仍是性价比之王。

参数 3.5B OpenRAIL++ 2023
生态大LoRA低显存项目主页 ↗

视频生成

12 个
阿里通义万相

开源视频生成的当前标杆,文生视频与图生视频双 14B MoE 架构,运动幅度与画面质感领先,Apache 2.0 可商用,社区 LoRA 生态最大。

参数 T2V / I2V A14B(14B 激活) Apache 2.0 2025
文生视频图生视频Apache 2.0项目主页 ↗
腾讯混元

从 13B 精简到 8.3B 后显存门槛大幅下降(约 14GB + offload),配合超分可到 1080p,官方配套 LoRA 与二次开发链路,适合本地批量出片。

参数 8.3B Tencent Community 2025
可本地1080p可训练项目主页 ↗
清华 / 潞晨科技

最早开源的类 Sora 项目之一,2.0 起画质与时长明显提升;训练与推理流程完整公开,适合想搞懂视频模型是怎么训出来的团队。

参数 多规格(含 2.0) Apache 2.0 2024–2025
可复现科研Apache 2.0项目主页 ↗
阿里通义万相

Wan 2.2 的轻量版,文生视频与图生视频一体,GGUF 量化加 offload 最低 8GB 显存可跑,消费级显卡入门首选。

参数 5B Apache 2.0 2025
低显存文生视频图生视频项目主页 ↗
阿里通义万相

角色动画与角色替换专用版本:给一张人物图加一段驱动视频,即可生成表情、动作与场景一致的角色镜头,短剧里最常用。

参数 A14B Apache 2.0 2025
角色动画人物一致短剧项目主页 ↗
Lightricks

目前唯一原生带同步音频的开源视频模型,10 秒以上 4K 输出,Q3 量化后约 12GB 显存可跑,做短视频成片最省事。

参数 22B(DiT) LTX-2 Community(营收 < 1000 万美元免费) 2026
原生音频4K长时长项目主页 ↗
智谱 AI

提示词遵循度在开源视频模型里长期领先,5B 版显存需求友好,官方配套微调与 LoRA 脚本齐全。

参数 2B / 5B CogVideoX License 2024
提示词遵循可微调中文强项目主页 ↗
Genmo

公认最容易微调的开源视频基座,官方提供单卡可跑的 LoRA 训练脚本,做风格化与角色定制时上手最快。

参数 10B Apache 2.0 2024
易微调Apache 2.0LoRA项目主页 ↗
昆仑万维 Skywork

面向影视与短剧场景的开源视频模型,支持长时分镜续写与镜头控制,人物表演和场景连贯性针对剧情片做过优化。

参数 1.3B–14B Apache 2.0 2025
短剧镜头控制长视频项目主页 ↗
北大 / 快手

金字塔式分分辨率流匹配,10 秒 768p 视频在消费卡上几分钟出片,训练与推理全按 Apache 2.0 开放。

参数 约 2B(待核实) Apache 2.0 2025
低显存长时长Apache 2.0项目主页 ↗
guoyww / 社区

给静态 SD 模型加"运动模块"的开创性方案,能直接复用 SD 生态的全部 LoRA 与画风,做风格化动态短片成本最低。

参数 运动模块(配合 SD1.5 / SDXL) 视基座而定 2023
生态大风格化复用 LoRA项目主页 ↗
Stability AI

图生视频的经典基座,输入一张图生成短片段,大量二次开发与控制插件基于它构建,适合做镜头微动与素材延展。

参数 约 1.5B(待核实) Stability Community 2023
图生视频经典基座可控项目主页 ↗

数字人 / 口型同步

5 个
腾讯音乐 TME

实时高质量唇形同步,单张 256×256 人像即可驱动,推理速度快,是数字人播报与配音替换的常用方案。

参数 约 500M(待核实) 开源(以仓库 LICENSE 为准) 2024
口型同步实时数字人项目主页 ↗
快手 KwaiVGI

让静态人像照跟着驱动视频做表情与头部动作,可控性强、生成快,是"让照片说话"最流行的开源方案之一。

参数 约 1B(待核实) 非商用(商用需授权) 2024
人像驱动表情迁移非商用项目主页 ↗
蚂蚁集团 Ant Group

从"只做脸"扩展到半身与手势,音频驱动全身动作更自然,Apache 2.0 协议对商用友好。

参数 半身版(待核实) Apache 2.0 2025
半身驱动音频驱动Apache 2.0项目主页 ↗
OpenTalker 社区

最早流行的"单图 + 音频 → 说话视频"方案,资料与教程最多,适合快速验证与低成本批量出片。

参数 轻量(约 200M,待核实) 开源(待核实) 2023
说话人脸入门生态成熟项目主页 ↗
Rudrabha / 社区

唇形同步领域的经典基座,模型极小、CPU 也能跑,至今仍是大量数字人项目内置的对齐模块。

参数 极小(SyncNet + 生成器) 开源(非商用,待核实) 2020
口型同步轻量经典项目主页 ↗

语音 / 音频

12 个
OpenAI

开源语音识别标杆,多语种转写准确、可本地离线运行,是字幕与会议记录首选。

参数 tiny–large-v3 MIT 2022
语音识别多语种离线项目主页 ↗
Coqui(已停止维护)

曾经的多语种声音克隆首选,至今仍被大量项目依赖;但 Coqui 公司已于 2024 年关停、仓库停止维护,新项目建议改用 Chatterbox 或 CosyVoice 2。

参数 多语种 CPML 2023
声音克隆多语种停更项目主页 ↗
阿里通义(达摩院)

中文语音识别的工业级工具箱,含 Paraformer 非自回归模型与 VAD、标点、说话人分离,实时率高、适合长音频批量转写。

参数 Paraformer 系列(220M 起) Apache 2.0 2024
语音识别中文强工业级项目主页 ↗
阿里通义 FunAudioLLM

一个模型同时做多语种识别、语种判别、情感与声音事件检测,推理极快,适合字幕生成与情绪标注。

参数 Small(约 300M,待核实) Apache 2.0(待核实) 2024
语音识别情感识别多语种项目主页 ↗
hexgrad

只有 8200 万参数却能输出自然旁白级语音,CPU 上就能跑且远快于实时,Apache 2.0 可商用,是"离线念稿"成本最低的方案。

参数 82M Apache 2.0 2025
语音合成可商用CPU 可跑项目主页 ↗
Resemble AI

商用声音克隆的务实选择:约 5 秒参考音频即可克隆,自带情绪夸张度旋钮,MIT 协议允许商用。

参数 0.5B MIT 2025
声音克隆可商用情绪控制项目主页 ↗
阿里通义 FunAudioLLM

流式延迟低至 150ms,中文情感与方言(粤语、四川话等)可细粒度控制,比 1.0 发音错误减少 30–50%,适合实时配音。

参数 0.5B Apache 2.0 2025
流式中文强方言项目主页 ↗
B 站 IndexTeam

零样本克隆的同时能精确控制时长,音色与情感解耦可分别调节——对口型严丝合缝的影视与短剧配音场景最实用。

参数 待核实 Apache 2.0 2025
时长控制配音零样本项目主页 ↗
SWivid / 开源社区

英文自然度与韵律公认最好的开源零样本 TTS,十来秒样本即可复刻音色;注意协议为非商用。

参数 约 1B(待核实) CC-BY-NC 4.0 2024
零样本韵律自然非商用项目主页 ↗
Nari Labs

直接生成带笑声、停顿的多人对话音频,输入脚本即可出双人对谈,适合播客、短剧对白与有声书。

参数 1.6B Apache 2.0 2025
多人对话拟真Apache 2.0项目主页 ↗
MOSI.AI / OpenMOSS

2026 年新开源的语音合成家族,主打零样本克隆与多说话人对话生成,支持 31 种语言混合合成;商用前请先核对仓库 LICENSE。

参数 待核实 待核实 2026-06
零样本多说话人多语种项目主页 ↗

向量与检索(RAG)

5 个
智源 BAAI

中文检索的事实标准,一个模型同时支持稠密、稀疏与多向量三种检索方式,覆盖 100+ 语种、最长 8192 token。

参数 568M Apache 2.0 2024
检索多语种Apache 2.0项目主页 ↗
阿里通义千问

基于 Qwen3 基座的向量模型,多语种与长文本表现好,配套 Qwen3-Reranker,三种尺寸便于按成本取舍。

参数 0.6B / 4B / 8B Apache 2.0 2025
检索多尺寸Apache 2.0项目主页 ↗

没有匹配的模型,换个关键词试试。

数据说明:模型信息以各项目官方仓库 / 许可证为准;许可证条款可能随版本调整,商用前请核对最新 LICENSE。