热门 AI 模型下载导航

35 个常用开源模型的 Hugging Face 仓库地址,含许可证与权限门槛(Llama、Gemma 要先申请,别等到要用时才发现下不动)。 下面还写了单文件直链怎么拼、命令行怎么拉、国内网络怎么办。

仓库地址、许可证与是否需要申请,均于 2026 年 8 月 逐个查询 Hugging Face 接口核对。 模型迭代很快,用之前建议点进去确认一眼。

三种拉法

1. 单文件直链

规律是 /<仓库>/resolve/<分支>/<文件名>, 知道之后不用每次进页面翻。比如:

https://huggingface.co/Qwen/Qwen3-8B/resolve/main/config.json

别用 blob/blob/ 是网页预览地址,下下来是一个几十 KB 的 HTML 页面, 加载时报「格式错误」,很容易误以为是模型坏了。要下文件只认 /resolve/

2. 官方命令行(推荐)

pip install -U "huggingface_hub[cli]"
hf download Qwen/Qwen3-8B --local-dir ./Qwen3-8B

# 只要其中几个文件(GGUF 仓库通常几十 GB,整仓拉是浪费)
hf download unsloth/DeepSeek-R1-GGUF \
  --include "*Q4_K_M*" --local-dir ./R1-gguf

# 需要申请权限的模型(Llama / Gemma)先登录
hf auth login

它支持断点续传与并发分片,几十 GB 的权重比浏览器直接下靠谱得多 —— 中途断一次要重来的话,代价是几个小时。

3. git clone

# 必须先装 git-lfs,否则拉下来的权重全是几百字节的指针文件
git lfs install
git clone https://huggingface.co/Qwen/Qwen3-8B

# 只要仓库结构、暂时不下权重
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/Qwen/Qwen3-8B

没装 git-lfs 是最常见的坑:clone 显示成功、文件名也对,但每个 .safetensors 只有几百字节 —— 那是 LFS 指针,不是权重。

国内网络连不上时

hf-mirror.com 的路径结构与官方完全一致,把主机名换掉即可;命令行则设一个环境变量:

export HF_ENDPOINT=https://hf-mirror.com
hf download Qwen/Qwen3-8B --local-dir ./Qwen3-8B

另外魔搭 ModelScope上有国内团队自己上传的官方仓库(Qwen、GLM、DeepSeek 等都在), 走国内带宽最快,但仓库名与目录结构和 HF 不一定一一对应。

镜像站是第三方运营的,本站与其无关。介意来源的话,用官方地址或魔搭。

国产旗舰

权重开源、国内团队出品,中文能力通常明显好于同尺寸海外模型

DeepSeek 的通用旗舰,MoE 架构。日常问答、写作、代码都能打,MIT 许可商用无门槛。

直接下载mit文件列表 →镜像

带长思维链的推理模型,数学与复杂逻辑题是强项。输出会先写一大段推理再给答案,问路径规划这类问题很划算,问「今天天气」就纯属浪费。

直接下载mit文件列表 →镜像

通义千问第三代的小尺寸版。单张 16G 显卡能跑,是本地部署最稳妥的起点。

直接下载apache-2.0文件列表 →镜像

质量与显存的折中点。量化后单张 24G 卡可跑,日常任务已经接近旗舰体验。

直接下载apache-2.0文件列表 →镜像

Qwen3 的 MoE 旗舰,激活参数 22B。需要多卡或专业推理服务器。

直接下载apache-2.0文件列表 →镜像

智谱 GLM 系列新版,MIT 许可。中文写作与工具调用是它一直以来的长处。

直接下载mit文件列表 →镜像

GLM-4.5 的轻量版,为单机部署做过取舍,显存吃紧时优先看它。

直接下载mit文件列表 →镜像

月之暗面 Kimi K2 的指令版,Agent 与代码任务上口碑不错。许可证是自定义的,商用前先读条款。

直接下载other文件列表 →镜像

MiniMax 的开源权重模型。自定义许可,商用前读条款。

直接下载other文件列表 →镜像

百度文心 4.5 的开源版本,MoE 架构、激活参数仅 3B,推理很省。Apache 2.0。

直接下载apache-2.0文件列表 →镜像

海外开源

Llama 与 Gemma 需要先在 HF 上申请,别等到要用时才发现下不动

生态最广的一档,几乎所有微调教程与工具链都默认支持它。

需申请审核llama3.1文件列表 →镜像

Llama 3.x 的大号版本,效果接近上一代 405B 但便宜得多。

需申请审核llama3.3文件列表 →镜像

端侧尺寸,手机与边缘设备上跑得动,适合做本地摘要 / 分类这类窄任务。

需申请审核llama3.2文件列表 →镜像

谷歌 Gemma 3 的小尺寸多模态版,能读图。轻量部署里少见的原生视觉能力。

需申请审核gemma文件列表 →镜像

Gemma 3 的主力尺寸,同样支持图像输入。

需申请审核gemma文件列表 →镜像

老牌 7B,Apache 2.0 无任何使用限制。资源紧张且要商用时的稳妥选择。

直接下载apache-2.0文件列表 →镜像

Mistral 的中等尺寸,Apache 2.0。单卡可部署,延迟表现好。

直接下载apache-2.0文件列表 →镜像

OpenAI 放出的开源权重模型,Apache 2.0。20B 这一档单卡可跑。

直接下载apache-2.0文件列表 →镜像

同系列的大号版本,需要较大显存或多卡。

直接下载apache-2.0文件列表 →镜像

代码模型

补全与改写代码专用,比通用模型更懂上下文里的项目结构

Qwen3 代码版,MoE 架构激活 3B,本地补全时延迟很低。

直接下载apache-2.0文件列表 →镜像

上一代但依然主流,社区量化版本齐全,接 Continue / Cline 这类插件资料最多。

直接下载apache-2.0文件列表 →镜像

DeepSeek 早期的代码模型。老了,但很多老教程与镜像还在用它,列在这里免得找不到。

直接下载other文件列表 →镜像

多模态(看图)

能读图片的模型,做 OCR、截图理解、表格提取

Qwen3 视觉版,中文场景的 OCR 与图表理解是强项。

直接下载apache-2.0文件列表 →镜像

上一代视觉模型,生态成熟、部署资料多,跑不通新版时可以回落到它。

直接下载apache-2.0文件列表 →镜像

蒸馏与量化(消费级显卡)

把大模型的能力塞进能在自己电脑上跑的尺寸

把 R1 的推理能力蒸馏到 Qwen-32B 上。量化后单张 24G 卡能跑,是本地跑推理模型最实际的选择。

直接下载mit文件列表 →镜像

同系列的 8B 版,16G 显存足够。效果比 32B 差一截,但门槛低很多。

直接下载mit文件列表 →镜像

R1 的 GGUF 量化合集,llama.cpp / Ollama / LM Studio 直接可用。仓库里有多档量化,按显存挑一个下就行,不用整仓拉。

直接下载mit文件列表 →镜像

bartowski 是社区里量化做得最勤的账号之一,几乎每个热门模型都有对应的 GGUF。这条当作入口,仓库名里换个模型名通常也存在。

直接下载apache-2.0文件列表 →镜像

向量与检索

做 RAG、语义搜索的底座,尺寸小、跑起来便宜

智源 BGE 的多语言版,同时支持稠密 / 稀疏 / 多向量检索。做中文 RAG 的默认选择。

直接下载mit文件列表 →镜像

纯中文向量模型,比 m3 小、比 m3 快,只做中文时够用。

直接下载mit文件列表 →镜像

语音识别

把音频转成文字

Whisper 的官方权重,多语种通用基准。中文可用但不算最强。

直接下载apache-2.0文件列表 →镜像

同一个模型的 CTranslate2 转换版,配 faster-whisper 用,速度与显存都好几倍。要跑批量转写就用这个。

直接下载mit文件列表 →镜像

阿里 FunAudio 出品,中文识别很快很准,还带情感与音频事件标注。自定义许可,商用前读条款。

直接下载other文件列表 →镜像

图像生成

文生图,注意这两条的许可证都不是自由商用

当前开源文生图的第一梯队。许可证是**非商用**的,做产品前务必看清;商用要找 FLUX.1 的授权版本。下载前需在页面上勾选同意(即时放行)。

勾选同意即可other文件列表 →镜像

SDXL 基础模型,生态与 LoRA 最丰富。OpenRAIL++ 许可有使用限制条款,不是无条件商用。

直接下载openrail++文件列表 →镜像

几件值得先知道的事

  • 开源权重 ≠ 随便商用。Apache 2.0 和 MIT 是真的没限制;Llama、Gemma 各有自己的条款; FLUX.1-dev 明确禁止商用。 上表标了许可证,但真要用请点进仓库读原文 —— 这里只是提示,不构成法律意见。
  • 显存怎么估。粗算:FP16 约「参数量 × 2 GB」,INT4 量化约「参数量 ÷ 2 GB」, 再留 20% 给 KV 缓存和上下文。8B 模型 FP16 要 16G 以上、Q4 量化 6G 左右能跑。 要精确一点可以用本站的 LLM 权重文件大小计算器
  • MoE 的参数量会骗人。671B 的 MoE 每次只激活其中一部分,算力需求接近激活量, 但显存要按总量准备—— 权重得全部装下。看到「激活 37B」就以为 40G 卡能跑,是最常见的误判。
  • 本地跑先用 GGUF。原始的 safetensors 是给 GPU 推理框架(vLLM / SGLang)用的; 个人电脑上跑,找对应的 GGUF 量化版配 Ollama 或 LM Studio,省事得多。
  • 想看哪个模型效果更好,去 AI 评测榜单导航;想直接用现成产品而不是自己部署,看 国内 海外 AI 工具导航