热门 AI 模型下载导航
35 个常用开源模型的 Hugging Face 仓库地址,含许可证与权限门槛(Llama、Gemma 要先申请,别等到要用时才发现下不动)。 下面还写了单文件直链怎么拼、命令行怎么拉、国内网络怎么办。
仓库地址、许可证与是否需要申请,均于 2026 年 8 月 逐个查询 Hugging Face 接口核对。 模型迭代很快,用之前建议点进去确认一眼。
三种拉法
1. 单文件直链
规律是 /<仓库>/resolve/<分支>/<文件名>, 知道之后不用每次进页面翻。比如:
https://huggingface.co/Qwen/Qwen3-8B/resolve/main/config.json
别用 blob:/blob/ 是网页预览地址,下下来是一个几十 KB 的 HTML 页面, 加载时报「格式错误」,很容易误以为是模型坏了。要下文件只认 /resolve/。
2. 官方命令行(推荐)
pip install -U "huggingface_hub[cli]" hf download Qwen/Qwen3-8B --local-dir ./Qwen3-8B # 只要其中几个文件(GGUF 仓库通常几十 GB,整仓拉是浪费) hf download unsloth/DeepSeek-R1-GGUF \ --include "*Q4_K_M*" --local-dir ./R1-gguf # 需要申请权限的模型(Llama / Gemma)先登录 hf auth login
它支持断点续传与并发分片,几十 GB 的权重比浏览器直接下靠谱得多 —— 中途断一次要重来的话,代价是几个小时。
3. git clone
# 必须先装 git-lfs,否则拉下来的权重全是几百字节的指针文件 git lfs install git clone https://huggingface.co/Qwen/Qwen3-8B # 只要仓库结构、暂时不下权重 GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/Qwen/Qwen3-8B
没装 git-lfs 是最常见的坑:clone 显示成功、文件名也对,但每个 .safetensors 只有几百字节 —— 那是 LFS 指针,不是权重。
国内网络连不上时
hf-mirror.com 的路径结构与官方完全一致,把主机名换掉即可;命令行则设一个环境变量:
export HF_ENDPOINT=https://hf-mirror.com hf download Qwen/Qwen3-8B --local-dir ./Qwen3-8B
另外魔搭 ModelScope上有国内团队自己上传的官方仓库(Qwen、GLM、DeepSeek 等都在), 走国内带宽最快,但仓库名与目录结构和 HF 不一定一一对应。
镜像站是第三方运营的,本站与其无关。介意来源的话,用官方地址或魔搭。
国产旗舰
权重开源、国内团队出品,中文能力通常明显好于同尺寸海外模型带长思维链的推理模型,数学与复杂逻辑题是强项。输出会先写一大段推理再给答案,问路径规划这类问题很划算,问「今天天气」就纯属浪费。
百度文心 4.5 的开源版本,MoE 架构、激活参数仅 3B,推理很省。Apache 2.0。
海外开源
Llama 与 Gemma 需要先在 HF 上申请,别等到要用时才发现下不动Mistral 的中等尺寸,Apache 2.0。单卡可部署,延迟表现好。
代码模型
补全与改写代码专用,比通用模型更懂上下文里的项目结构上一代但依然主流,社区量化版本齐全,接 Continue / Cline 这类插件资料最多。
DeepSeek 早期的代码模型。老了,但很多老教程与镜像还在用它,列在这里免得找不到。
多模态(看图)
能读图片的模型,做 OCR、截图理解、表格提取蒸馏与量化(消费级显卡)
把大模型的能力塞进能在自己电脑上跑的尺寸把 R1 的推理能力蒸馏到 Qwen-32B 上。量化后单张 24G 卡能跑,是本地跑推理模型最实际的选择。
R1 的 GGUF 量化合集,llama.cpp / Ollama / LM Studio 直接可用。仓库里有多档量化,按显存挑一个下就行,不用整仓拉。
bartowski 是社区里量化做得最勤的账号之一,几乎每个热门模型都有对应的 GGUF。这条当作入口,仓库名里换个模型名通常也存在。
向量与检索
做 RAG、语义搜索的底座,尺寸小、跑起来便宜语音识别
把音频转成文字同一个模型的 CTranslate2 转换版,配 faster-whisper 用,速度与显存都好几倍。要跑批量转写就用这个。
图像生成
文生图,注意这两条的许可证都不是自由商用当前开源文生图的第一梯队。许可证是**非商用**的,做产品前务必看清;商用要找 FLUX.1 的授权版本。下载前需在页面上勾选同意(即时放行)。
SDXL 基础模型,生态与 LoRA 最丰富。OpenRAIL++ 许可有使用限制条款,不是无条件商用。
几件值得先知道的事
- 开源权重 ≠ 随便商用。Apache 2.0 和 MIT 是真的没限制;Llama、Gemma 各有自己的条款; FLUX.1-dev 明确禁止商用。 上表标了许可证,但真要用请点进仓库读原文 —— 这里只是提示,不构成法律意见。
- 显存怎么估。粗算:FP16 约「参数量 × 2 GB」,INT4 量化约「参数量 ÷ 2 GB」, 再留 20% 给 KV 缓存和上下文。8B 模型 FP16 要 16G 以上、Q4 量化 6G 左右能跑。 要精确一点可以用本站的 LLM 权重文件大小计算器。
- MoE 的参数量会骗人。671B 的 MoE 每次只激活其中一部分,算力需求接近激活量, 但显存要按总量准备—— 权重得全部装下。看到「激活 37B」就以为 40G 卡能跑,是最常见的误判。
- 本地跑先用 GGUF。原始的 safetensors 是给 GPU 推理框架(vLLM / SGLang)用的; 个人电脑上跑,找对应的 GGUF 量化版配 Ollama 或 LM Studio,省事得多。
- 想看哪个模型效果更好,去 AI 评测榜单导航;想直接用现成产品而不是自己部署,看 国内 与 海外 AI 工具导航。