可本地免费部署开源模型能力清单-AIGC大模型社区-AI工具清单-四海清单

可本地免费部署开源模型能力清单

可本地免费部署开源模型能力分类总表

说明:​国内模型​=国内机构开源;​国外模型​=海外机构开源;全部开放权重、可本地离线部署;许可证大多支持免费商用,个别需看协议;能力分类:对话LLM / Agent工具调用 / 文本生成 / 图像生成/理解 / 音频(ASR/TTS/语音对话) / 视频理解/生成 / 多模态;链接优先GitHub / HuggingFace / ModelScope。

一、国内开源模型(可本地部署)

模型名称 能力分类 简介 开源链接 许可证
Qwen(通义千问)系列:Qwen2.5 / Qwen3 / Qwen3-VL / Qwen3-Audio 对话LLM、Agent、文本、图像理解、音频、多模态 阿里,全尺寸0.5B~72B,强工具调用,图文音多模态,中文极强,量化GGUF完善 [https://github.com/QwenLM/Qwen
https://huggingface.co/Qwen
Apache](https://github.com/QwenLM/Qwen
https://huggingface.co/Qwen
DeepSeek(深度求索)DeepSeek-V2/V3 / DeepSeek-R1 对话LLM、Agent、文本、代码 强推理、代码、工具调用,长上下文,适合本地Agent智能体 [https://github.com/deepseek-ai/DeepSeek-V3
https://huggingface.co/deepseek-ai
MIT
GLM-4-9B / GLM-4-V 对话LLM、Agent、文本、图像理解 智谱AI,长文本,RAG+Agent友好,中文强 [https://github.com/THUDM/GLM-4
https://huggingface.co/THUDM
MIT
MiniCPM系列(OpenBMB)MiniCPM-V / MiniCPM-o 4.5 对话LLM、Agent、图像理解、音频、全模态多模态 端侧轻量化,MiniCPM-o支持音视频+文本全双工实时对话,RTX5070可本地跑 [https://github.com/OpenBMB/MiniCPM-o
https://huggingface.co/openbmb
Apache](https://github.com/OpenBMB/MiniCPM-o
https://huggingface.co/openbmb
Wan2.2(万相) 图像理解、视频生成/视频理解 阿里Pai,文生视频、图生视频,5B/14B,ComfyUI适配 [https://github.com/Wan-Video/Wan2.2
https://huggingface.co/Wan-AI
Apache](https://github.com/Wan-Video/Wan2.2
https://huggingface.co/Wan-AI
MiniMax H3 图像、视频生成 国内视频生成开源模型,可本地量化部署 [https://huggingface.co/MiniMaxAI/MiniMax-H3 ](https://huggingface.co/MiniMaxAI/MiniMax-H3
MOSS-TTS-Nano 音频TTS 复旦MOSS,轻量语音合成,CPU可跑 [https://github.com/OpenMOSS/MOSS-TTS-Nano Apache](https://github.com/OpenMOSS/MOSS-TTS-Nano
SenseVoice(阿里) 音频ASR 语音识别,多语种,轻量本地离线转写 [https://github.com/FunAudioLLM/SenseVoice
https://huggingface.co/FunAudioLLM
Apache](https://github.com/FunAudioLLM/SenseVoice
https://huggingface.co/FunAudioLLM
CosyVoice 音频TTS 阿里语音合成,音色克隆,流式语音 [https://github.com/FunAudioLLM/CosyVoice
https://huggingface.co/FunAudioLLM
Apache](https://github.com/FunAudioLLM/CosyVoice
https://huggingface.co/FunAudioLLM

二、国外开源模型(可本地部署)

模型名称 能力分类 简介 开源链接 许可证
Llama3 / Llama3.1 / Llama4 对话LLM、Agent、文本、图像理解、多模态 Meta,生态最完善,Ollama/llama.cpp全支持,工具调用强 [https://huggingface.co/meta-llama Llama](https://huggingface.co/meta-llama
Muse Glimmer 30B 对话LLM、Agent、图像理解、多模态 Meta面向本地Agent的多模态模型,支持规划、工具调用,24G消费卡可量化运行 [https://huggingface.co/meta-models/Muse-Glimmer-30B Apache](https://huggingface.co/meta-models/Muse-Glimmer-30B
Mistral系列:Mistral-7B / Large 3 / Pixtral 对话LLM、Agent、文本、图像理解 MistralAI,欧洲开源,速度快,Pixtral图像理解,工具调用优秀 [https://github.com/mistralai/mistral-src
https://huggingface.co/mistralai
Apache](https://github.com/mistralai/mistral-src
https://huggingface.co/mistralai
Gemma4(Google) 对话LLM、Agent、文本、图像理解、多模态 Google DeepMind,2B~31B,多模态,256K上下文,Ollama原生支持 [https://huggingface.co/google/gemma-4 Apache](https://huggingface.co/google/gemma-4
Phi-4(微软) 对话LLM、Agent、文本、图像 微软小参数量化友好,推理强,轻量Agent场景 [https://huggingface.co/microsoft/phi-4 MIT
Nemotron 3 Nano Omni(NVIDIA) 对话LLM、Agent、图像、音频、视频、全多模态 英伟达统一多模态Agent模型,图文音视频一体 [https://huggingface.co/nvidia/Nemotron-3-Nano-Omni NVIDIA](https://huggingface.co/nvidia/Nemotron-3-Nano-Omni
Flux / Flux.1 [Black Forest Labs] 图像生成 当前本地文生图首选,ComfyUI生态成熟 [https://github.com/black-forest-labs/flux
https://huggingface.co/black-forest-labs
Apache](https://github.com/black-forest-labs/flux
https://huggingface.co/black-forest-labs
Stable Diffusion XL 图像生成 经典本地图像生成模型 [https://github.com/Stability-AI/generative-models
https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0
Apache](https://github.com/Stability-AI/generative-models
https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0
Whisper(OpenAI) 音频ASR 语音识别,多语种离线转写,本地部署标杆 [https://github.com/openai/whisper
https://huggingface.co/openai/whisper
MIT
Holo-3.1 Agent、图像理解 屏幕截图GUI自动化Agent,识别界面元素、输出点击坐标 [https://huggingface.co/ahmadwaqar/holo-3.1 Apache](https://huggingface.co/ahmadwaqar/holo-3.1

三、本地部署工具栈(配套开源框架,用于跑上面模型)

不属于模型本身,是本地推理/Agent运行框架,免费开源

  1. Ollama:一键本地跑LLM/VLM,内置API,支持Windows/Mac/Linux;https://github.com/ollama/ollama MIT
  2. llama.cpp:纯C/C++推理,CPU/GPU,GGUF量化;https://github.com/ggml-org/llama.cpp MIT
  3. vLLM:高吞吐GPU推理服务;https://github.com/vllm-project/vllm Apache 2.0
  4. SGLang:支持多模态、Agent工具调用高性能推理;https://github.com/sgl-project/sglang Apache 2.0
  5. ComfyUI:图像/视频生成可视化工作流;https://github.com/comfyanonymous/ComfyUI GPL3
  6. OpenClaw:本地LLM驱动Agent智能体框架;https://github.com/OpenClaw/OpenClaw MIT

四、能力快速归类索引(方便筛选)

纯对话LLM+Agent(文本+工具调用)国内:Qwen系列、DeepSeek系列、GLM4 国外:Llama3.1/4、Mistral Large3、Phi4、Gemma4

图像理解(VLM)国内:Qwen-VL、MiniCPM-V、GLM-4-V 国外:Llama4、Pixtral、Gemma4、Muse Glimmer

图像生成国内:无原生开源文生图大模型(可搭配SD/Flux) 国外:Flux1、SDXL

音频(ASR语音识别 / TTS语音合成)国内:SenseVoice、CosyVoice、MOSS-TTS-Nano、MiniCPM-o 国外:Whisper

视频生成/视频理解国内:Wan2.2、MiniMax H3 国外:Nemotron3 Nano Omni

全模态统一多模态(文本+图像+音频+视频,端到端)国内:MiniCPM-o 国外:Nemotron3 Nano Omni、Muse Glimmer

GUI桌面/网页自动化Agent国外:Holo-3.1

五、硬件选型提示

  • 轻量模型(1B~4B,MiniCPM、Phi4、Gemma4 2B):8G内存即可,无独立显卡可用CPU量化
  • 7B~14B模型(Qwen7B、Llama3 8B、Wan2.2 5B):推荐≥16G显存
  • 30B级多模态Agent(Muse Glimmer、Nemotron Nano Omni):≥24G显存

如果你想要,我可以:

  1. 导出Markdown纯表格版本,直接复制到Notion/语雀
  2. 精简成一页选型清单(只保留最推荐3-5个国内+国外)
  3. 增加一列:最低显存、推荐量化版本、Ollama拉取命令。
请登录后发表评论

    没有回复内容