本地开源模型选型清单-AIGC大模型社区-AI工具清单-四海清单

本地开源模型选型清单

 

本地开源模型选型清单(国内+国外|含最低显存、推荐量化、Ollama命令)

只保留最值得本地部署主力模型,免费开源、权重可离线下载;按场景分类。 量化说明:GGUF,Q4_K_M 平衡速度/显存/效果,本地首选;Q2_K 极致省显存,精度下降。

🇨🇳 国内开源模型

模型 能力 最低显存 推荐量化 Ollama拉取命令 许可证
Qwen2.5 7B / Qwen2.5-VL 7B 对话LLM、Agent工具调用、图文多模态 8GB Q4_K_M ollama run qwen2.5:7b
ollama run qwen2.5-vl:7b
Apache2.0
DeepSeek-V3 6.7B 强推理、代码、Agent规划 8GB Q4_K_M ollama run deepseek-v3:6.7b MIT
GLM-4-9B 长文本RAG、Agent、图文理解 10GB Q4_K_M ollama run glm4:9b MIT
MiniCPM-o 4.5B 文本+图像+音频全模态,实时语音对话 6GB Q4_K_M ollama run minicpm-o:4.5b Apache2.0
Wan2.2 5B 文生视频/图生视频 12GB FP16 Ollama无内置,ComfyUI部署 Apache2.0
SenseVoice 离线ASR语音转写 2GB INT8 独立推理,非LLM Apache2.0
CosyVoice TTS语音合成、音色克隆 2GB INT8 独立推理,非LLM Apache2.0

🇺🇳 国外开源模型

模型 能力 最低显存 推荐量化 Ollama拉取命令 许可证
Llama3.1 8B / Llama3.2-Vision 11B 对话、Agent、图像理解,生态最强 8GB / 10GB Q4_K_M ollama run llama3.1:8b
ollama run llama3.2-vision:11b
Llama社区许可
Mistral 7B / Pixtral 12B 高速推理、工具调用、图文 6GB / 10GB Q4_K_M ollama run mistral:7b
ollama run pixtral:12b
Apache2.0
Phi-4 14B 轻量强推理,小型Agent 8GB Q4_K_M ollama run phi4:14b MIT
Flux.1 [schnell/dev] 图像生成 12GB FP8 ComfyUI部署,无Ollama Apache2.0
Whisper-large-v3 离线ASR语音识别 6GB INT8 ollama run whisper MIT

✅ 快速选型推荐(按显卡)

  1. 显存 ≤ 6GB(笔记本/低端卡)​:MiniCPM-o 4.5B、Phi4-mini、Mistral-7B Q4_K_M
  2. 8GB显存(主流消费卡)​:Qwen2.5-7B、Llama3.1-8B、DeepSeek-V3 6.7B
  3. 10\~12GB显存​:Qwen2.5-VL、Pixtral、GLM4-9B、Flux、Wan2.2
  4. ≥16GB显存​:可上30B级别模型、更高精度多模态

🧰 配套框架(本地Agent/推理)

框架 用途 命令/链接
Ollama 一键LLM/VLM本地API [https://github.com/ollama/ollama
llama.cpp GGUF量化底层推理 [https://github.com/ggml-org/llama.cpp
vLLM 高吞吐GPU推理服务 [https://github.com/vllm-project/vllm
SGLang 多模态+Agent工具调用 [https://github.com/sgl-project/sglang
ComfyUI 图像/视频生成工作流 [https://github.com/comfyanonymous/ComfyUI
OpenClaw 本地LLM驱动Agent智能体 [https://github.com/OpenClaw/OpenClaw

 

请登录后发表评论

    没有回复内容