模型

本地部署知识库

部署教程 · 模型评测 · 场景方案 —— 一边学一边积累

部署教程

模型评测

Claude Fable 5 评测:能力天花板,但闭源+贵+政策风险 不推荐
✓ 软件工程能力公开模型最强:SWE-bench Verified 95.0%(领先 Opus 4.8 88.6%、GPT-5.5 88.7%),SWE-bench Pro 80.3%(官方技术报告)、1M token 上下文 + 128K 单次输出,长时程 agentic 与代码库级任务(Anthropic Platform 文档)、多模态输入(文本/图像/文件)+ 视觉推理(官方 System Card)
✗ 闭源专有,权重未公开,**根本无法本地部署**(搜索未找到开源权重/HF 下载)、API 定价 $10/$50 每百万 token,是 Opus 4.8 的 2 倍、Sonnet 5 的 5 倍,性价比极低(Anthropic 定价页)
Claude Opus 4.8 评测:能力第一梯队,但闭源不可本地部署 不推荐
✓ 编程 / Agent 顶尖:SWE-bench Pro 69.2%(领先 GPT-5.5 / Gemini 3.1 Pro)、FrontierSWE 83% 登顶、知识工作 GDPval-AA 1890 Elo(官方 / EdenAI)、诚实性显著提升:主动报告代码缺陷概率比 4.7 高 4 倍,更愿说"我不确定"(官方技术报告)、1M 上下文 + 多模态输入(文本 / 图像 / 音频 / 视频)
✗ 闭源专有,权重不公开,**根本无法本地部署**,只能通过 Anthropic API / Claude Code / AWS Bedrock / Vertex AI 调用(llm-stats / explainx.ai 标注 closed source)、API 贵:输入 $5 / 输出 $25 每百万 token,新 tokenizer 使同文本 token 数涨 30-35%,实际成本更高
DeepSeek-V4-Flash 评测:开源性价比王,但本地仍需 142GB 谨慎
✓ Apache-2.0 开源,可商用可量化可微调(官方技术报告 / 模型卡)、1M token 上下文,长文档处理强(官方技术报告)、API 定价全球最低档:输入 $0.14/M、输出 $0.28/M,比 GPT-5.5 Pro 便宜 100 倍以上(DeepSeek 定价页 / BenchLM)
✗ 本地门槛极高:284B 总参即使 INT4 量化也需约 142GB 显存,单卡消费级 GPU 无法运行(社区部署指南)、官方 benchmark 均为自报,独立第三方大规模复现尚不充分(Macaron.im 评测汇总)
GLM-5 评测:开源编程 Agent 前代王者,744B 门槛高 + 数学弱 谨慎
✓ MIT 开源权重可下载可商用,HuggingFace 托管(zai-org/GLM-5.2)、编程/Agent 开源 SOTA:SWE-bench Verified 77.8%(2026-02 发布时开源第一,逼近 Claude Opus 4.5 80.9%)、Terminal-Bench 2.0 56.2%、τ²-Bench 89.7%(官方技术报告 arXiv:2602.15763)、LMArena Chatbot Arena Elo 1451 开源第一;代码生成 EvalPlus 87.0%、中文 C-Eval 88.8% 突出
✗ 744B 总参(40B 激活),FP8 权重 744GB + 1M 上下文 KV Cache 约 103GB ≈ 847GB,需 8×B200 或 8×H100 集群(腾讯云拆解)、数学推理明显弱:GSM8K 68.8%(低于 Kimi-K2 92.1、DeepSeek-V3 87.6)、MATH 56.4%(官方技术报告 Table 11)
GLM-5.2 评测:开源代码 SOTA,但本地门槛顶级 谨慎
✓ MIT 协议全量开源,可商用可改可本地部署,HuggingFace 已托管完整权重(zai-org/GLM-5.2)、代码能力开源 SOTA:SWE-bench Pro 62.1%、Terminal-Bench 2.0 81%、FrontierSWE 74.4%(仅次 Claude Opus 4.8 约 1%),Artificial Analysis Index v4.1 51 分开源第一(官方/BenchLM/aireiter.com)、原生 1M 上下文,IndexShare 稀疏注意力使 1M FLOPs 降 2.9x,实测处理 74 万条服务器日志根因分析(官方/百度百科)
✗ 本地门槛极高:753B 总参/40B 激活,BF16 约 1.5TB、FP8 约 750GB,最低需 8×H200 或 256GB 统一内存 Mac Studio(社区部署指南)、消费级硬件几乎无法运行可用版本,NVFP4 量化后具体显存公开资料未明确
GPT-5.5 评测:Agent 能力顶尖,但闭源不可本地 不推荐
✓ Agent / 终端任务顶尖:Terminal-Bench 2.0 82.7%(领先 Claude Opus 4.7 约 10 个百分点)、OSWorld-Verified 78.7%、LMSYS Agent Arena 第一(官方 / LMSYS)、代码强:SWE-Bench Verified 88.7%、HumanEval 约 93.1%、1M 上下文,Graphwalks 1M f1 达 45.4%(前代 9.4%),长上下文迈入生产可用(第三方评测)
✗ 闭源不可本地:权重未开放,仅 OpenAI API / ChatGPT 订阅,无任何官方本地部署路径(官方 / 多源)、API 贵:标准 $5 / $30 每百万 token(Pro $30 / $180),约为开源竞品 DeepSeek V4 的 10-20 倍
Liquid-LFM-1.2B 评测:1.2B 端侧王,<1GB 内存 推荐
✓ 1.2B 却在多项 benchmark 超 Qwen3-1.7B / Llama-3.2-1B:MMLU-Pro 44.35、GPQA 38.89、IFEval 86.23(Ollama 官方)、极致内存效率:4-bit 量化 <1GB(AMD Ryzen AI Max+ 395 上 Q4_0 仅 853MB)、推理极快:AMD CPU decode 239 tok/s、移动 NPU 82 tok/s,全框架支持(llama.cpp/MLX/vLLM/ONNX)
✗ 官方明确不推荐知识密集型任务和编程、License 有 $10M 年营收门槛(非纯 Apache-2.0),大企业需购商业授权
Llama-3.1-8B 评测:本地入门经典,但许可/知识/对话有短板 谨慎
✓ 开源可本地部署,128K 长上下文支持长文档处理(官方)、工具调用强:BFCL 76.1%、API-Bank 82.6%,适合 Agent 场景(ModelScope / Granite4-1 评测)、本地门槛低:Q4 量化仅约 5GB VRAM,8GB 显卡可流畅跑;CPU i7 级约 7 tok/s(LLMConfigurator / RunAIatHome)
✗ 许可是 llama-3.1-community license(非 Apache-2.0),月活超 7 亿有商用限制、知识截止 2023 年 12 月,已滞后一年半
Kimi-K2.6 评测:开源 Agent 强,但 1T 参数本地门槛极高 谨慎
✓ modified MIT 开源,允许商用(需满足特定条件)、编程 / Agent 开源领先:SWE-bench Pro 58.6% 超越 GPT-5.4 / Claude Opus 4.6,Artificial Analysis 智能指数开源榜首(官方 / DeepLearning.AI)、256K 上下文 + 原生多模态(MoonViT 400M 视觉编码器)
✗ 1T 总参 MoE,本地门槛极高:完整精度需 610GB+,8×H200 / B200 集群;Dynamic 2-bit 量化仍需 350GB+(社区部署指南)、纯推理 / 数学落后闭源:HLE-Full 34.7(低于 Gemini 3.1 Pro 44.4)、AIME 2026 96.4(低于 GPT-5.4 99.2)
DeepSeek-V4-Pro 评测:开源编程王,本地部署门槛极高 谨慎
✓ MIT 协议开源,权重可下载,商用无限制(HuggingFace 官方仓库)、编程能力开源顶尖:SWE-bench Verified 80.6%、Codeforces 3206、Agent 评分 GDPval-AA 1554 居开源第一(官方技术报告 / Artificial Analysis)、1M 原生上下文,CSA+HCA 混合注意力使长文本推理 FLOPs 仅前代 V3.2 的 27%、KV Cache 仅 10%(官方技术报告)
✗ 本地门槛极高:权重约 865GB(FP4+FP8 混合精度),FP8 需约 2.4TB VRAM(16× H100),INT4 量化仍需约 700GB(8× H100),消费级显卡完全不可行(社区部署指南 / Artificial Analysis)、幻觉率高:AA-Omniscience 测得 94%,模型不确定时几乎不拒绝作答(Artificial Analysis)
Llama-3.2-3B 评测:3B 本地入门,128K+吞吐强,但安全/复杂推理弱 谨慎
✓ 开源可商用(Llama 3.2 社区许可),3B 轻量适合本地与边缘、官方 MMLU 64.4%、GSM8K 78%,3B 量级能力在线(官方)、128K 长上下文,同尺寸中罕见
✗ 复杂推理/数学受限于 3B 参数量,整体智力"有限但够用"(Intelligence Index 4.2/10)、越狱/提示注入抵抗弱(37%),安全性需外部防护
Llama-3.2-1B 评测:1B 极致轻量,但数学/工具弱 谨慎
✓ 开源 Llama 3.2 Community License,支持商用(月活 < 7 亿)、128K 超长上下文,适合长文本摘要与检索(Artificial Analysis 确认)、1B 极致轻量,4GB RAM 即可运行,Q4 量化磁盘约 0.7GB
✗ 数学推理弱:GSM8K 44.4%(明显低于 Gemma-3-1B 62.8%)、工具调用弱:BFCL V2 仅 25.7%
Ministral-3B-2512 评测:3B 多模态边缘,256K+视觉,但能力有限 谨慎
✓ Apache-2.0 开源可商用,权重开放、3B 极小:BF16 约 16GB,量化可低于 8GB,消费级硬件友好、256K 超大上下文 + 原生多模态(3.4B 语言 + 0.4B 视觉编码器)
✗ 3B 复杂推理/多模态精细任务弱(空间变换/表格识别错误率高)、Arena Hard 0.305 与同系列 8B(0.509)/14B(0.551)差距大
Ministral-8B-2512 评测:8B 多模态+262K,但学术/中文待证 谨慎
✓ Apache-2.0 许可证,可商用且社区友好、原生多模态(文本+视觉),支持图像理解、262K 超长上下文窗口(128K 的 2 倍),适合长文档
✗ 中文 benchmark 无公开证据,中文能力待验证、MMLU 76.1%、MATH 62.6% 在 8B 级非顶尖,落后更大模型
Nemotron-Nano-12B-VL 评测:文档 OCR 专精,多模态本地 推荐
✓ NVIDIA Open Model License 可商用,权重/训练数据/代码全开源(HuggingFace BF16/FP8/FP4 多精度)、文档理解顶尖:DocVQA 94.7%、ChartQA 89.8%、OCRBench 85.6%,OCRBench v2 私有榜领先(官方技术报告)、128K 上下文 + 多图/视频输入,EVS 技术提升视频推理吞吐 2 倍+
✗ STEM 视觉/GUI 弱:MMMU 55.3%(低于 Qwen3-VL 69.6%)、ScreenSpot 39.4%(Qwen3-VL 94.4%)、视觉 SFT 损耗文本:RULER 长上下文从 77.9 降至 72.1
Phi-4-mini 评测:3.8B 小钢炮,数学代码降维打击 推荐
✓ MIT 开源可商用,权重完全开放(HuggingFace)、3.8B 数学代码突出:GSM8K 88.6%、MATH 64.0%、HumanEval 74.4%,显著领先同尺寸(官方技术报告 Table 7/8)、128K 超长上下文,支持长文档与多轮对话
✗ 中文弱:Multilingual MMLU 49.3%,低于 Qwen2.5-3B 55.9%、知识截止 2024-06,无实时联网(需配 RAG)
Nemotron-Nano-9B-v2 评测:数学/吞吐强,但中文弱+NVIDIA 依赖 谨慎
✓ NVIDIA Open Model License,允许商用与分发衍生模型(官方许可)、Mamba2-Transformer 混合架构,推理吞吐最高提升 6.3 倍,长文本场景优势明显(官方技术报告)、128K-131K 超长上下文,RULER 128K 得分 78.9%
✗ 纯文本,不支持多模态(图像/音频/视频)、中文明显弱:CMMLU 61.59%、C-Eval 63.62%,远落后 Qwen3-8B(81.68%/84.84%)
Qwen2.5-3B 评测:中文数学优,但协议限制+知识/代码弱 谨慎
✓ 中文+数学 3B 级领先:GSM8K 79.1%、MATH 65.0%(DataLearnerAI)、端侧友好:3.09B、32K 上下文,支持 Ollama/vLLM/Transformers + 工具调用、生态成熟:HuggingFace/ModelScope/Ollama 官方 + GGUF/GPTQ/AWQ 量化齐全
✗ 协议非 Apache-2.0:采用 Qwen Research License,商用需额外审阅(系列内 0.5B/1.5B/7B 才是 Apache)、通用知识弱:MMLU 65.6%、MMLU-Pro 34.6%,明显低于 7B(74.2%/45.8%)
Qwen3-30B-A3B 评测:MoE 本地性价比王,30B/激活 3B 推荐
✓ Apache-2.0 开源可商用,社区活跃、MoE 架构参数效率高:30B 总参仅激活 3.3B,推理成本接近 3B 稠密模型(官方技术报告)、思考/非思考双模式切换,灵活适配任务
✗ 非思考模式推理弱:AIME25 仅 21.6,需开思考模式才发挥实力、纯文本无原生多模态
Qwen2.5-7B-Instruct 评测:中文本地主力,7B 数学代码领先 推荐
✓ Apache-2.0 开源可商用,社区活跃(HuggingFace 下载超 2 亿次)、7B 数学代码领先:GSM8K 91.6%、MATH 75.5%、HumanEval 84.8%(Emergent Mind 官方汇总)、128K 上下文(另有 1M 长上下文特化版),适合长文档
✗ MMLU 74.2% 仍落后更大模型、纯文本无原生多模态(需 Qwen2.5-VL 系列)
Qwen3.7-Max 评测:国产闭源旗舰,不可本地部署 不推荐
✓ 编程 / Agent 国产第一梯队:SWE-Verified 80.4(与 Claude Opus 4.6 / DeepSeek-V4-Pro-Max 持平)、GPQA Diamond 92.4、Terminal-Bench 2.0 69.7(官方技术报告)、多语言强:WMT24++ 85.8、MAXIFE 89.2,覆盖 50+ 语言(官方技术报告)、API 成本优势:输入 $1.25 / 百万 token,约为 GPT-5.6 的 1/28(社区评测)
✗ 闭源不可本地:阿里云官方确认权重不公开,仅百炼 / PAI API(阿里云开发者社区 2026-05-27 答复)、1.2T 总参 MoE,即使未来开源门槛也极高(参考同族 Qwen3.5-397B FP16 约 794GB),属数据中心级

场景方案