本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-20),非实机测试。
① 公开证据综合
GPT-5.5 是 OpenAI 2026-04-23 发布的旗舰闭源模型,代号 Spud,自 GPT-4.5 以来首个全新预训练基础模型,从底层融入 Agent 训练目标(官方)。
Agent 与终端任务是其核心突破:Terminal-Bench 2.0 82.7%(领先 Claude Opus 4.7 约 10 个百分点)、OSWorld-Verified 78.7%(自主桌面任务)、LMSYS Agent Arena 第一、Agents’ Last Exam(ALE)Codex + GPT-5.5 组合 24.0% 居首(官方 / LMSYS)。代码 SWE-Bench Verified 88.7%、HumanEval 约 93.1%。1M 上下文 Graphwalks f1 45.4(前代 9.4),长上下文迈入生产可用(第三方)。
但多模态与新颖推理弱于竞品:MMMU-Pro 76、ARC-AGI-2 52.9,均落后 Gemini 3.1 Pro(82.8 / 77.1);SWE-Bench Pro 58.6% 低于 Claude Opus 4.8 75.1%(Kimi)。社区 20 款模型横实测综合通过率仅 59.4%(低于 Claude 3.5 Sonnet 91.3),与官方 Agent 高分反差大,提示能力高度依赖任务类型(DS)。
规模:官方未公开参数量;arXiv 黑盒探针(IKP)估算约 8.8T(90% 置信区间 2.9T-26.5T,仅供参考)。
② 与同类模型横评
- vs Claude Opus 4.8:同闭源顶级 Agent 阵营,GPT 终端代理 / 代码效率略优,Claude SWE-Bench Pro / 对话自然度更强
- vs Gemini 3.1 Pro:Gemini 多模态 / 新颖推理反超、API 更便宜($2 / $12 vs $5 / $30)
- vs DeepSeek-V4-Pro:DS 开源可本地、成本低 10-20 倍、能力接近——本地 / 性价比维度碾压
③ 本地部署建议与 verdict
能不能本地跑?不能。 GPT-5.5 完全闭源,权重未开放,仅 OpenAI API / ChatGPT 订阅,无任何官方本地路径(3 家一致)。网络上的”本地部署 GPT-5.5 Pro”教程经核查是第三方基于 GPT-2 架构微调的衍生小模型,与官方无关,切勿混淆(DS)。即使未来泄露,8.8T 估算规模也远超消费级 / 企业级单节点承载。
Verdict:not-recommend(不推荐本地)。 GPT-5.5 Agent 能力顶尖、生态成熟,但闭源根本不可本地;API 高昂且存在能力相近、成本低 10-20 倍、可本地的开源替代(DeepSeek-V4-Pro / Qwen3.5 等)。仅推荐预算充足、需 OpenAI 顶级 Agent 能力的企业通过云 API 使用——本地部署场景应选开源权重模型。