模型

GPT-5.5 评测:Agent 能力顶尖,但闭源不可本地

查看模型详情 →
结论:不推荐
优点
  • ✓ Agent / 终端任务顶尖:Terminal-Bench 2.0 82.7%(领先 Claude Opus 4.7 约 10 个百分点)、OSWorld-Verified 78.7%、LMSYS Agent Arena 第一(官方 / LMSYS)
  • ✓ 代码强:SWE-Bench Verified 88.7%、HumanEval 约 93.1%
  • ✓ 1M 上下文,Graphwalks 1M f1 达 45.4%(前代 9.4%),长上下文迈入生产可用(第三方评测)
  • ✓ 原生全模态(文本 / 图像 / 音频 / 视频)+ Computer Use 生态集成完整(官方)
缺点
  • ✗ 闭源不可本地:权重未开放,仅 OpenAI API / ChatGPT 订阅,无任何官方本地部署路径(官方 / 多源)
  • ✗ API 贵:标准 $5 / $30 每百万 token(Pro $30 / $180),约为开源竞品 DeepSeek V4 的 10-20 倍
  • ✗ 估算约 8.8 万亿参数(arXiv 黑盒探针,90% 置信区间约 3 倍误差),即使泄露也无法消费级运行
  • ✗ 多模态 / 新颖推理弱于 Gemini 3.1 Pro(MMMU-Pro 76 vs 82.8、ARC-AGI-2 52.9 vs 77.1);社区实测综合通过率仅 59.4%,与官方 Agent 高分反差大
适合场景:云 API 企业级 Agent 自动化(Codex / 多工具工作流)、1M 超长文档分析与科研综述、ChatGPT 重度生态用户(文本 + 图像 + 代码 + 浏览器一站式)

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-20),非实机测试。

① 公开证据综合

GPT-5.5 是 OpenAI 2026-04-23 发布的旗舰闭源模型,代号 Spud,自 GPT-4.5 以来首个全新预训练基础模型,从底层融入 Agent 训练目标(官方)。

Agent 与终端任务是其核心突破:Terminal-Bench 2.0 82.7%(领先 Claude Opus 4.7 约 10 个百分点)、OSWorld-Verified 78.7%(自主桌面任务)、LMSYS Agent Arena 第一、Agents’ Last Exam(ALE)Codex + GPT-5.5 组合 24.0% 居首(官方 / LMSYS)。代码 SWE-Bench Verified 88.7%、HumanEval 约 93.1%。1M 上下文 Graphwalks f1 45.4(前代 9.4),长上下文迈入生产可用(第三方)。

但多模态与新颖推理弱于竞品:MMMU-Pro 76、ARC-AGI-2 52.9,均落后 Gemini 3.1 Pro(82.8 / 77.1);SWE-Bench Pro 58.6% 低于 Claude Opus 4.8 75.1%(Kimi)。社区 20 款模型横实测综合通过率仅 59.4%(低于 Claude 3.5 Sonnet 91.3),与官方 Agent 高分反差大,提示能力高度依赖任务类型(DS)。

规模:官方未公开参数量;arXiv 黑盒探针(IKP)估算约 8.8T(90% 置信区间 2.9T-26.5T,仅供参考)。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?不能。 GPT-5.5 完全闭源,权重未开放,仅 OpenAI API / ChatGPT 订阅,无任何官方本地路径(3 家一致)。网络上的”本地部署 GPT-5.5 Pro”教程经核查是第三方基于 GPT-2 架构微调的衍生小模型,与官方无关,切勿混淆(DS)。即使未来泄露,8.8T 估算规模也远超消费级 / 企业级单节点承载。

Verdict:not-recommend(不推荐本地)。 GPT-5.5 Agent 能力顶尖、生态成熟,但闭源根本不可本地;API 高昂且存在能力相近、成本低 10-20 倍、可本地的开源替代(DeepSeek-V4-Pro / Qwen3.5 等)。仅推荐预算充足、需 OpenAI 顶级 Agent 能力的企业通过云 API 使用——本地部署场景应选开源权重模型。