模型

Gemini 1.5 Pro

仅 API 可商用
Google · Gemini · 商业许可 · — · 上下文 2M
能做什么
多模态理解长文档分析编程开发逻辑推理内容创作
部署门槛
待补充
API 价格
$1.25 /百万
输入/标准档 · 全站比价 →
上下文
2M
token 窗口
参数
Gemini

01基础参数

参数规模
上下文窗口
2M
输入模态
text / multimodal / vision / audio / video
可生成
text
模型系列
Gemini
开源许可
商业许可
主要语言
multi

02部署门槛详情

硬件等级 待补充

03Benchmark 评测

待补充

04适用场景

✓ 适用
超长文档分析与理解、跨模态推理与内容创作、复杂代码库解析与编程辅助、视频内容理解与摘要生成
✗ 不适用
图像生成、实时性要求极高的对话场景、需要本地离线部署的场景

05部署与限制

⚙ 本地部署建议
Gemini 1.5 Pro为闭源API模型,无法本地部署。开发者需通过Google AI Studio、Vertex AI或Gemini API调用使用。Google提供付费API服务,并有免费额度供测试。
⚠ 已知限制
模型参数量、具体架构细节未公开。其强大的长上下文能力在处理超长输入时可能带来较高的API调用成本。作为闭源商业模型,使用受Google API服务条款限制,且数据需通过云端处理。

06详细介绍

Gemini 1.5 Pro 是 Google DeepMind 于2024年2月发布的旗舰级多模态大语言模型,以其突破性的长上下文理解能力著称。它采用混合专家(MoE)架构,原生支持对文本、图像、音频、视频和代码的联合推理。其最突出的特点是拥有高达200万token的上下文窗口,能够一次性处理约150万个单词,相当于超过5000页的文本、数小时的视频或完整的超大型代码库。

该模型的核心能力在于对海量多模态信息的深度理解与分析。它在「大海捞针」等长上下文检索任务中实现了近乎完美的准确率,并能根据一份语法手册从零学习翻译一种新语言(如Kalamang语)。此外,Gemini 1.5 Pro还支持代码执行功能,可在沙盒环境中生成并运行Python代码来解决复杂的数学或逻辑推理问题。它适用于长文档摘要、跨模态内容创作、复杂的代码审查与编程辅助、以及视频内容的理解与问答等场景。需要注意的是,该模型为闭源商业API服务,无法本地部署,需通过Google AI Studio或Vertex AI平台调用,并会产生相应费用。

07官方资源

08API 定价 全站比价 →

标准 ≤128K 输入 1.25 / 输出 5 USD/百万token
标准 >128K 输入 2.5 / 输出 10 USD/百万token
预算估算器
USD ≈ 可输入 百万 token

09同类模型