gemini
Google DeepMind 开发的多模态大模型 Gemini,支持文本、图像、音频、视频理解与生成,原生 1M~2M 长上下文。提供 Pro / Flash / Flash-Lite 三档,并支持图像生成(Imagen / Gemini Image)。
1M~2M token 上下文窗口;隐式缓存(implicit cache,cache_read 25% input);显式缓存(explicit cache,可指定 TTL);视觉理解(图像/视频/PDF);音频输入;图像生成(Gemini 3 Pro Image / Flash Image);Function Call;代码执行;Google 搜索工具;JSON 模式。
多模态问答;视频内容理解与检索;图像生成与编辑;长文档分析;代码生成;Agent 工作流;Google Workspace 集成。
图像生成按张计费;视频生成按秒计费;不提供本地部署(除 Vertex AI);企业版需 Google Cloud 账号;部分模型需申请预览权限。
| Model | Input / 1M tokens | Output / 1M tokens | Per 1M tokens |
|---|---|---|---|
| $0.2000 | $0.0000 | 1M tokens | |
| $2.0000 | $12.0000 | 1M tokens | |
| $0.5000 | $3.0000 | 1M tokens | |
| $0.2500 | $1.5000 | 1M tokens | |
| $1.5000 | $9.0000 | 1M tokens | |
| $2.0000 | $12.0000 | 1M tokens |