首页
/
Google DeepMind
基本信息
- 工具类别: 大模型
- 收录时间: 2026-05-28
- 访问次数: 47
- 评分: 4.6
- 官网: https://deepmind.google/models/
工具详情
DeepMind 模型广场使用指南
DeepMind 官网模型页集中展示其Gemini 全系、Gemma 开源系列、音视频生成(Nano Banana/Lyria/Veo/Imagen)、世界模型(Genie)、机器人模型等,定位为“下一代 AI 系统探索入口”。
一、核心模型与主要功能
1. Gemini 3.5(2026.5 最新旗舰)
- 定位:前沿智能 + 行动能力,含 3.5 Pro/Flash 两版。
- 功能:
- 文本/图像/音频/视频全模态理解。
- 长上下文支持(1M 输入/65K 输出)。
- 代码生成、工具调用、实时联网搜索、企业级智能体。
- Gemini 3.5 Flash:4 倍速、低成本、高吞吐,适合实时对话/批量处理。
2. Gemini Omni(2026.5 新)
- 定位:原生全模态“任意输入→任意输出”,首发视频生成。
- 功能:
- 文本/图/音/视频输入→视频输出。
- 对话式视频编辑(改场景/换对象/调光照)。
- 物理模拟(重力/流体)。
- 未来支持图像/音频输出。
3. Gemma 4(开源最强)
- 定位:Apache 2.0 开源,高智能/参数比,支持本地部署。
- 功能:
- 文本/图像/音频(小模型)。
- 256K 上下文。
- 推理/代码生成/多模态任务、可商用无版权费。
4. Nano Banana 2(图像生成)
- 定位:Pro 级画质+Flash 级速度,4K 商用级。
- 功能:
- 文生图/图生图/编辑。
- 实时联网(RAG)、4K 输出、多角色/物体一致性(5 角色/14 物体)。
- 文字渲染/信息图/数据可视化。
5. Lyria 3(音乐生成)
- 定位:带人声的音乐创作,24-bit 高保真。
- 功能:
- 文本/图生音乐、带歌词人声。
- 多风格(流行/古典/电子)、短视频 BGM。
- AI 封面生成。
6. Veo(视频)/ Imagen(图像)
- Veo:顶尖文生视频,电影级画质。
- Imagen:顶尖文生图,高细节/艺术感。
7. Genie 3(世界模型)/ Gemini Robotics
- Genie 3:3D 世界模拟、环境交互、物理引擎,可与 Google 街景联动。
- Gemini Robotics:视觉 - 语言 - 动作(VLA)模型,实体机器人控制。
二、适用人群
- C 端用户:创意生成(图文/视频/音乐)、学习辅助、日常对话、内容编辑(Gemini App)。
- 创作者/设计师:Nano Banana 2(4K 商用图)、Veo(视频)、Lyria(音乐)、Omni(视频编辑)。
- 开发者/企业:
- 开源:Gemma 4(本地部署/隐私优先/商用)。
- 云端:Gemini API/AI Studio(智能体/RAG/批量处理)。
- 平台:Enterprise Agent Platform(企业级智能体)。
- 科研/教育:Genie(世界模拟)、Gemini(长文档分析)、Gemma(定制研究)。
- 机器人/工业:Gemini Robotics(实体控制)、Genie(数字孪生)。
三、免费与付费
1. 免费
- Gemma 4:完全开源(Apache 2.0),权重免费下载,本地运行零成本,可商用。
- 基础试用:Gemini App 免费版(基础对话/简单生成)、Google AI Studio 免费额度(API 试用)。
- 部分工具:如 Gemini 基础嵌入、简单提示词模板。
2. 付费(API/订阅)
- Gemini 3.5 Flash(API):$1.50/百万输入 token,$9.00/百万输出 token;缓存输入 $0.15/百万。
- Gemini Omni:仅限 Google AI Plus/Pro/Ultra 订阅,API 暂未开放。
- Nano Banana 2/Veo/Lyria:订阅制(Gemini App 高级版)+ API 按用量计费。
- 企业版:Gemini Enterprise Agent Platform、Vertex AI 定制定价。
四、如何使用(快速上手)
1. C 端(直接用)
- 访问 Gemini App(gemini.google.com)或移动端 App。
- 登录 Google 账号,免费版直接用;高级功能(Omni/4K/长视频)需订阅 Plus/Pro/Ultra。
- 选择功能:对话(Gemini)、生图(Nano Banana)、生视频(Omni/Veo)、生音乐(Lyria)。
2. 开发者(API/开源)
- 云端 API(推荐)进入 Google AI Studio(aistudio.google.com)。
- 创建项目→获取 API Key→选择模型(Gemini 3.5/Omni/Nano Banana 2)。
- 调用 API:支持文本/图像/音频/视频输入,返回生成结果。
- 开源本地部署(Gemma 4)下载权重(Hugging Face/Google)。
- 本地运行:需 GPU(推荐 RTX 4090+),支持笔记本/边缘设备。
3. 企业(智能体/定制)
- Gemini Enterprise Agent Platform:构建/部署/管理企业级智能体,支持私有数据集成。
- Google Antigravity:AI 原生开发平台,低代码构建应用。
五、避坑点(重要提醒)
- 地区限制:Gemini/Omni/Nano Banana 2 等部分地区不可用(含中国大陆),需合规网络环境。
- 版权风险:生成内容(图像/视频/音乐)可能涉及版权/商标侵权,商用需版权审核;SynthID 水印用于溯源。
- 提示词质量:
- Omni/Nano Banana 2:需详细提示词(风格/分辨率/细节),模糊描述易出低质结果。
- 长文本:Gemini 3.5 支持 1M 上下文,但超长输入易降质,建议分段。
- 成本控制:API 按 token 计费,批量任务易超预算;优先用 Flash 版(低成本高速)、缓存输入降成本。
- 开源限制(Gemma 4):Apache 2.0 免费,但不可用于非法/侵权用途;本地部署需硬件门槛。
- 生成稳定性:
- Omni 视频:长视频(>1 分钟)易卡顿/失真,建议 30 秒内。
- Lyria 音乐:中文歌词发音不准、曲风有限,适合短视频 BGM。
- 数据隐私:云端 API 输入数据可能被 Google 用于训练,敏感数据优先用 Gemma 4 本地部署。
暂无评论