首页 / 详情
Site icon

Google DeepMind

基本信息

Google DeepMind 网站截图预览

工具详情

DeepMind 模型广场使用指南

DeepMind 官网模型页集中展示其Gemini 全系、Gemma 开源系列、音视频生成(Nano Banana/Lyria/Veo/Imagen)、世界模型(Genie)、机器人模型等,定位为“下一代 AI 系统探索入口”。

一、核心模型与主要功能

1. Gemini 3.5(2026.5 最新旗舰)

  • 定位:前沿智能 + 行动能力,含 3.5 Pro/Flash 两版。
  • 功能:
  1. 文本/图像/音频/视频全模态理解。
  2. 长上下文支持(1M 输入/65K 输出)。
  3. 代码生成、工具调用、实时联网搜索、企业级智能体。
  • Gemini 3.5 Flash:4 倍速、低成本、高吞吐,适合实时对话/批量处理。

2. Gemini Omni(2026.5 新)

  • 定位:原生全模态“任意输入→任意输出”,首发视频生成。
  • 功能:
  1. 文本/图/音/视频输入→视频输出。
  2. 对话式视频编辑(改场景/换对象/调光照)。
  3. 物理模拟(重力/流体)。
  4. 未来支持图像/音频输出。

3. Gemma 4(开源最强)

  • 定位:Apache 2.0 开源,高智能/参数比,支持本地部署。
  • 功能:
  1. 文本/图像/音频(小模型)。
  2. 256K 上下文。
  3. 推理/代码生成/多模态任务、可商用无版权费。

4. Nano Banana 2(图像生成)

  • 定位:Pro 级画质+Flash 级速度,4K 商用级。
  • 功能:
  1. 文生图/图生图/编辑。
  2. 实时联网(RAG)、4K 输出、多角色/物体一致性(5 角色/14 物体)。
  3. 文字渲染/信息图/数据可视化。

5. Lyria 3(音乐生成)

  • 定位:带人声的音乐创作,24-bit 高保真。
  • 功能:
  1. 文本/图生音乐、带歌词人声。
  2. 多风格(流行/古典/电子)、短视频 BGM。
  3. AI 封面生成。

6. Veo(视频)/ Imagen(图像)

  • Veo:顶尖文生视频,电影级画质。
  • Imagen:顶尖文生图,高细节/艺术感。

7. Genie 3(世界模型)/ Gemini Robotics

  • Genie 3:3D 世界模拟、环境交互、物理引擎,可与 Google 街景联动。
  • Gemini Robotics:视觉 - 语言 - 动作(VLA)模型,实体机器人控制。

二、适用人群

  1. C 端用户:创意生成(图文/视频/音乐)、学习辅助、日常对话、内容编辑(Gemini App)。
  2. 创作者/设计师:Nano Banana 2(4K 商用图)、Veo(视频)、Lyria(音乐)、Omni(视频编辑)。
  3. 开发者/企业:
  • 开源:Gemma 4(本地部署/隐私优先/商用)。
  • 云端:Gemini API/AI Studio(智能体/RAG/批量处理)。
  • 平台:Enterprise Agent Platform(企业级智能体)。
  1. 科研/教育:Genie(世界模拟)、Gemini(长文档分析)、Gemma(定制研究)。
  2. 机器人/工业:Gemini Robotics(实体控制)、Genie(数字孪生)。

三、免费与付费

1. 免费

  • Gemma 4:完全开源(Apache 2.0),权重免费下载,本地运行零成本,可商用。
  • 基础试用:Gemini App 免费版(基础对话/简单生成)、Google AI Studio 免费额度(API 试用)。
  • 部分工具:如 Gemini 基础嵌入、简单提示词模板。

2. 付费(API/订阅)

  • Gemini 3.5 Flash(API):$1.50/百万输入 token,$9.00/百万输出 token;缓存输入 $0.15/百万。
  • Gemini Omni:仅限 Google AI Plus/Pro/Ultra 订阅,API 暂未开放。
  • Nano Banana 2/Veo/Lyria:订阅制(Gemini App 高级版)+ API 按用量计费。
  • 企业版:Gemini Enterprise Agent Platform、Vertex AI 定制定价。

四、如何使用(快速上手)

1. C 端(直接用)

  1. 访问 Gemini App(gemini.google.com)或移动端 App。
  2. 登录 Google 账号,免费版直接用;高级功能(Omni/4K/长视频)需订阅 Plus/Pro/Ultra。
  3. 选择功能:对话(Gemini)、生图(Nano Banana)、生视频(Omni/Veo)、生音乐(Lyria)。

2. 开发者(API/开源)

  1. 云端 API(推荐)进入 Google AI Studio(aistudio.google.com)。
  2. 创建项目→获取 API Key→选择模型(Gemini 3.5/Omni/Nano Banana 2)。
  3. 调用 API:支持文本/图像/音频/视频输入,返回生成结果。
  4. 开源本地部署(Gemma 4)下载权重(Hugging Face/Google)。
  5. 本地运行:需 GPU(推荐 RTX 4090+),支持笔记本/边缘设备。

3. 企业(智能体/定制)

  • Gemini Enterprise Agent Platform:构建/部署/管理企业级智能体,支持私有数据集成。
  • Google Antigravity:AI 原生开发平台,低代码构建应用。

五、避坑点(重要提醒)

  1. 地区限制:Gemini/Omni/Nano Banana 2 等部分地区不可用(含中国大陆),需合规网络环境。
  2. 版权风险:生成内容(图像/视频/音乐)可能涉及版权/商标侵权,商用需版权审核;SynthID 水印用于溯源。
  3. 提示词质量:
  • Omni/Nano Banana 2:需详细提示词(风格/分辨率/细节),模糊描述易出低质结果。
  • 长文本:Gemini 3.5 支持 1M 上下文,但超长输入易降质,建议分段。
  1. 成本控制:API 按 token 计费,批量任务易超预算;优先用 Flash 版(低成本高速)、缓存输入降成本。
  2. 开源限制(Gemma 4):Apache 2.0 免费,但不可用于非法/侵权用途;本地部署需硬件门槛。
  3. 生成稳定性:
  • Omni 视频:长视频(>1 分钟)易卡顿/失真,建议 30 秒内。
  • Lyria 音乐:中文歌词发音不准、曲风有限,适合短视频 BGM。
  1. 数据隐私:云端 API 输入数据可能被 Google 用于训练,敏感数据优先用 Gemma 4 本地部署。


评论

暂无评论