什么是谷歌人工智能?
Google AI 是 Alphabet 旗下人工智能研究、基础设施、产品和开发者工具的统称。它涵盖了从 Google DeepMind 构建的基础大型语言模型 (LLM) 到嵌入在搜索、Gmail、照片和 Android 等面向消费者的功能,再到外部工程师用于构建自身 AI 应用的云端 API 和开发环境等方方面面。简而言之,Google AI 并非单一产品,而是一个集成化的多层技术栈,几乎渗透到 Google 的每一款产品和每一项服务之中。
核心组件概览
- Google DeepMind:由 Google Brain 和 DeepMind 于 2023 年合并而成的综合性人工智能研究机构。负责基础模型研究,包括 Gemini 模型系列。
- Gemini 模型:谷歌旗舰级多模态大型语言模型系列,提供多种尺寸——Ultra、Pro、Flash 和 Nano——针对不同的功能和延迟权衡进行了优化。
- Google AI Studio:一个免费的、基于浏览器的开发者环境,用于通过 Gemini API 对 Gemini 模型进行原型设计和实验。
- Vertex AI: Google Cloud 的企业级 MLOps 和模型服务平台,提供对 Gemini 以及数百个第三方模型的访问。
- AI 概览和 AI 模式: AI 生成的摘要和对话式搜索体验直接在 Google 搜索中呈现。
- Gemini App:消费者聊天机器人应用程序(前身为 Bard),可在网页和移动设备上使用,由 Gemini Pro 和 Ultra 型号提供支持。
- 设备端 AI: Gemini Nano 直接在 Pixel 智能手机和部分 Android 设备上运行,无需网络通话即可实现私密、低延迟的 AI 功能。
为什么谷歌人工智能如此重要
谷歌人工智能之所以重要,有三个既独立又相互关联的原因:规模、基础设施深度和科研产出。没有任何其他机构能够同时做到:为数十亿用户提供消费级规模的人工智能服务;维护底层计算基础设施(TPU、数据中心、网络);发表整个领域赖以生存的基础性研究;并通过公有云向开发者出售这些功能的访问权限。这种组合创造了难以复制的叠加优势。
部署规模
谷歌搜索每天处理约 85 亿次查询。自 2024 年推出 AI 概览功能以来,其中很大一部分查询现在会触发实时生成的 AI 生成式回复。Gmail 的智能撰写和智能回复功能使用序列到序列模型,每天处理数亿封电子邮件。自 2016 年以来,谷歌翻译一直采用神经机器翻译技术,每天处理超过 1000 亿个单词。这些数字表明,谷歌 AI 并非仅仅是研究对象,而是支撑全球大部分信息工作的重要基础设施。
研究影响
许多如今定义人工智能行业的架构理念都源自谷歌。谷歌大脑的研究人员在2017年发表的论文《注意力机制至关重要》(Attention Is All You Need)中提出了Transformer架构,该架构是GPT-4、Claude、Llama和Gemini等模型的基础。谷歌研究人员还推出了BERT(2018),它重新定义了模型理解文本上下文的方式;以及Word2Vec(2013),它确立了将单词表示为稠密数值向量的方法。DeepMind开发的AlphaFold预测了超过2亿种蛋白质的三维结构——这一贡献使DeepMind的Demis Hassabis获得了2024年诺贝尔化学奖。
经济和开发商生态系统
通过 Gemini API 和 Vertex AI,谷歌将其功能最强大的模型开放给外部开发者,从而构建了一个基于谷歌 AI 基础设施的、不断壮大的应用生态系统。Gemini API 在 Google AI Studio 中的免费层级支持快速原型开发,无需预付费用,降低了初创企业和独立开发者的门槛。对于企业用户,Vertex AI 则提供了大型组织所需的治理、合规性和扩展控制。这种双层架构——免费实验,付费生产——与谷歌发展其云业务的整体策略如出一辙。
谷歌人工智能的工作原理:技术架构
谷歌人工智能的运行依赖于多个不同的技术层。理解这些技术层有助于我们理解某些功能为何会以这种方式运行,以及谷歌的人工智能能力为何在结构上与纯软件竞争对手有所不同。
第一层——定制硅(TPU)
谷歌自主设计名为张量处理单元 (TPU) 的人工智能加速芯片。最新一代的 TPU v5p 在矩阵乘法运算方面,每瓦吞吐量远高于通用 GPU,而矩阵乘法运算正是神经网络训练和推理的核心。由于谷歌既设计芯片,又编写软件栈(包括用于优化 TPU 硬件计算的 JAX 和 XLA 编译器),因此它可以进行协同优化,而那些购买通用硬件的竞争对手则无法做到这一点。训练规模最大的 Gemini 模型需要数千个 TPU 在谷歌的全球数据中心网络中并行运行——这项基础设施投资高达数十亿美元。
第二层——基础模型(双子座)
Gemini 模型系列本身就是多模态的,这意味着这些模型从一开始就使用交错的文本、图像、音频、视频和代码进行训练,而不是先用文本训练,然后再通过补丁来处理其他模态。这种架构选择至关重要,因为原生多模态模型能够构建更丰富的跨模态表征:它可以推断图表与其说明文字之间的关系,或者口头提问与视觉回答之间的关系,而外加的视觉模块则无法做到这一点。
Gemini 模型采用仅包含解码器的 Transformer 架构,并在某些变体中加入了稀疏混合专家 (MoE) 层,这使得模型能够在不成比例增加推理成本的情况下扩展参数数量。Gemini 1.5 Pro 的上下文窗口达到了 100 万个 token,是当时所有公开可用模型中最大的,使其能够在一次提示中处理整个代码库、长篇法律文件或长篇电影。
第 3 层——服务基础设施和接地
原始模型输出对于许多任务来说很有用,但对于像谷歌搜索这样对事实准确性和时效性要求极高的产品而言却远远不够。谷歌通过一种名为“锚定”(grounding)的技术来解决这个问题,该技术将模型的响应锚定到从谷歌网络索引或用户个人数据(在 Workspace 应用中)中检索到的文档上。锚定技术不再仅仅依赖于训练过程中嵌入到模型权重中的知识,而是允许模型引用和综合当前可验证的来源。这就是 AI 概览背后的机制:系统检索一组候选网页,将它们作为上下文传递给 Gemini 模型,并生成带有引用的综合答案。
第 4 层 — 设备端推理(Gemini Nano)
并非所有谷歌人工智能都在云端运行。Gemini Nano 是一种压缩模型,旨在完全在移动设备的神经网络处理单元 (NPU) 上运行。在 Pixel 8 及更新的设备上,Nano 为录音机应用中的“摘要”功能、Gboard 中的“智能回复”功能以及“谷歌电话”中的实时诈骗检测功能提供支持。由于推理在设备端进行,这些功能无需互联网连接即可运行,也不会向谷歌服务器发送敏感的音频或文本——这在某些使用场景下具有显著的隐私优势。
第五层——开发者 API 和工具
Google 通过两种主要接口向开发者开放其模型。Gemini API 可通过 Google AI Studio 访问,专为快速原型开发而设计,支持 REST 调用、Python 和 JavaScript SDK 以及可视化提示编辑器。Vertex AI 提供相同的模型,并添加了企业级功能:微调管道、模型评估工具、与 Google Cloud IAM 集成以实现访问控制,以及支持将自定义模型与 Google 的基础模型一同部署。两种接口均支持函数调用,模型可以在对话过程中调用外部 API 或工具,从而实现智能体工作流,使模型能够执行多步骤操作,而不仅仅是生成文本。
谷歌人工智能产品之间的主要区别
| 产品 | 主要用户 | 基础模型 | 关键能力 |
|---|---|---|---|
| 双子座应用程序 | 消费者 | Gemini Pro / Ultra | 对话助手,多模态推理 |
| 人工智能概述 | 搜索用户 | 双子座(脚踏实地) | 来自实时网络索引的合成答案 |
| 人工智能模式 | 搜索用户 | 双子座(脚踏实地) | 包含后续查询的完整对话式搜索 |
| Google AI Studio | 开发者 | Gemini API | 提示设计、模型测试、API密钥生成 |
| Vertex AI | 企业开发人员 | Gemini + 第三方模型 | MLOps、微调、治理、扩展 |
| 工作空间中的 Gemini | 企业用户 | Gemini Pro / Ultra | 在文档/表格/Gmail 中进行草稿撰写、摘要撰写和数据分析 |
| Gemini Nano(设备端) | Pixel/Android 用户 | 双子座纳米 | 移动硬件上的私有离线人工智能功能 |
谷歌人工智能背后的研究机构
谷歌DeepMind由谷歌大脑(Google Brain)和位于伦敦的DeepMind于2023年4月合并而成,是谷歌的主要研究引擎。该机构在山景城、伦敦、纽约、巴黎等地设有办公室,拥有数千名研究人员和工程师。其研究领域涵盖强化学习(AlphaGo、AlphaZero、AlphaStar)、蛋白质结构预测(AlphaFold)、天气预报(GraphCast)、数学推理(AlphaProof)以及Gemini模型系列。DeepMind在包括《自然》(Nature)、《神经信息处理》(NeurIPS)、ICML和ICLR在内的同行评审期刊上发表了大量论文,秉持着推进基础科学和开发商业化产品的双重使命——这种平衡有时会造成内部紧张关系,但也带来了纯粹的学术实验室或纯粹的产品团队难以独立实现的突破。
安全与负责任的人工智能
自 2018 年以来,谷歌发布了一系列人工智能原则,正式排除了某些应用——例如自主武器、导致或助长非法监控的技术,以及旨在造成严重伤害的工具。在实践中,谷歌的安全工作包括在发布模型前进行红队演练、训练分类器以检测和过滤有害输出,以及发布关于机制可解释性(理解模型实际执行的计算)和可扩展监管(如何监管最终可能在特定领域超越人类专家表现的人工智能系统)等主题的研究成果。安全人工智能框架 (SAIF) 是谷歌面向在生产环境中安全部署人工智能系统的组织机构发布的公开指南。
如何有效利用谷歌人工智能:完整策略
要充分利用 Google AI,需要了解哪些工具服务于哪些用途,如何构建输入以获得更佳输出,以及大多数用户容易犯的错误。以下策略涵盖从设置到日常使用再到高级集成的各个方面,包括 Gemini、搜索中的 AI 模式、Google AI Studio 以及更广泛的生态系统。
第一步:选择适合您目标的谷歌人工智能工具
Google AI并非单一产品。在开始使用之前,最重要的决定就是选择合适的工具来完成你的任务。
| 工具 | 最适合 | 使用权 | 成本 |
|---|---|---|---|
| 双子座 (gemini.google.com) | 会话任务、写作、分析、图像理解 | 浏览器、Android、iOS | 免费版;Google One AI Premium 提供高级模型 |
| 双子座高级版 | 长上下文推理、复杂文档、编码项目 | Google One AI 高级订阅 | 付费版(捆绑2TB存储空间) |
| Google AI Studio | 原型设计、API 访问、快速工程、微调 | aistudio.google.com | 免费,但需遵守配额限制 |
| Gemini API(Vertex AI) | 生产应用、企业集成 | Google Cloud Console | 按次付费 |
| 谷歌搜索中的 AI 模式 | 研究、多部分问题、购物比较 | Google 搜索(美国,实验室选择加入) | 自由的 |
| NotebookLM | 总结和查询您自己的文档 | notebooklm.google.com | 免费;NotebookLM Plus 付费版 |
| 工作空间中的 Gemini | 在 Gmail、Docs、Sheets、Slides 和 Meet 中撰写草稿 | Google Workspace 帐户 | 包含在部分工作区套餐中 |
常见错误:在 AI 模式下使用 Gemini 效果更佳
Gemini 是一款对话式助手,专为开放式任务而优化。Google 搜索中的 AI 模式针对需要实时网页结果、产品比较和本地信息的查询进行了优化。如果您需要实时价格、最新新闻或权威信息,请使用搜索中的 AI 模式。如果您需要撰写长篇文档或解释代码,请使用 Gemini。
步骤二:正确设置您的 Google AI 环境
在第一次正式开始之前,请配置好您的环境,以免与默认设置作斗争。
适用于 Gemini(消费者)
- 请使用个人 Google 帐户登录 gemini.google.com。使用 Workspace 帐户可能会限制某些功能,具体取决于管理员的设置。
- 请在“设置”中启用 Gemini 扩展程序,以连接 Gmail、Google 云端硬盘、YouTube、地图和搜索。如果没有这些扩展程序,Gemini 将无法访问您的个人数据或实时信息。
- 在 Android 系统上,将 Gemini 设置为默认助手,以替代 Google Assistant 来处理设备上的任务。
- 如果您订阅了 Google One AI Premium,请明确选择 Gemini 1.5 Pro 或最新可用型号——默认型号可能是较轻量级的型号。
适用于 Google AI Studio(开发者)
- 使用 Google 帐户登录 aistudio.google.com。无需进行任何结算设置即可开始原型设计。
- 如果您计划超出免费套餐的速率限制或迁移到生产环境,请在 Google Cloud Console 中创建一个项目并将其链接起来。
- 从 AI Studio 生成 API 密钥并安全地存储它——切勿将其硬编码到客户端代码中。
- 熟悉三种提示类型:自由形式(开放式提示)、结构化(用于少量学习的输入/输出对)和聊天(多轮对话)。
对于 NotebookLM
- 请先上传资料来源——可以是 PDF 文件、Google 文档、网页链接、YouTube 链接或音频文件。NotebookLM 会根据您上传的资料来分析所有回复,因此资料来源的质量决定了答案的质量。
- 每个笔记本都应专注于一个主题或项目。混用不相关的资料会降低相关性。
步骤三:编写能产生有用结果的提示
你的输出质量几乎完全取决于你的输入质量。大多数用户编写的提示信息过于模糊、过于简短,或者缺少关键的背景信息。
四部分提示结构
- 角色:告诉Gemini你是谁。“你是一位资深财务分析师,正在审核一家初创公司的商业计划书。”
- 任务:明确陈述具体行动。“找出财务预测中最薄弱的三个假设。”
- 背景信息:请提供所需材料。您可以粘贴文本、上传文件或详细描述情况。
- 格式:请指定输出结构。“请以编号列表的形式作答,每点用一句话解释。”
行之有效的提示策略
- 使用示例。在要求 Gemini 生成更多输出之前,先向它展示一两个你想要的输出示例。这称为少样本提示,可以显著提高输出的一致性。
- 先要求给出推理过程。在后面加上一句“请一步一步地思考,然后再给出最终答案”。这样可以减少逻辑或数学题上的错误。
- 明确设定限制条件。字数限制、语气要求、应避免的内容——直接说明。“不要使用项目符号。用简洁的散文体写作,字数控制在200字以内。”
- 在同一对话中反复修改。Gemini会保留会话中的上下文。与其从头开始,不如说“修改第二段,使其更直接”或“现在针对不同的受众做同样的事情”。
- 在 AI Studio 中使用系统提示符。系统指令字段可设置整个会话期间的持久行为。您可以使用它一次性定义角色、输出格式和约束条件,而无需在每条消息中重复设置。
提示过程中应避免的错误
- 在同一个问题中提出多个不相关的问题。将复杂的请求拆分成多个顺序的问句。双子座更擅长处理专注的任务,而不是冗长繁杂的多部分问题。
- 假设模型了解你的背景信息。除非你明确说明,否则 Gemini 不会知道你的行业、受众或偏好。请将每一次新的对话都视为从零开始。
- 直接接受第一次输出结果,无需迭代。第一次回复只是草稿。通过后续提示进行完善几乎总是比从头重写效果更好。
- 过度依赖 Gemini 获取实时信息。Gemini的基础模型存在训练限制。对于时事新闻,请使用搜索中的 AI 模式或在 Gemini 中启用 Google 搜索扩展程序。
第四步:策略性地使用谷歌搜索中的AI模式
AI模式将谷歌搜索从链接列表转变为一个推理引擎,能够综合来自整个网络的信息。它对于以前需要打开十个标签页才能完成的研究任务尤其强大。
何时使用AI模式
- 同时根据多个标准比较产品、服务或选项
- 需要综合分析来自多个来源的信息的研究问题
- 规划诸如旅行行程、膳食准备或房屋装修项目等任务
- 基于先前搜索的后续问题——AI模式会记住会话中的上下文
如何从人工智能模式中获得更好的结果
- 用自然语言提问,而不是关键词串。“对于年收入9万美元的30多岁人士来说,罗斯个人退休账户(Roth IRA)和传统个人退休账户(Traditional IRA)的主要区别是什么?”比“罗斯个人退休账户 vs 传统个人退休账户”效果更好。
- 使用后续提问功能。在 AI 概览出现后,在同一对话线程中输入澄清问题,以缩小答案范围。
- 请查看引用的来源。AI模式会显示每项说法对应的网页。点击链接核实任何重要信息后再采取行动。
- 可用于本地查询。AI 模式整合了谷歌地图数据、营业时间、评价和实时可用性信息,这是标准搜索结果所不具备的。
第五步:将谷歌人工智能集成到您现有的工作流程中
单独使用谷歌人工智能只能带来有限的收益。但如果将其嵌入到你日常使用的工具中,就能带来累积性的生产力提升。
Google Workspace 集成
- Gmail:使用“帮我写”功能,根据简短提示撰写回复草稿。使用智能回复功能快速回复。使用摘要功能在回复前精简冗长的邮件往来。
- Google 文档:选中任意段落,让 Gemini 用不同的语气重写、简化或扩展。在空白文档顶部使用“帮我写作”功能,即可根据一句话简要说明生成初稿。
- Google Sheets:请 Gemini 用通俗易懂的语言编写公式。“创建一个公式,计算 B 列和 C 列之间的百分比变化,并突出显示变化超过 10% 的单元格。”
- Google 幻灯片:根据提示生成整个演示文稿大纲,然后用 AI 生成的内容和建议的图片填充各个幻灯片。
- Google Meet:启用自动会议记录和摘要功能。通话结束后,Gemini 会生成一份结构化的摘要,并将行动事项分配给相应的参会者。
开发人员工作流集成
- 使用 Gemini API 的函数调用将 AI 响应连接到真实数据源(数据库、API 或内部工具),以便模型可以检索实时信息,而不是依赖训练数据。
- 在生产应用程序中对 Google 搜索进行接地处理,以确保响应基于当前的网络内容,从而降低出现幻觉的风险。
- 使用流式响应在面向用户的应用程序中实时显示输出,从而改善感知延迟。
- 在部署到生产环境之前,使用 AI Studio 的内置评估工具系统地评估输出结果。