Google 智能体白皮书

Google发布智能体白皮书,指出AI正从被动响应问答、翻译等离散任务,转向具备自主规划与执行能力的智能体范式。这类智能体是融合语言模型推理力与工具调用能力的完整应用,可不依赖人工干预,完成多步骤复杂任务。

发布于2025年11月12日 04:31
编辑零重力瓦力
评论0
阅读132

作者:Alan Blount、Antonio Gulli、Shubham Saboo、Michael Zimmermann 和 Vladimir Vuskovic

简介

人工智能正在发生变化。多年来,人们的关注点一直在于能够胜任被动、离散任务的模型,回答问题、翻译文本,或根据提示生成图像。这种范式虽然强大,但每一步都需要人工持续引导。如今,我们正见证着范式的转变,人工智能从仅仅做出预测或生成内容,迈向能够自主解决问题和执行任务的新型软件。

这一新前沿以 AI 智能体为核心。智能体不再只是静态工作流中的 AI 模型,而是一个完整的应用程序,能够制订计划并采取行动以实现目标。它结合了语言模型(LM)的推理能力与实际行动能力,从而能够处理单一模型难以胜任的复杂多步骤任务。其关键能力在于,智能体能够自主工作,在没有人类持续引导的情况下,自行推断为达成目标所需的下一步行动。

核心要点

智能体是什么

智能体 = 模型(大脑)+ 工具(双手)+ 编排层(神经系统)+ 运行时服务,用 LM 在循环中达成目标。它不再只是"工作流自动化",而是能自主规划、行动、观察的协作实体。

五步问题解决循环

  • 接收任务:由用户或自动化触发一个高层目标。
  • 扫描环境:编排层收集上下文——用户请求、短期记忆、可访问的工具与数据。
  • 思考推演:推理模型分析任务与环境,制定多步计划。
  • 采取行动:调用工具执行计划的第一步(API、代码、数据库查询)。
  • 观察迭代:把行动结果写回上下文,回到"思考"步骤,循环直至目标完成。

智能体能力分级

  • Level 0 核心推理系统:纯 LM,无工具,仅靠预训练知识。
  • Level 1 连接型问题解决者:接入外部工具(搜索、RAG、数据库),能获取实时信息。
  • Level 2 战略型问题解决者:掌握上下文工程,主动筛选、打包、管理每一步最相关的信息。
  • Level 3 协作多智能体系统:从"超级智能体"转向"专家团队",智能体之间互相委托任务。
  • Level 4 自进化系统:能识别自身能力缺口,动态创建新工具甚至新智能体来填补。

核心架构三要素

  • 模型:选型不能只看基准分,要针对业务问题测试,并权衡质量、速度、成本。可用"专家团队"路由——重活交给旗舰模型,简单高频任务交给快速廉价模型。
  • 工具:信息检索(RAG、NL2SQL)、执行动作(API、代码执行、人在回路 HITL)、函数调用(OpenAPI 契约、MCP 协议)。
  • 编排层:运行"思考-行动-观察"循环的状态机。关键设计选择包括自主度光谱、无代码 vs 代码优先框架、系统提示词注入领域知识与人格、短期/长期记忆管理。

多智能体设计模式

  • 协调者模式:一个"经理"智能体拆分任务并分派给专家智能体,再汇总结果。
  • 顺序模式:数字流水线,一个智能体的输出是下一个的输入。
  • 迭代精炼模式:生成器 + 评审器循环,持续提升质量。
  • 人在回路(HITL):高风险动作前暂停,征求人工批准。

Agent Ops:把不可预测变成可管理

  • 像 A/B 实验一样度量:定义证明价值的 KPI(目标完成率、满意度、延迟、单次成本、业务影响)。
  • 用 LM 当裁判:用强大模型按评分标准评估输出质量,替代简单的通过/失败。
  • 指标驱动开发:跑完整评估集对比新旧版本,作为部署的 Go/No-Go。
  • OpenTelemetry 追踪:高保真记录智能体每一步执行轨迹,回答"为什么"。
  • 珍视人类反馈:把用户反馈转成新的测试用例,给系统"打疫苗"。

智能体互操作

  • 与人类:聊天界面、computer use(接管 UI)、实时多模态语音(Gemini Live)。
  • 与智能体:A2A 协议 + Agent Card(数字名片),实现发现与异步任务通信。
  • 与金钱:AP2 协议(加密签名的授权委托)、x402(HTTP 402 微支付),构建智能体经济信任层。

安全与治理

  • 信任权衡:给智能体足够长的"绳子"干活,但短到不会"跑进车流"——纵深防御:确定性规则 + AI 守卫模型。
  • 智能体身份:智能体是新的主体类别,需可验证的数字身份(SPIFFE),按最小权限授权。
  • 规模化治理:从单智能体到企业舰队,需要中央网关作为控制平面 + 中央注册表,治理"智能体蔓延"。

学习与进化

智能体从运行时经验(会话日志、追踪、HITL 反馈)和外部信号(新政策、法规)中学习,通过优化上下文工程、优化或创建工具来持续改进。前沿方向是 Agent Gym——离线模拟环境,让智能体在真实部署前"试错"训练。

高级案例

  • Google Co-Scientist:虚拟科研协作者,生成并评估新假设,用多智能体生态加速科学发现。
  • AlphaEvolve:用进化算法优化数学与计算机科学算法,已改进谷歌数据中心、芯片设计与 AI 训练效率。

全文

下载《Google 智能体白皮书》全文(PDF,54 页英文原版)

相关文章

Jev 实操指南,用概率闸门重构智能体决策流
AI 新闻资讯
2026年9月18日
0 条评论
小创

Jev 实操指南,用概率闸门重构智能体决策流

TypeSafe AI 推出系统一模型 Jev,作为智能体概率决策闸门,仅返回带校准概率的结构化结果而不生成文本。该模型具备低成本、低延迟及零输出错误率特性,支持 Choice、Score、Noul 三种提问原语。文章详解了其 API 调用、SDK 集成及推测式并行、置信度路由等五种落地模式,并指出其本质是强类型函数调用而非廉价 LLM。建议在生产环境中锁定版本、规避算术任务,并通过影子模式实测校准效果。

#智能体#AI 编程#提示词工程
阅读全文
Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流
AI 教程知识
2026年9月18日
0 条评论
小创

Anthropic 开源知识工作插件库,111 个无代码技能包重塑智能体工作流

Anthropic 开源 knowledge-work-plugins 项目,提供 111 个无代码智能体技能包。该体系基于 Markdown 和 JSON 构建标准化模块,支持渐进式披露与 MCP 工具集成,标志提示词工程向软件工程化转型。内置 marketing 与 productivity 等插件展示了结构化输入及分层记忆范式,支持语义路由与轻量化定制。尽管存在多插件上下文竞争及云端连接器限制内网访问等问题,仍为智能体工作流提供了可复用的模块化规范。

#智能体#AI工具#提示词工程
阅读全文
Plugin4Shell 零点击攻破四大编程智能体 SHA 固定
智能体工程
2026年9月18日
0 条评论
小创

Plugin4Shell 零点击攻破四大编程智能体 SHA 固定

安全团队 AIR 披露高危漏洞 Plugin4Shell,影响 Claude Code、Codex 等四大主流 AI 编程智能体。该漏洞利用 Git 分支命名解析歧义绕过 SHA 固定机制,使攻击者可通过插件后台自动更新实现零点击远程代码执行。这是 AI 智能体生态首个分发层供应链漏洞,打破了传统安全审阅的信任假设。目前 Anthropic 和 OpenAI 已修复,Google 建议迁移,Microsoft 尚未发布补丁。开发者需在客户端增加 HEAD 哈希校验以防范风险。

#智能体#AI 编程#安全
阅读全文
互动讨论

评论区

围绕《Google 智能体白皮书》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。