| 来源 | CSDN 下载频道 |
| 资源名 | 李飞飞 AI Agent 综述,全中文版本,带目录,内容共93页 |
| 格式 | PDF · 4.24 MB |
| 评分 | ⭐⭐⭐⭐⭐ (超过95%同类资源) |
| 所需积分 | 5 积分 |
| 获取方式 | ① 开通CSDN VIP(低至0.43元/天)免费下载;② 用已有积分兑换下载 |
| 链接 | https://download.csdn.net/download/lp895876294/90416734 |
💡 提示:CSDN VIP 买一年送一年,最低可享7折,还有30元优惠券可用。如果只是下载这一篇,5积分兑换成本约几块钱人民币。
人工智能的定义自1956年达特茅斯会议以来不断演变。1970年MIT的「Copy Demo」机器人系统已开始探索将感知、规划与执行融为一体的整体性AI。然而,此后的AI发展日趋碎片化——计算机视觉、自然语言处理、机器人学等子领域各自为政。
论文重点探索Agent AI在游戏、机器人、医疗三大领域的应用潜力,同时高度关注其伦理影响。
三大技术支柱:
全文共12章 + 6个附录:范式与框架(第2-3章)→ 训练方法(第4章)→ 分类体系(第5章)→ 应用(第6章)→ 跨域迁移(第7-8章)→ 数据集(第9章)→ 伦理与影响(第10-12章)→ 附录(GPT-4V在各类游戏/场景中的提示工程案例)。
当前AI智能体的核心能力包括:预测建模、决策制定、歧义处理、持续迭代。关键局限:大多数LLM不支持训练后实时更新知识库。
偏差来源包括:训练数据的社会固有偏差、历史文化偏差、语言与上下文理解局限、优势群体观点放大。缓解措施包括多样化训练数据、偏差检测与修正、伦理设计准则、支持多语言与无障碍访问。
需考量:数据采集透明度、存储安全、保留周期与删除机制、数据可携性、匿名化处理,需符合GDPR、CCPA等数据保护法规。
提出智能体能力提升路径:模仿学习 → 解耦 → 泛化 → 涌现行为。通过解耦任务特定奖励函数,从专家演示中学习通用策略;简单组件的交互可催生复杂的涌现行为。
包括:数据丰富化、算法优化、人在回路(HITL)、实时反馈整合、跨域知识迁移、特定场景定制化、伦理与偏差校验、持续学习迭代。
两类方案:通过提示工程约束模型输出范围;设计包含预执行人工校验与修改的高层流程,保障物理场景(如机器人操作)的系统安全性。
核心挑战:现有交互式Agent AI在未见过的环境/场景中泛化不足,为每个领域准备大规模数据集成本极高甚至不可行。
核心目标:复用预训练模型能力、支持长期任务规划、实现记忆编码与检索、结合环境反馈优化动作决策。
五大核心模块:
| 模块 | 功能 |
|---|---|
| ① 环境与感知 | 含任务规划与技能观察 |
| ② 智能体学习 | 策略学习与知识获取 |
| ③ 记忆 | 长期与短期信息存储检索 |
| ④ 智能体动作 | 动作预测与执行 |
| ⑤ 认知 | 推理与决策 |
相比通用LLM智能体的优势:可定制化适配特定任务、动作决策可解释性更强、符合医疗/法律等数据隐私要求、部署成本更低。
两步走:① 明确域内目标与动作空间,为每个任务分配专属智能体token,设计任务成功自动判定规则以降低训练数据成本;② 通过持续性能监控与反馈迭代优化模型,避免偏差与不符合伦理的输出。
核心:通过环境反馈的奖励/惩罚学习状态与动作的最优映射。三大挑战及LLM/VLM的缓解作用:
核心:模仿专家行为学习策略,无需环境探索。典型方法为行为克隆(BC),直接复制专家动作序列。代表模型:RT-1、RT-2(机器人控制),结合LLM/VLM实现端到端训练。
核心挑战:维度灾难。解决方案:增加训练数据、在模型中引入归纳偏置(如3D结构辅助机器人操作、地图表示辅助导航)、合成仿真数据缩小Sim2Real差距、构建大规模数据集、数据增强。
通过在输入中提供少量示例实现零样本/少样本任务适配。多模态基础模型(Flamingo、BLIP-2)可通过少量示例实现多种视觉理解任务。
分为空间优化(多智能体协同、资源分配)与时间优化(任务调度、动作序列优化):
以MindAgent基础设施为例,包含5个核心模块:环境感知与任务规划 → 智能体学习 → 记忆 → 通用智能体动作预测 → 认知。支持提示式记忆技术优化规划与后续动作。当前多模态智能体的人机交互系统多为规则驱动,交互灵活度不足。
预训练基础模型可跨场景复用。典型应用:
| 一级(通用域) | 二级(智能体类型) | 三级(具体子领域) |
|---|---|---|
| 多模态Agent AI 通用Agent AI | 具身智能体 | 视觉导航、仿真环境、重排任务 |
| 动作智能体 | 游戏AI、物理动作执行 | |
| 语言/视觉语言智能体 | VR/AR/MR、具身视觉与语言 | |
| 知识/推理智能体 | 知识检索、逻辑推理、情感推理 |
目标:构建可与环境交互、创造性解决复杂任务的智能体。
在仿真环境中试错学习动作策略,避免物理场景训练的高成本与危险性。主流平台:
利用大生成式AI模型降低交互内容生产成本。核心能力:为对象添加任意交互行为与规则、从草图生成完整关卡几何、使用扩散模型重新纹理化场景内容、从简单提示生成自定义着色器与视觉特效。
当前XR内容创作成本极高(涉及概念设计、3D建模、纹理、绑定、动画等多个环节)。XR智能体可辅助完成资产加载、boilerplate代码编写等重复性工作,并支持用户在运行时通过指令生成代码修改渲染引擎。
保障AI输出符合已知事实与逻辑原则:
| 子主题 | 核心内容 |
|---|---|
| NPC行为 | 利用LLM/VLM驱动非玩家角色实现更自然、更具适应性的行为反应 |
| 人类-NPC交互 | 通过自然语言实现人机流畅通信,智能体可理解玩家意图并做出上下文相关的回应 |
| 游戏智能体分析 | 基于智能体的游戏测试与玩法分析,自动发现设计缺陷 |
| 游戏场景合成 | 使用生成式AI从草图或自然语言描述生成完整游戏关卡与场景 |
| 实验与结果 | 在多个游戏环境中验证MindAgent等基础设施的有效性 |
知识检索智能体与诊断辅助系统,利用LLM的医学知识进行初步分诊、报告生成和患者教育,需严格符合医疗数据隐私要求。
LLM智能体在指令遵循、通用对话、工具使用等NLP任务中的实验评估。
| 维度 | 核心挑战与方向 |
|---|---|
| 7.1 跨模态理解 | 统一视觉、语言、音频等多模态感知通道,实现模态间的无缝知识迁移。核心问题:不同模态的表示空间对齐、跨模态检索与推理。 |
| 7.2 跨域理解 | 将在游戏中学到的策略迁移到机器人操作、在仿真中学到的导航策略迁移到真实场景。瓶颈:域间分布差异(domain gap)导致的性能下降。 |
| 7.3 跨现实交互 | 同一智能体在物理世界与虚拟世界之间无缝切换。例如:在VR中学习的装配技能可指导真实机器人完成相同操作。关键技术:统一的动作空间表示和跨现实状态对齐。 |
| 7.4 仿真到真实迁移(Sim2Real) | 利用域随机化、域自适应、真实感渲染等技术缩小仿真与真实的感知差距,提升策略在真实场景中的泛化能力。 |
| 优化数据来源 | 说明 |
|---|---|
| 8.1 基于人类的交互数据 | 从用户与智能体的交互中收集反馈信号(隐式的使用模式、显式的评分/纠正),用于持续微调模型,使智能体适应用户偏好和环境变化。 |
| 8.2 基础模型生成的数据 | 利用LLM/VLM自动生成训练数据(如合成对话、模拟场景),降低人工标注成本,同时保持数据多样性。关键在于确保生成数据的质量和真实性。 |
两类数据源协同工作,形成数据飞轮:基础模型生成初始数据 → 人类交互提供反馈信号 → 反馈用于优化模型 → 优化后的模型生成更高质量的数据。
论文提出的多智能体协作基准测试:
| 组成部分 | 说明 |
|---|---|
| 基准测试 | 定义标准化的多智能体评估环境 |
| 任务 | 多智能体协同烹饪任务,测试任务分配、通信效率、协作效果 |
| 指标与评判 | 任务完成率、通信效率、协作得分等 |
| 评估 | 多个基线模型的多维度对比分析 |
构建大规模音视频语言预训练数据集,支持多模态基础模型的训练与评估,覆盖音频事件检测、视频描述、跨模态检索等任务。
Agent AI的广泛应用将从以下维度重塑社会:
论文作者团队涵盖斯坦福大学、微软研究院、加州大学洛杉矶分校、华盛顿大学、微软游戏等多个机构,背景涵盖计算机视觉、自然语言处理、机器人学、游戏开发等学科,体现了跨领域合作对Agent AI研究的重要性。
六个附录展示了GPT-4V作为视觉-语言智能体在各类真实和虚拟场景中的提示工程实践:
| 附录 | 场景 | 内容 |
|---|---|---|
| A | 通用 | GPT-4V智能体提示工程细节——包括提示模板、上下文构建策略、输出格式控制方法 |
| B | Bleeding Edge(前沿场景) | 在需要复杂空间理解和实时决策的未知前沿场景中测试GPT-4V的泛化能力 |
| C | 微软飞行模拟器 | 利用GPT-4V解析飞行仪表盘、天气条件、导航信息,辅助飞行决策 |
| D | 《刺客信条:奥德赛》 | GPT-4V理解开放世界游戏中的任务目标、NPC对话、地图导航等复杂游戏上下文 |
| E | 《战争机器4》 | 在快节奏射击游戏中测试GPT-4V的实时态势感知和战术决策能力 |
| F | 《星空》(Starfield) | 在高度自由的太空探索RPG中评估GPT-4V处理多层级菜单、资源管理、星际导航等复杂交互的能力 |
| 术语 | 含义 |
|---|---|
| Agent AI | 能感知多模态输入并在环境中产生有意义的具身动作的交互系统 |
| Agent Token | 本文原创概念,为智能体行为预留的专用Transformer token子空间 |
| Infinite Agent | 可跨域迁移基础模型知识的新概念智能体 |
| MindAgent | 多智能体协同基础设施,含5大核心模块 |
| CuisineWorld | 本文提出的多智能体协作基准数据集 |
| 混合现实知识推理 | 微观+宏观层面的涌现机制,实现跨现实泛化 |
| Sim2Real | 仿真到真实世界的策略迁移 |
| TAMP | 任务与运动规划框架(Task and Motion Planning) |