“与其争论哪些工作才算是真正的 Agent,不如承认系统可以具有不同程度的 Agentic 特性。” —— 吴恩达
2024年 Snowflake 峰会开发者日上,人工智能领域的领军人物吴恩达 (Andrew Ng) 发表了题为“AI 代理工作流及其推动 AI 进展的潜力 (How AlAgentic workflows could drive more Al progress than even the next generation of foundation models)”的演讲,为我们揭开了 Agentic AI 的神秘面纱,并指出这可能是比下一代基础模型更具潜力的 AI 发展方向。

他深入解析了Agentic AI的概念,并强调这一技术有望成为比预期中的新一代基础模型更具发展潜力的AI新趋势。
Agentic AI改变传统LLM应用工作方式
Agentic AI标志着从传统的Agent概念向更高级别的自主智能体的转变。
传统的大型语言模型(LLM)如GPT-3和GPT-4虽然带来了显著的进步,但它们的交互方式通常局限于“非代理型工作流程(Non-agentic workflow)”,即用户输入指令(一次性prompt),模型输出结果。这种模式限制了模型的迭代优化能力,仿佛一位被束缚的天才作家,难以自由挥洒其创作才华。

Agentic AI的出现改变了这一现状,它将AI系统从被动接收指令的Agent转变为能够主动思考、规划和执行任务的智能体。这一转变的关键在于“代理型工作流程(Agentic workflow)”的实现。
吴恩达在其演讲中强调,Agentic workflow的核心在于将复杂任务分解为多个步骤,并通过循环迭代的方式逐步优化结果。这种方法更贴近人类解决问题的思维方式,包括以下几个步骤:
目标设定:明确任务目标,例如“撰写一篇关于Agentic AI的文章”。 规划分解:将任务分解为多个子任务,例如“确定主题、搜集资料、撰写内容、修改润色”等。 迭代执行:依次执行每个子任务,并根据反馈进行调整和优化,直至最终完成目标。
Agentic AI实现了AI从被动接收指令到主动决策的智能体转变
为了评估Agentic Workflow的实际效用,吴恩达领导的团队开展了一项基于HumanEval(编码基准测试集)的实验研究。

实验结果显著,即便是性能相对较弱的GPT-3.5模型,在应用了Agentic Workflow之后,其代码生成能力也实现了对GPT-4的超越。具体表现在HumanEval基准测试中的性能对比上。

区分两个核心概念:Agent与Agentic
在探讨Agentic AI时,我们必须明确区分两个核心概念:Agent与Agentic。吴恩达准确地阐述了这两者的差异:"Agent"作为一个名词,指的是一个明确的分类,而"Agentic"作为一个形容词,则表示一种程度或范围。
传统的AI系统,如我们熟知的机器学习算法,通常被归类为Agent。这些系统接收输入,按照既定规则处理,并输出结果。相比之下,Agentic AI则更上一层楼,它不仅能够被动执行指令,还能主动感知环境、理解目标,并自主选择行动方案,展现出不同程度的自主性和智能性。
从Agent到Agentic的转变并非一夜之间的事,而是一个逐步演进的过程。正如机器学习领域从线性回归发展到深度学习一样,Agentic AI也需要经过不断的迭代和优化,才能充分发挥其潜力。
Agentic AI的应用——“Vision Agent”
Agentic AI的应用潜力不仅限于代码生成领域,它还在其他多个领域展现出巨大的潜力。例如,在视觉智能领域,吴恩达的团队开发了一款名为“Vision Agent”的应用。
Dylan Layer,作为项目的领导者同时也是一位冲浪狂热者,对冲浪视频,尤其是包含鲨鱼游动的视频充满兴趣。他关注视频中鲨鱼与冲浪者的距离,为此制作了一个视频,其中鲨鱼与冲浪者的距离超过10米时,画面中的指示线会从红变绿,直观展示距离变化。
编写代码以实现这一功能需要复杂的操作,如对象检测和边界框测量,耗时数小时。因此,他们设计了一个简洁的指令:“在视频中检测鲨鱼和冲浪者,用绿色线标出距离,并在研究板上显示结果。假设每30像素代表1米。”
Vision Agent接手了这个指令,将任务分解为一系列步骤,并利用数据抓取工具进行处理。通过DOM提供的指示,确保使用daystrap框架来分隔这些步骤,并按照正确的顺序执行。此外,他们还会检索所需的工具,例如保存视频的函数,并获取这些工具的详细描述。
最后,他们测量冲浪者与冲浪板之间的距离,并基于这些数据自动生成代码。

Vision Agent能够根据用户的自然语言指令,自动编写代码并完成各种视觉任务,如目标检测、图像分割和视频分析等。例如,用户可以输入指令“帮我找到所有带红色帽子的人”,Vision Agent就会自动编写代码,识别图像或视频中所有符合条件的目标。

Vision Agent的工作流程包括接收指令、生成代码和执行代码三个步骤。其核心是一个名为“Coder Agent”的模块,负责将自然语言指令转换为可执行的代码。Coder Agent的工作原理包括规划、检索工具和生成代码三个步骤。

为了提高代码的质量和可靠性,Vision Agent还引入了一个名为“Tester Agent”的模块,负责对Coder Agent生成的代码进行测试和评估。Tester Agent的工作原理包括执行代码、检查结果和反馈错误三个步骤。

通过Coder Agent和Tester Agent的协同工作,Vision Agent能够自动生成高质量的代码,并完成各种视觉任务。以下是一些Vision Agent的应用示例:
• 检测图像中的人脸,并判断是否佩戴口罩。

• 分析视频,识别交通事故。

吴恩达力推Agentic AI
