AI智能体与工作流:如何选对系统架构
一个采购团队看到一个AI演示:它能研究供应商、起草推荐意见,并将其交由审批流程。有人称之为智能体,有人称之为工作流。会议室里的人们点点头,仿佛这个标签无关紧要。
但它确实关乎紧要,因为AI智能体与工作流之争,本质上是一个关于运营风险、产品经济性,以及系统出错时谁来承担后果的决策问题。一个被包装成智能体来营销的工作流,可能会制造不必要的复杂性。而一个被硬塞进工作流形态盒子里的智能体,则可能白白丢失有意义的价值。更常见的情况是:团队在尚未赢得管理自主性的能力之前,就先买下了自主性本身。
AI智能体与工作流之争,本质是一个控制权问题
工作流是一系列明确界定的步骤。它接收已知的输入,套用规则或调用模型,将工作推进through预设的状态,并产出预期的结果。这个流程可以很复杂,可以包含检索、分类、文档生成、人工审批以及异常处理。但这些都不足以使它成为一个智能体。
智能体则拥有余地。它解读一个目标,从可用工具中做出选择,决定下一步该做什么,观察结果,并在一系列权限范围内调整自己的方法。它不仅仅是在流程的多个节点生成文本,而是在对路径本身做出选择。
这种区别绝非纸上谈兵。工作流为操作者提供一张地图;智能体则为系统提供一个目的地、一套工具,以及行驶范围的边界限制。当路线确实无法事先明确规定时,后一种模式可以威力巨大。但它也可能是一种极其“高效”的方式——用来自动化那些代价高昂的错误。这不是哪种架构在董事会PPT上听起来更“高级”的问题,而是:这个业务问题本身是否包含足够的不确定性和多样性,值得授权系统自主规划。
工作流的用武之地
对于那些具有可重复状态、稳定政策以及明确“完成”定义的流程,工作流应当是默认选择。想想看:接收登记、验证核对、信息补全、路由分配、审批流程、账目核对,以及合规报告。这些绝非低价值应用场景——事实上,这些往往正是真实采用率和持久收入开始的地方。
以理赔受理流程为例。一个工作流可以从提交材料中提取信息、检查必填字段、将细节与保单规则进行比对、识别缺失的证明材料,并将高风险案例转交给理赔专员。它可以使用语言模型,同时在关键层面依然保持确定性:哪些规则适用、谁有权批准例外情况,以及存在怎样的审计追踪记录。
工作流的魅力不在于它“平淡无奇”。当一个系统触及收入、合规或客户信任时,“平淡无奇”其实被低估了。它的魅力在于可测试性。你可以衡量完成率、异常率、周转时间、单案成本,以及交接环节的质量。当出现问题时,你可以找到失败的那一步,而不必对着一份智能体运行轨迹搞降神会式的猜谜。
创始人们常常低估这一优势,因为一个工作流演示看起来可能不如自主系统那样“神奇”。但客户往往会在第一次安全审查之后得出相反的结论。他们想知道:当系统遇到矛盾信息、缺少必要文件,或被要求在政策范围之外行事时,会发生什么。“它自己会想办法解决”并不是一种控制框架。
工作流也为产品团队提供了一条更清晰的学习路径。如果某个特定审批环节的转化率下降了,这是一个有用的信号;但如果一个智能体对相似的案例采取了不同的路径,信号就变得模糊不清了。你可能在真正理解一个流程之前,就已经构建出了一个用来改进这个流程的“灵活”系统。
智能体真正大显身手的地方
智能体适合那些以目标为导向、信息密集、且过于多变以致无法完全预先编码的工作。研究调查、账户准备、技术分诊,以及跨系统协调都可以归入此类。在这些场景中,通向有用答案的路径会随事实的变化而变化。
以企业客户研究为例。一个工作流可以从CRM、数据供应商和近期的支持工单中提取一组固定的字段。而一个智能体则可以走得更远:注意到某个续约存在风险、调查产品使用异常、审查实施历史、识别出可能的高管利益相关方,并为客户团队准备一份行动计划。价值来源于决定接下来该关注哪条线索。
这种自主性只有在满足三个条件时才是合理的。第一,智能体拥有的工具足够可靠,可以据此行动。第二,一次错误的中间决策所造成的代价是可控的。第三,结果可以对照真实的业务成效来评估,而不仅仅是看叙述听起来是否够“靠谱”。
这正是许多智能体产品在尽职调查中崩溃的地方。它们展示了开放式的推理能力,却无法说明权限边界、升级触发阈值、故障恢复机制,或单位经济效益。它们实质上是在兜售一个能接触生产系统、却无人监管的“能干实习生”。这或许是一场引人入胜的表演,但它不是企业级基础设施。
合格的智能体应当拥有对用户和管理员都清晰可见的边界。它应当明确知道自己能读取什么、能写入什么、何时必须请示、何时必须停止。对于重大行动,它应当保留相应证据。如果它能够发放退款、更改权益、修改财务记录,或对外沟通,那么审批机制就应当是产品本身的一部分,而不是法律条款里的小字。
一个伪命题:最有用的系统往往是混合型的
最优秀的生产级系统,很少是纯粹的智能体或纯粹的工作流,而是带有精心设限的智能体环节的工作流。
工作流可以掌管外层流程:接收请求、验证身份、对案例分类、分配权限、记录行动、闭环收尾。而在某一个环节内部,智能体可以调查一个模糊不清的问题、汇总证据,或提出解决方案。工作流让整个流程保持清晰可辨,智能体则处理那些原本需要人工在碎片化系统间四处搜寻才能完成的部分。
这远不如宣称拥有一支“全自主数字劳动力”那样光鲜亮丽,但它更容易销售、部署和扩展。客户购买的是更短的处理时间、更高的解决率,以及更少的可预防错误——他们买的不是对“自主性”这一理念的哲学承诺。
对创始人而言,混合模式改变了产品路线图的纪律要求:优先围绕高风险行动构建确定性的护栏,为模糊不清的工作建立监测机制,在人工操作者需要针对不断变化的输入反复做出相同判断的地方引入自主性,并在系统置信度较低或遇到未曾见过的情况时,保留一条回退路径。
对投资人而言,这改变了尽职调查该问的问题。不要问这家公司是否拥有智能体,而要问:智能体在哪些环节做出独立决策?它可以调用哪些工具?当它的计划失败时会发生什么?客户能否审查并推翻它的工作结果?一个打磨精美的智能体界面,可能掩盖着一支人工运营团队、脆弱的提示词链条,或一笔未被计入定价的推理成本账单。这些问题本身未必是致命的,但假装它们不存在才是致命的。
在为架构欢呼之前,先评估经济账
智能体消耗的算力可能大大高于工作流,因为它需要规划、调用工具、重试、反思,并维护上下文。当它取代了昂贵的专家工时,或者产出了明显更优的结果时,这样的成本是可以接受的;但如果它执行的只是一个简单规则引擎加一次模型调用就能搞定的任务,这样的成本就显得荒谬了。
应当在“任务”这个层级衡量系统表现:每完成一个案例的成本是多少?需要人工介入的比例有多高?系统采取需要撤销的行动的频率有多高?解决一个异常需要多长时间?部署之后,哪些客户指标发生了变化?
应避免使用诸如“智能体运行次数”“已启动任务数”或“已处理的token数”这类虚荣指标。当产品陷入混乱时,这些数字往往反而会上升。一个真正有用的系统,会减少工作量、风险,或达成价值所需的时间。如果某个指标奖励的是“活跃度”本身,团队最终就会去优化“活跃度”本身——这一点,对任何在规模化场景中运营过软件的人来说,都不会感到丝毫意外。
这其中还有一层商业含义。如果一家企业出售的智能体的经济价值来源于“完成的工作”,那么它就不应仅仅按席位数定价;同样,它也不应在承诺无限自主性的同时,背负一笔没有上限的算力账单。定价、权限设置与架构设计三者之间必须彼此契合。一旦不契合,毛利率最终就会成为那场没人愿意参加的会议的主题。
一个更好的决策标准
从客户所要达成的成果出发,把当前流程梳理得足够细致,从而暴露出其中真实存在的变化与多样性。识别出哪些环节是固定的、哪些需要判断力、哪些环节存在重大下行风险,以及人工目前在哪些地方把时间花在“搜寻”而非“决策”上。然后,选择那个能够可靠地改善结果的、自主程度最低的系统。
这一标准并非在反对智能体——恰恰相反,这正是智能体赢得可信度的方式。把需要判断力的工作交给自主性去承担,在错误代价高昂的地方对其加以约束,并针对买家所认可的基准来证明它的价值。最终能在部署后存活下来的产品,不会是那个最激进地使用“智能体”这个词的产品,而会是那个在不制造出一整套全新的“运营悔恨”的前提下,让某项可衡量的工作真正变得更好的产品。
您的领导方式在哪里有效,又在哪里正在消耗公司?
这个博客讨论的多数问题,最终都回到创始人如何经营公司这一点上。藤架领导力诊断把它拆成六个维度共24道行为锚定题:约12分钟,即时出结果,自助版免费。
开始藤架领导力诊断 →想了解兼职高管或顾问合作?预约探索性通话 →
