可以,但替代的是用户绘制工作流图这一步,而不是工作流本身。对于目标清楚、过程允许调整、结果可以复核的知识工作,使用者完全可以只用自然语言描述任务,让 Work Agent 自行规划和调用工具;对于付款、删除数据、批量外发、合规审批等高风险流程,确定性的状态、权限、检查点和回滚机制仍然不可省略。更准确的说法是:自然语言可以成为工作流的上层接口,传统工作流则会下沉为执行约束和治理底座。
传统自动化平台通常要求使用者先把工作拆成节点,再配置节点之间的条件、数据映射和异常分支。流程图既是操作界面,也是执行定义。它的优点是确定、可查看、容易逐步排查;缺点是业务人员必须提前知道每一步,而且外部页面、字段或规则一变化,流程就可能需要重新维护。
Work Agent 改变的是任务的表达层。官方给出的使用方式是:用户用自然语言交代目标,例如寻找符合条件的潜在客户、整理每周数据或处理收件箱;系统再把任务拆解为阅读、搜索、起草和交叉检查等步骤,必要时向用户确认,最后交付可审阅的成果。于是,使用者不必亲手连接“读取表格”“筛选记录”“生成文档”这些节点。
不过,只要任务涉及多个工具,就一定存在某种执行顺序。代理仍要保存当前状态,决定下一步调用哪个工具,处理失败和重试,并把中间结果传给后续步骤。区别只是这些步骤由系统在运行时生成,而不是由用户预先画在画布上。因此,所谓“自然语言替代工作流图”,实质是从显式的人工编排转向受约束的动态编排。
第一类是结果定义明确、实现路径开放的任务。例如“整理五十家满足规模条件的公司,并给出联系人和可核验的信息”。用户关心的是最终表格是否完整准确,并不关心代理先查公司网站还是先整理候选名单。路径越开放,代理按实际信息动态调整的价值越大。
第二类是以非结构化信息为主的知识工作。市场调研、资料汇总、邮件草拟和周报生成都包含阅读、判断、归纳与写作,硬编码每个分支的成本很高。自然语言模型能理解上下文,也能在缺少某项数据时改变搜索策略,因此比固定节点更适合处理长尾差异。
第三类是可低成本复核的任务。官方展示的交付模式强调工作记录、来源和最终成品,并把含糊或无法确认的内容标记出来。只要人能够快速检查表格、报告或邮件草稿,代理偶尔选择了次优路径也不会立即造成不可逆损失。此时衡量标准应是交付质量和人工复核时间,而不是每次执行是否经过完全相同的节点。
第四类是边界明确的周期任务。每周从表格与客户关系管理系统提取数据并生成摘要,看起来高度重复,但不同周期可能出现缺失字段、新增分类或异常波动。代理可以在稳定的触发时间和数据范围内灵活处理这些变化。这里通常采用“固定外壳、动态内核”:调度、凭证和输出位置固定,分析与写作步骤由代理决定。
如果每一步都承担法律、财务或安全责任,就不能只依赖自然语言意图。付款审批、账户权限变更、生产数据库修改、员工信息处理等流程,需要明确谁可以发起、谁可以批准、金额或数据范围是多少,以及失败后如何补偿。这些规则必须成为机器可强制执行的约束,而不能只是提示词中的一句要求。
高吞吐、低变化的事务同样更适合固定流程。假设每天要转换十万条格式统一的数据,确定性程序在速度、成本和可重复性上通常优于每条记录都让模型推理。代理可以负责发现异常或生成修复建议,但不应为了“智能化”取代成熟的数据管道。
严格追求可重放性的业务也需要显式定义。模型的规划可能受上下文、工具返回和模型更新影响,同一句任务不保证产生完全相同的步骤。如果审计要求证明某个决定严格执行了既定规则,就应把规则写入代码、策略引擎或流程节点,并记录输入、版本与输出。
此外,自然语言天然存在歧义。“找出最重要的客户”可能指收入最高、续约风险最大,也可能指战略价值最高。传统表单和流程图迫使设计者提前消除歧义;Work Agent 则需要通过追问、默认策略或任务模板来弥补。如果系统没有可靠的澄清机制,省下的配置时间可能会变成更昂贵的返工。
实际系统不必在代理与工作流之间二选一。稳妥的实现可分为五层:最上层接收自然语言目标;规划层将目标拆成可执行子任务;工具层只暴露经过授权的查询、写入和通信能力;策略层在每次调用前检查权限、数据范围和风险;执行层保存状态、日志、产物与失败信息。用户看到的是一句任务,平台内部仍有清晰的控制边界。
例如,用户要求“每天整理收件箱并回复常规邮件”。代理可以自由完成分类、摘要和草稿,但工具权限只允许读取邮件和保存草稿,不能直接发送。官方页面对收件箱场景也强调草稿需要人工复核,含糊邮件保持不动并被标记。这里自然语言取代了分类与撰写流程图,而“不得直接发送”仍是确定性的执行规则。
再如,用户要求生成销售线索表。规划层可以选择搜索顺序并调整关键词,工具层限制可访问的数据源,策略层禁止编造无法验证的邮箱,执行层记录每一行的来源和确认状态。最终验收只检查字段完整率、重复率、可验证率和目标匹配度。这样的系统既获得了代理的灵活性,又保留了传统自动化的可控性。
自然语言并不等于随意聊天。高质量委派至少要包含目标、输入、范围、交付物和约束。与其说“帮我研究竞争对手”,不如说明研究对象的市场范围、需要比较的维度、截止时间、输出格式,以及遇到无法确认的信息时如何处理。描述的是验收标准,而不是预设每一个操作步骤。
目标:比较三家直接竞争产品的企业版能力。
范围:只使用公开可核验的信息,数据截至本周。
交付物:一张对比表和一页结论,标出每项信息的来源。
约束:无法确认的字段留空,不做推测;不联系任何公司。
检查点:候选名单确定后先请求确认,再完成详细研究。
这类任务说明给代理留下了规划空间,同时将质量和风险边界说清楚。若任务会重复执行,还应把经过验证的说明保存为模板或操作手册。模板不是退回传统流程图,而是把成功经验固化为可复用的输入契约。
上线前可以选一个当前需要三十至六十分钟、每周发生多次且容易人工复核的任务。先记录人工基线,包括完成时间、错误率和返工次数;再让代理执行十到二十次,逐次检查交付物、工具调用、澄清次数和失败类型。不能只观察它是否“跑完”,还要确认结果是否真正可用。
验收指标应对应业务结果。例如,线索任务关注有效记录比例和重复率,报告任务关注数据一致性和人工修改时间,收件箱任务关注分类准确率与误操作数量。若代理经常在同一个环节失败,就把该环节改成固定工具或确定性子流程;若失败来自任务含糊,就补充输入字段或增加确认点。
风险可以按动作分级。只读搜索和生成草稿可自动执行;写入内部系统可在执行后通知;外发消息、删除记录和资金操作则要求执行前批准。权限应采用最小授权,凭证不放进任务文本,敏感数据设置访问范围,所有关键动作保留审计记录。这样即使规划发生偏差,影响也被限制在可恢复范围内。
第一,看业务人员是否能只描述成果而不再维护节点。第二,看任务变化时是否只需调整目标和约束,而不必重画整条链路。第三,看系统能否解释做了什么、使用了哪些信息,并把不确定项交给人。第四,看高风险动作是否仍受强制策略控制。满足前三项说明自然语言入口产生了实际价值,满足第四项才说明它可以进入生产环境。
因此,Work Agent 能显著减少传统工作流图的使用范围,尤其适合研究、整理、起草、报告和其他可审阅的知识工作。但它并没有让编排消失,而是把编排从用户界面移到了代理运行时。最佳实践不是删除所有流程,而是让人负责目标、边界和审批,让代理负责动态拆解与执行,再让确定性系统负责权限、状态、审计和恢复。