过去一年,Agent 已经能接通电话、投放广告,甚至转账付钱。但能执行,不意味着企业敢完全放手。话说出口能撤回吗?广告预算花超了算谁的?钱转错了又该谁负责?
能不能把一项工作从头到尾做完,才是 Agent 落地的真正分水岭。如果最后 10% 仍然必须由人接手,它就可能成为整个流程的瓶颈,自动化带来的效率也会大打折扣。
8 月 3 日,在新加坡的 AGI Playground 2026 舞台上,四位面向企业提供 Agent 服务的创业者展开了一场讨论:WIZ.AI 董事长兼联合创始人陆剑锋、Ateve 创始人兼首席执行官 Eileen Weng、易点天下 zMaticoo Demand VP Bill Cao,以及 Airwallex 空中云汇全球首席营收官吴恺。他们从各自正在经历的真实业务出发,讨论了 Agent 落地最具体的难题。本次对谈,我们邀请了 Stealth Startup 创始人胡少阳作为 Founder Park 的客串主持人。
四家公司切入的场景并不相同。WIZ.AI 用语音 Agent 服务大型企业,Ateve 为 Agent 构建搜索引擎,易点天下正在用 Agent 改造数字营销工作流,Airwallex 希望把 AI 接入全球支付、资金与支出管理。
但他们的判断指向了同一件事。Agent 的下一阶段,不再取决于它看起来有多聪明,关键是能否在企业环境里持续、可靠、低成本地交付结果。
以下为对谈实录,经 Founder Park 编辑整理。
01
从财务到客服,
Agent 正在进入真实工作流
Founder Park:从你们的视角来看,Agent 领域发生的最重大变化是什么?
吴恺(Airwallex):我们是一个 AI 原生的全球金融平台,帮助企业端到端地管理支付、资金和支出。我们看到两项尤其相关的趋势,并围绕它们推出了两款产品。
第一个叫 T0,定位是为创业者担任 AI 财务总监。我们创业之初,很难招到优秀的财务总监。财务背景的人对加入早期创业公司往往比较谨慎,找到合适的人对我们而言曾是一个真实痛点。有了 T0,现在可以帮助初创公司处理记账、财务报告、税务申报,包括资金管理、企业信用卡和员工工资发放在内的所有金融运营。我们希望,在公司规模还很小时,AI 财务总监可以支持创始人,把团队从一两个人扩展到二三十人。而且随着公司进一步成长,T0 仍然可以更深度地嵌入他们的财务工作流。
第二个趋势是 Agentic Commerce。目前体量还很小,但随时可能爆发,就像很多 AI 应用一样。所以我们推出了「Airi」,本质上是一种面向消费者的 Agent 银行服务,支持消费者钱包以及由 Agent 驱动的交易流程。
未来,消费者想通过 ChatGPT 或任何其他 AI 工具购物时,我们可以把他们的支付方式嵌入这些工具,让 Agent 代表他们完成支付。起点是一键结账,未来可能变成零键结账,完全由 Agent 操作,当然需要用户事先授权。
Bill Cao(易点天下):吴恺刚从金融角度做了分享,我从营销角度来谈。我们为营销人员提供全栈营销解决方案,尤其面向中国出海的数字营销市场。程序化广告本质上是一个硬核工程问题,需要应对高并发、超低延迟,并把海量数据整合到同一个系统中。我们正在用 Agent 改造整个营销工作流。
回看六七年前,我们还处于大数据时代,不是 AI 时代。数字营销是个重度数据驱动的市场,海量数据不断涌入,营销人员基于纯数字指标来衡量绩效。行业的核心问题一直是:大家用不同的工具、在不同渠道投放广告、有多个数据触点,但没有一个统一的接入点把所有数据整合在一起。
大约一年半前,数字营销行业刚开始采用 AI 时,企业主要让它完成单项任务,例如检索和格式化数据、汇总和分析数据,或生成广告创意。这些功能彼此分散,AI 只是一个接一个地完成任务,任务之间没有连接起来。
现在,我们把这些功能组合成一套 Agent 工作流。AI 可以贯穿营销人员的整个流程,从数据检索、数据分析,到智能决策,再根据结果继续优化。过去 12 到 18 个月,我看到行业正在向越来越复杂的端到端工作流演进。
Eileen Weng(Ateve):我们正在为 Agent 设计一款搜索引擎,目标是让 AI 能够找到一切信息,从底层为 AI 而非人类打造,因为我们发现人类搜索和 Agent 搜索有根本区别。
首先是搜索频次。传统人类搜索通常只搜一次,比如用 Google。但 Agent 搜索是一个迭代推理的过程,Agent 会根据上一次查询的结果生成下一个查询,所以 Agent 的查询远没有人类查询稳定。
人类搜索可能形成容易识别的趋势,但 Agent 的查询经常出现在中间推理或验证假设的过程中。离开 Agent 正在执行的任务后,其中许多查询本身几乎没有意义。这会改变搜索的优化方式,目标不再只是把人的查询与相关结果匹配起来,而是判断检索到的信息能否帮助 AI 完成任务。
其次,Agent 的需求与人类不同。人类用户可能主要看重相关性和时效性,Agent 还需要结构化输出、低延迟、可控成本和 token 效率。
基于这些,我们看到 Agent 搜索正在从一款简单产品,演变为持续运行的认知基础设施。
陆剑锋(WIZ.AI):我们为大型企业提供语音 Agent,主要用于客户服务和客户互动。客户大多位于东南亚,也覆盖拉丁美洲及全球其他地区。
从今年开始,无论在东南亚还是其他市场,我们都看到了越来越多的语音 Agent 公司。其中一个原因是,开源技术和大语言模型的能力都得到了大幅提升。但做出 Demo 很容易,真正打造一款企业可以使用的应用很难。
对我们而言,最重要的问题是可靠性。所谓可靠的对话,是指 AI Agent 能够像熟悉客户业务的专家一样解决问题、完成互动。效率和成本当然重要,但要排在可靠性之后。
首先需要控制的是响应时间,用户停止说话后,Agent 能不能在两秒内开始回应?这里指的是开始回答,而不是在两秒内说完。
这个问题出乎意料地难,我们在这上面投入了很多时间。我们的语音流量大多通过公共交换电话网、手机或企业电话系统传输。如果延迟像一些聊天机器人那么长,用户会直接挂断电话。
企业还非常关注首次呼叫解决率。企业把业务外包给 BPO 服务商时,会考察客户满意度以及问题有没有得到解决。如果 AI Agent 无法在这些结果上与人工坐席竞争,多数企业就不会采用。这就是我们今年初推出多 Agent 语音系统的原因,可靠性是第一优先级。
Founder Park:最近 OpenAI 推出了新的 GPT-live 语音实时模式,挺出乎意料的。它只是一个 Demo,还是已经真正实用?语音会不会成为人与 Agent 交互的主要方式?
陆剑锋(WIZ.AI):我们也在和 OpenAI 合作测试。使用语音到语音模型做一个 Demo 并不难。但我们为客户提供的不只是语音 Agent 系统,还有配套的评测系统。
如果把整套方案从一个模型切换到另一个模型,我们会用真实对话进行测试:它能完成多少任务,问题解决率是多少,对用户意图的识别准确率如何。通过这类 A/B 测试,我们才能判断一个模型能否正式上线。
这个问题没有简单的是或否。它取决于如何约束和驾驭整个 Agent,以及还需要哪些辅助技术帮助它完成任务。可靠性归根结底就是把事情做成。客户并不太关心我们用了哪种技术,他们关心的是结果。

02
Agent 进入复杂业务,
需要不断进化的工程能力
Founder Park:机会越大,工程挑战也越大。Bill,你们的营销 Agent 要实现闭环,还要同时处理高流量和大量操作,这样的工作流是怎样搭建的?
Bill Cao(易点天下):把所有分散的工具和数据源整合在一起。这是我们面临并解决的最大问题之一。
在易点天下,我们已经通过 MCP 对运营工作流中几乎所有工具和数据源进行了标准化。这样一来,Facebook、Google、内部工具、数据看板等不同来源的数据就能汇集到一起,为 Agent 提供更丰富的上下文,帮助它做出更好的决策。
第二,Agentic 工作流是有成本的,特别是 LLM 成本和 token 成本。我们的解决方案是对所有 SOP 进行分类。对于需要深度推理的复杂场景,用高能力模型。高频、常规的场景,比如数据检索和分析,用更便宜的模型。在智能决策与成本之间取得平衡,让整套系统在经济上可持续。
Founder Park:能描绘一下未来营销人员与 Agent 团队协作的场景吗?
Bill Cao(易点天下):我设想,数字营销会变成一个 Agent 对 Agent 的网络。
现在,每家公司都有自己的 Agent 工作流。无论是 Google、Meta 这样的平台还是程序化广告公司,Agent 工具基本都在各自系统内部运行。但未来一两年,行业会逐步走向 Agent 对 Agent 的网络——其实已经有公司在推进了。
今天的程序化广告依赖 OpenRTB 等协议,也就是很多系统共同遵循的 API 标准。未来,一部分交互可能不再需要僵化的固定协议,一家公司的 Agent 可以直接与另一家公司的 Agent 沟通。例如,SSP 的 Agent 可以直接与 DSP 的 Agent 对话。我认为,数字营销的转型会在这里发生。
Founder Park:Eileen,你们在研究「自我进化」这个前沿方向,在产品中如何实现它?
Eileen Weng(Ateve):自我进化可以在很多层面发生,Agent 层、Harness 层,或者模型层。我们开始研究它,是因为传统的搜索优化方法并不适合 Agent。
Agent 发出的查询可能只是中间步骤,也可能是为了验证一个抽象假设。在这个搜索过程中,可能完全没有人的信号,没有点击,也没有直接反馈。你所拥有的,可能只有最初的 Prompt 和最终结果,也就是任务到底成功还是失败。
在这种情况下,我们无法彼此独立地优化排序器、检索模型和其他组件,它们必须整体一起进化。搜索引擎也不能独立演化,必须与 Agent 一起演进。
Founder Park:基础模型的自我演化很可能是大公司的事情。对于一家产品创业公司来说,应该从什么时候开始考虑 Harness 的自我演化?
Eileen Weng(Ateve):刚开始开发产品时,你需要找到模型公司或 Meta、Athrophic 和 OpenAI 这样的大平台不会做的事情,并选择一个能够持续深入的领域。现在仍然有很多困难、专业的工作是模型公司不愿深入的,尤其是具体行业的 Know-how。
举个例子,我们服务很多医疗公司,他们的搜索需求和通用搜索完全不同,他们需要搜索论文,而不是通用问答。创业公司应该深入这类行业,找到模型公司不愿做的工作。
03
Agent 自主权越大,
责任边界越要清楚
Founder Park:Agent 开始执行任务之后,信任和权限就变成了关键问题。什么时候需要 human in the loop,什么时候 human on the loop 就够了?吴恺,你的业务直接涉及资金,这一点尤为重要,怎样在 Agent 能力和权限之间取得平衡?
吴恺(Airwallex):这是所有 Agent 公司都要面对的问题,对金融服务尤其重要。我们的方法基于两点。
第一,重要决策的控制权仍然属于用户。有些操作不可逆,比如让 Agent 为员工发工资,或者向供应商转账。钱一旦转出,就不能简单撤回。面对这类决策,我们一定会要求 Agent 获得人的授权。授权可以有不同形式,比如把一批交易统一提交审批,但控制权始终掌握在用户手中。
另一些决策可以撤销。在这些场景里,我们希望尽量减少对人的打扰。比如 Agent 做记账工作,在账簿中添加一笔会计分录,就没有必要让人介入每一次操作,否则整个工作流都会慢下来。
第二是可追溯性。Agent 执行的每项操作都应该可以追溯,用户能看到它做了什么、改了什么,也可以通过工具撤回。我们还在建立操作的反馈闭环,让 Agent 从错误中学习,未来避免类似失误。
消费者交易会更复杂。如果 Agent 代表消费者购物,一旦出现退款争议或欺诈,最终由谁负责?目前,答案仍然是用户,因为用户是持卡人,也是交易的授权者。我们正在与卡组织和其他支付方式提供商合作,研究 Agentic Commerce 场景中的拒付和授权争议该如何处理。
Founder Park:未来,交易会不会主要通过对话完成?比如我只要告诉 ChatGPT 或另一个 Agent,向吴恺转账 30 美元,它就能直接执行。
吴恺(Airwallex):从技术上说,现在已经可以做得很好。在 Airwallex 的网页应用里,你可以告诉 Kai Agent,自己想向某个人发起一笔转账。它会在后台创建转账,你确认之后,款项就会发出。
更有意思的问题是,我们究竟应该给 Agent 多大的自主权。它只负责创建转账,还是收到指令后也可以直接把钱发出去?我们对完全自主仍然比较谨慎。目前采取的是相对保守的方式,Agent 在后台创建转账,但真正执行前,用户必须点击确认。
从技术上说,实现完全自主并不难,真正的问题是责任归属。
Founder Park:剑锋,你们面对的是实时语音对话。Agent 说出口的话无法撤回,怎样控制它的边界?
陆剑锋(WIZ.AI):智能的本质是解决问题。人类智能同样会犯很多错误,因此,信任来自你能多好地控制和减少错误。
AI 和人有不同的优势。比如,我们有些客户一小时要处理超过 100 万通电话,AI 可以稳定地避免违规回应,无论是监管机构禁止的话,还是容易激怒客户的措辞。这种一致性,用 AI 比用人更容易做到。
但 AI 仍然有很多薄弱点。我们需要设置护栏,阻止 Agent 回答职责范围之外的问题。也有人会尝试通过语音进行 Prompt 越狱,因此系统必须先识别和过滤这类攻击,让 Agent 忽略这些指令。与普通人工工作流相比,AI 系统需要更多保护层。
我职业生涯最初 15 年都在做网络安全,攻防从来是一场持续的较量。针对 AI 系统的威胁已经出现,但我们也不能为了所有假设中的威胁过度提前建设,否则防御机制会推高延迟和成本。
我们的做法是持续监控新威胁,针对真正出现的问题建立防御。信任因此包含两个层面,一是在现有方案中控制已知风险,二是在新威胁出现时开发新的应对技术。否则,整个业务都可能陷入危险。
04
做到什么程度,
企业才愿意把人的工作交给 Agent
Founder Park:对公司而言,怎样判断一个 Agent 真的有效?客户为什么会使用它?
吴恺(Airwallex):我会用一个 2×2 矩阵来理解 Agent 的成功。一个维度是执行能否形成闭环,另一个维度是智能是否构成瓶颈。
最理想的情况是,执行能够闭环,同时智能是主要瓶颈。AI Coding 是最典型的例子,系统可以完成整个执行闭环,最终交付代码,效果主要取决于智能水平。全世界都在寻找下一个像 AI Coding 一样有吸引力的用例,但目前还在探索。
第二类场景也是包括 Airwallex 在内的很多公司正在做的,即智能并非瓶颈,但执行可以形成闭环。我把它称为自动化。对账或代表客户完成财务操作,未必需要最前沿的智能,但 Agent 可以完成工作,把整个流程自动化。Agentic Commerce 往往属于这一类。
衡量这类 Agent 的关键,是它能不能端到端完成工作流。90% 和 100% 之间存在巨大差距。如果 Agent 能完成 100% 的流程,采用速度会快得多。Agent 化改造必须渗透到每一个环节。如果最后一公里仍然由人完成,这一步就可能成为整个流程的瓶颈,大幅降低自动化效率。
我还经常思考另一个问题,让 AI 关注那些过去被人忽略的决策,工作流真的会变得更好吗?比如,一个过去每月只复盘一次的决策,现在 AI 可以每天甚至每小时复盘,能不能因此带来实际改善?
最后一类是执行无法闭环,同时智能又是瓶颈。在金融领域,很多操作都是这样,因为我们不希望 AI 对不可逆的操作做出确定性决策。这类产品通常被称为 AI 助手或 Copilot。人仍然要完成一部分步骤,AI 负责协助操作或思考。它们同样有价值,但不会像 AI Coding 那种闭环场景一样具有颠覆性。
Founder Park:Bill,你用什么指标判断客户成功?
Bill Cao(易点天下):行业变化太快,不同阶段对成功的定义也不一样,六个月后可能就会完全变化。
目前,我们的目标是构建一个从识别、诊断、执行到评估的完整闭环。现在的瓶颈是评估,因为必须考虑风险。我们虽然不是金融科技公司,但如果 Agent 超支了广告主的预算,同样会造成严重问题。
评估环节目前仍然需要人提供输入,为 Agent 补充上下文。所以,我现阶段对成功的定义,是从识别到评估形成完整闭环,同时把评估阶段所需的人工输入降到最低。
另一个维度是行业层面的价值。随着越来越多企业开始采用 Agent 和 Agentic 工作流,怎样推动我前面提到的 Agent 对 Agent 网络的形成,是整个行业需要面对的问题。我们希望把自己在 AI Agent 上的实践经验带给行业,成为这个方向的先行者——这也是我定义成功的一部分。
Eileen Weng(Ateve):我们服务很多 B 端企业客户,会通过几项标准判断一个 Agent 是否真正完成部署。
第一,Agent 是否在真实业务流程中运行,而不只是一个 Demo,必须在生产环境中解决真实问题。
<