Featured image of post 支付宝发布 xUI 终端交互引擎:集成 A2UI 声明式框架实现 Agent 服务闭环

支付宝发布 xUI 终端交互引擎:集成 A2UI 声明式框架实现 Agent 服务闭环

支付宝 xUI 技术体系支撑「阿宝」AI 入口,实现多模态通信、生成式 UI 与 GUI 执行能力。

核心事件与技术定位

核心事件与技术定位
核心事件与技术定位|新闻截图

支付宝 AI 端云交互负责人魏凤笛在 AICon 2026 深圳站发布 xUI 技术体系,用于支撑其面向 AI 的入口产品"阿宝"。该引擎并非独立产品上线,而是一套面向 Agent 交互的终端技术架构,覆盖四类核心能力:全双工多模态通信、生成式渲染交互、服务执行技术与多 Agent 生态协同。xUI 的设计目标是将支付宝海量供给(支付、生活、政务服务、小程序等)以对话和 Agent 执行方式提供给用户,解决"用户说一句话,Agent 帮办到底"的工程化挑战。

技术演进路径与关键实现

技术演进路径与关键实现
技术演进路径与关键实现|新闻截图

通信层:早期基于 gRPC 双工通道与 RTC 实现,但 RTC 面向人机通话设计,建连耗时长、多模态扩展困难。团队转向以 MoQ(面向 Agent 交互设计的协议)为主、RTC 为备份、gRPC 兜底的三层网络策略。MoQ 原生支持打断等行为,能复用所有模态数据,使建连耗时与入网卡顿率显著下降。

渲染交互层:经历三代演进:

  1. 流式 Markdown 渲染:利用原生渲染替代浏览器引擎,兼顾流式展示与三端性能;
  2. 流式 HTML 渲染:自研 Web 内核深度优化,支持动态嵌入复杂图表与交互组件;
  3. A2UI 声明式 UI:Google 提出的 UI 交互方案,核心原则是「模型生成任务步骤,工程实现组合组件」,让 Agent 通过 MCP/Skill 将步骤转化为 UI 卡片,用户确认后闭环完成服务,实现从"表达"到"办事"的跨越。

服务执行层:针对无法提供标准 MCP 的服务(如政务、蚂蚁庄园),采用三套执行技术组合策略:

  • GUI Agent:终端内模拟点击操作,融合布局树分解与点击检测,在无系统权限下实现 UI 操作;
  • TUI Agent:将页面结构结构化为文本描述,模型理解后指定功能位置,避免视觉推理开销,速度更快;
  • 固定 Workflow:针对固定动线场景(如搜索固定对象),跳过模型推理直接运行脚本。 关键挑战在于执行成功率需达 90% 以上,实现方式包括:操作前页面稳定性校验、端云协同下的任务中断保护、以及海量小程序理解能力的模型训练闭环。

跨 Agent 协同机制

跨 Agent 协同机制
跨 Agent 协同机制|新闻截图

Ex:用户对手机系统助手说"帮我领蚂蚁能量",助手将任务转交支付宝 Agent 后台完成,用户无需打开支付宝。该模式规避了厂商跨_APP 操作的权限与合规问题,形成"系统助手负责意图理解 + 支付宝负责领域执行"的职责分工。合作方系统级能力(如屏幕采集)比客户端模拟更稳定,错误率更低。

落地建议与适用场景

落地建议与适用场景
落地建议与适用场景|新闻截图

  • 适合立即关注:AI 产品团队、客户端架构师、小程序服务商——A2UI 声明式框架为服务接入提供了标准协议路径,可提前规划 MCP/Skill 对接方案;
  • 建议再观望:希望使用复杂 GUI 自动操作 Service 的开发者——GUI Agent 泛化性虽高,但模型对地方政务类、小程序类 UI 的理解仍在迭代中,需等待 Alipay 开放平台进一步支持;
  • 企业级参考价值:协议分层设计(网络抽象层隔高媒体与传输依赖)为其他多模态应用提供可复用架构范式。

写在最后

xUI 标志着移动端 Agent 从对话响应迈向任务闭环执行的新阶段。其工程价值不在于单一技术突破,而在于系统性整合通信、渲染、执行与协同四大能力,并通过协议解耦与分层抽象应对真实世界的服务异构性——这正是 Agent 落地复杂业务场景的普适难题。