核心事件:国产Data Agent方案登顶国际 benchmarks

OceanBase团队提交的Data Agent方案(内部代号Scout)近日登顶国际数据智能体基准Data Agent Benchmark(DAB),以90.62%的准确率位列第一,成为该榜单首个准确率突破90%的参评方案。相关技术能力后续将沉淀至OceanBase DataPilot产品。
关键硬信息如下:
- 评测结果:准确率90.62%,排名第一
- 底层模型:国产大模型GLM-5.2
- 数据库底座:国产数据库OceanBase
- 方案代号:Scout
- 能力迁移:将融入OceanBase DataPilot产品
技术细节:从理解数据到验证答案的完整闭环
DAB基准由加州大学伯克利分校EPIC Data Lab与Hasura PromptQL合作推出,覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等多个领域,并涉及PostgreSQL、MongoDB、SQLite、DuckDB等多种数据库。
与传统Text-to-SQL仅测试AI将自然语言转为SQL的能力不同,DAB更关注AI在真实数据环境中的端到端任务完成能力。一个完整任务中,Data Agent需执行以下环节:
- 数据理解:识别字段含义与数据关系
- 数据选择与规划:根据任务复杂度规划分析路径
- 查询计算执行:完成数据筛选、关联与聚合
- 结果验证与修复:通过证据追踪校验计算过程,发现问题时调整方案并重新验证
该方案内部流程围绕"数据理解—规划执行—验证修复"闭环构建:
- 通过DataLens构建数据画像,识别字段和数据关系
- 根据任务复杂程度动态规划执行路径
- 得到结果后启动证据追踪与答案校验机制
意 external surprises:国产模型组合超越海外大模型方案
此次评测结果的关键意外点在于:在底层模型采用国产GLM-5.2的情况下,OceanBase方案最终超过了多项基于GPT、Claude Opus、Claude Fable等海外模型构建的Data Agent方案。
这验证了Data Agent的综合能力不取决于单一模型的"出身",而在于"模型+Agent+数据系统"三者的协同水平——模型负责理解和推理,Agent负责规划和执行,数据系统支撑数据发现、关联计算和结果校验。三者缺一不可。
行业意义:数据库向AI数据平台演进
随着AI Agent成为新的数据使用者,数据库的角色正在发生本质变化。过去,数据库只需负责存、算、取;如今还需帮助AI理解数据、组织数据并完成分析。OceanBase此次登顶 DAB,标志着其从"把数据交给AI"向"帮助AI把数据用起来"的转型路径获得外部验证。
AI时代的数据底座,正从被动响应走向主动协同,从存储引擎升级为数据工作引擎。
读者落地建议
- 适合谁用:企业数据团队若需构建复杂数据分析流程、对数据验证与错误修复有较高要求,可关注OceanBase DataPilot后续产品化进展
- 建议再等等:若仅需基础Text-to-SQL轻量查询能力,当下已有成熟方案;本次突破更适合追求端到端自动化分析闭环的中高阶场景
写在最后
一次评测成绩无法代表全部实战能力,但DAB结果清晰传递了技术范式转向:Data Agent的价值不在于单点模型的参数规模,而在于整个数据系统的协同精度与可靠性。国产技术栈在这一新赛道上已展现出系统级整合潜力。
