Data Agent Benchmark(DAB)测的是"模型+智能体+数据系统"端到端协同,覆盖 PostgreSQL、MongoDB、SQLite、DuckDB 与金融、生物医学、政务等领域;首个破 90% 的提交用 OceanBase 加智谱 GLM 5.2 大模型组合,Scout 是 OceanBase 这次提交 DAB 的内部代号,仍非上线产品。
OceanBase 团队用代号 "Scout" 的提交,在 UC Berkeley EPIC 实验室与 Hasura PromptQL 联合发布的 Data Agent Benchmark(DAB) 上拿到 90.62% 准确率,成为该基准首个突破 90% 的提交。它击败的对手不弱。榜单上还挂着多套基于 GPT、Claude Opus 的提交,但读这条新闻不能停留在"国产数据库+大模型战胜 GPT/Claude"那句最响的口号上。DAB 测的不是聊天机器人,也不是单纯的 Text-to-SQL;它测的是"模型+智能体+数据系统"这条端到端协同回路,能不能在异构数据源和真实业务领域上跑通理解-规划-执行-验证四步。
DAB 在测什么
DAB 在 2026 年由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 联合发布,覆盖 PostgreSQL、MongoDB、SQLite、DuckDB 四类异构数据源,领域横跨互联网/本地生活、金融/股票、生物医学、知识产权、企业运营、政务/公共、媒体娱乐七大类。它比传统 Text-to-SQL 基准更接近"企业真实数据栈"。每道题要求系统先理解数据 schema 和语义、规划执行路径、跨表/跨库做选择、过滤、连接、计算,再回到证据上自校验答案。整个流程是否闭环,正是 DAB 在打分的事。
Scout 怎么搭的
按 量子位转载的 OceanBase 团队稿件 与 InfoQ 中文站 的复述,Scout 的核心是一个叫 DataLens 的组件先给数据建画像,再规划执行路径,然后做选择、过滤、连接、计算,并把每一步产物挂在证据链上,最后用答案自校验 + 自纠错回路兜底。底层数据库是 OceanBase 本身,大模型用的是智谱系的 GLM-5.2。两者都不是在国际榜单上"刷脸"最多的组合,国产端到端链路第一次在一个有公开提交记录的基准上被量化打分,是这次更值得记的进展。
与 GPT/Claude 提交的对比
同一份榜单上,紧随其后的是用 GPT、Claude Opus 等主流闭源模型搭出来的智能体提交,KuCoin 的快讯 和 凤凰财经 也都把这一对比作为传播点。但"击败 GPT/Claude 系提交"需要被读得更克制。基准里还有一款叫"Claude Fable"的提交,这款在中文 AI 圈识别度很低,命名口径在落地前要核清;榜单上的 GPT 提交往往是通用基线,参数和提示工程未必为 DAB 调过。从结构上看,Scout 的"数据库原生"在 DAB 这种偏 OLAP/跨源查询的基准里本身就吃结构红利。OceanBase 不仅是数据库,还是 Scout 自己的数据底座。
Scout 不是产品
这一点必须挑明。Scout 是 OceanBase 实验室这次提交 DAB 时用的内部代号,GitHub 上的 PR #96 才是公开的提交记录;该仓库 ucbepic/DataAgentBench 同时维护公开排行榜。读者今天拿不到一个叫 Scout 的产品,它的能力要等落到 OceanBase DataPilot 这条 AI 数据分析产品线才算真正上线。落到 DataPilot 的时间点目前官方没有给出。
读这条新闻的三个避雷点
第一,来源是 Ant 集团/OceanBase 团队稿件经 量子位 授权转载,不是独立测评;90.62% 的数字是公司自报。第二,"国产 AI 击败 GPT/Claude"是营销口径,不是结论。单基准、单提交、模型识别度低、对手命名待核,都是缩限条件。第三,GLM-5.2 在中文 AI 圈以外的曝光度有限,写稿时不宜把它当成读者耳熟能详的明星模型。
接下来看什么
OceanBase DataPilot 何时上线 Scout 这套能力;是否有第三方在 DAB 上独立复现 90% 区间的成绩;第一批把这条链路跑进真实客户环境(金融、政务、生物医学)的部署案例何时出现。
DAB 测的是"能不能跑通",企业真正要的是"跑得稳、跑得起、跑得安全"。Scout 拿到的是入场券,不是终局。