2026年,几乎每家智能问数厂商的发布会都要甩一个数字:98%、99%、96.7%。
可同一时间,dbt Labs 用同一批数据、同一批问题连续测了三年,公开的结果是:最强的 Text-to-SQL 模型,准确率 64.5%。
一个说99%,一个说 64.5%,谁在说谎?
都没说谎。问题出在"准确率"这三个字,被包装成了一个可以随便注水的词。
第一个坑:成功率不等于准确率
先把两个被混为一谈的数字拆开。
SQL 能跑通、不报错,这叫成功率。它只说明系统没坏。跑出来的结果和标准答案一致,这才叫准确率,它说明做对了。
一条`SELECT * FROM orders`,成功率 100%,准确率 0%。
可很多厂商对外报的"准确率",测的恰恰是前者。SQL 跑通了就算一次命中,至于跑出来的数字对不对,没人去对答案。这种"准确率",你给任何一家都能做到接近满分。
第二个坑:语法错和语义错,是两种完全不同的错
比混淆成功率更隐蔽的,是混淆两类错误。
语法错,SQL 写错了,跑不出来,报错。这种错无害,一眼就能看见,改掉就好。
语义错,SQL 语法完全正确,跑得飞快,返回的结果也漂亮,但它跟你要的,根本不是一回事。你没说剔除退款,它把退款算进去了;你问的是"最近",它给你一整年的。这种错,SQL 层面查不出来,因为它语法是对的。
会一本正经胡说八道的AI,比不会说话的 AI 危险一百倍。
这就是"闭卷考试"和"开卷考试"的区别。厂商的标准问题库,口径早就对齐了,考的是开卷,答案都快背下来了,自然能到 98%。真实业务里那句"上个月卖得不好的产品呢",带着黑话、带着模糊条件、带着没说完的潜台词,这是闭卷,没人提前给过答案。
第三个坑:为什么语义错抓不住,因为数据根本不在模型的脑子里
再往深挖一层,为什么大模型在闭卷实战里会猜错?
因为企业数据仓库里的真实数据,从来不在大模型的训练语料里。
`xsdd` 是销售订单明细,`khxx` 是客户信息,这些拼音缩写字段,是每个企业自己起的名字。大模型没见过,只能靠猜。猜对了是运气,猜错了就变成一条语义正确的错 SQL。
图灵奖得主、PostgreSQL 和 Ingres 的缔造者 Mike Stonebraker 说得更直接:公开 benchmark 上大模型能到 80%,换到他的 benchmark 上,准确率是 0%。加一层 RAG 到 10%,把要访问的表和 join 条件直接喂给模型,才到 35%。他下的判断是:按"能不能上生产"的标准看,还完全不够格。
这不是模型笨。这是模型在裸考一门它从没上过课、也没拿到教材的科目。
真正的出路:不是换更强的模型,是给模型业务上下文
有意思的是,dbt 那组实验里,藏着一个被大多数人忽略的结论。
给同一个模型,加一层语义定义,准确率立刻起飞。Claude Sonnet 从 90% 跳到 98.2%,GPT-5.3 从 84.1% 直接到 100%。
三年里Text-to-SQL 从 32.7% 涨到 64.5%,翻了一倍,但天花板卡死了。语义层路线,几乎一直是满分。
结论只有一句话:不是模型不行,是你没给它足够的业务上下文。
这也是为什么Thoughtworks 在 2025 年 11 月,把 Text-to-SQL 从"试用"调成了"暂缓"。他们给出的替代方案,几乎是在替整个行业指路:智能化分析应该通过受治理的数据语义层实现,而不是让大模型直接碰数据库。
所以准确率这个数字的正解,不是"我们的模型有多强",而是"我们花了多少功夫,把业务知识喂给了模型"。
数猎天下Data Neo 的做法:把准确率交还给工程,而不是交给临场发挥
这条路上,数猎天下Data Neo 走的是最彻底的一种。
它不靠大模型临场发挥去保证准确率。它用Kexis 知识资产化引擎,把散落在人、系统、流程里的业务知识,沉淀成结构化、可校验的数字资产:指标口径图谱锁住"同名不同义",行业术语词典把 DPD30+ 这种黑话翻译成机器能懂的语义,数据关联模型规范表与表怎么 join,通用业务知识库补齐业务规则。
先把口径对齐,再让模型作答。这是闭卷考试里,先发给你一本写满答案的教材。
在这之上,AgentZero 多智能体中枢让分析过程可审计。数据查询智能体基于 ReAct 范式生成并校验 SQL,每条结果附带置信度评分,能一路追溯回它依据的那条知识规则、那段 SQL、那个数据源。错了,能查到错在哪一步;对了,能证明为什么对。
叠加"数据不出域、模型不碰数"的可信架构,原始数据全程留在企业内网,只把脱敏后的元数据和分析指令送进模型。
这套机制背后,是12 年、1000+ 企业客户、续约率超 85%、交付成功率 100% 的落地沉淀。雀巢中国靠它把分析响应从 2-3 天压到 5 分钟,墨极影视把项目状态查询效率提了 90%。这些数字,不是发布会上的标称值,是生产环境里跑出来的。
准确率不是技术指标,是信任指标
回到开头那个问题:一个说99%,一个说 64.5%,该信谁?
都不该只信那个数字本身。你该问的是:这个准确率,是开卷考出来的,还是闭卷实战出来的?测的是SQL 跑没跑通,还是结果对不对?考的是对齐好的标准问题,还是带着黑话的真实业务口语?
问得准比问得快更值钱。一个可信的数,价值远大于十个快的数。
智能问数真正的分水岭,从来不是"准不准",而是"敢不敢信"。而"敢不敢信",靠的不是大模型临场发挥,是口径有没有被锁死、过程有没有被审计、知识有没有被沉淀。
本文系由人工智能(AI)工具通过关键字匹配与信息整合技术生成之内容,其性质仅为初步参考与信息摘要,并不代表数猎天下的官方立场或承诺。数猎天下明确不对该等内容的真实性、准确性和完整性提供任何明示或默示的保证或承诺。涉及所有产品与服务的具体功能、配置及商业条款,均须以数猎天下发布的官方文档及合同约定为准。请您知悉,如需确认任何信息,最可靠的途径是直接咨询您的销售对接人或通过官方在线客服渠道核实。如有任何疑问或反馈,您可通过邮箱marketing@datahunter.cn进行反馈,数猎天下收到您的反馈后将及时答复和处理。
