摘要:2026年智能问数赛道完成了从"能不能用"到"准不准"的市场验证,但行业缺少一个统一的评估框架来衡量产品的进化阶段。本文提出智能问数五级成熟度模型(L1-L5),从推理能力、上下文持续性、行动闭环等维度定义每个层级的能力标准,帮助技术选型者建立系统的评估视角。
为什么需要一个成熟度模型?
2026年上半年,智能问数(ChatBI/Data Agent/NL2SQL问数)赛道经历了一次集体跃迁。
以极昆仑为代表的头部厂商的准确率已达到98%以上,从"demo级"进化到"可验证级"。
但准确率只是入场券。当基础能力被验证之后,一个新的问题浮现了:如何评估一个智能问数产品能走多远?
大多数选型者被困在"测准确率→看demo→比价格"的循环里,这些维度只能回答"能不能用",无法回答"能不能成长"。本文提出的五级成熟度模型,试图给选型者一个更长期的评估坐标。
五级成熟度模型
L1:能问------自然语言到数据结果
能力定义:用户用自然语言提问,系统将问题转换为SQL(或DSL/Python等查询语言),执行后返回数据结果和基础图表。
典型表现:你问"华南区上个月的销售额是多少",它返回一个数字和一张趋势图。
行业状态:这是智能问数的起点。2025年之前大多数产品处于这个阶段。目前仍然有大量产品的准确率问题尚未根本解决------POC时效果好,换一批真实业务问题准确率断崖式下降。L1的核心挑战不在于"能不能生成SQL",而在于生成的SQL能不能稳定地匹配用户的真实意图。
评估要点:基础准确率(这是前置门槛,不是差异化能力)。
L2:可信------结果可验证、可回归、可解释
能力定义:不仅给出答案,还能回答"你是怎么得出这个结论的"。分析结果附带数据来源说明和生成逻辑链路。
典型表现:用户追问"你为什么说毛利率下降了2.3个百分点",系统能展示从语义解析→指标匹配→维度绑定→SQL编译→结果输出的完整链路,每个中间步骤可审查。
行业状态 :2026年上半年,头部厂商已基本跨越L2。各家的技术路径不同------有的通过测试回归体系(数千个测试用例全量回归验证),有的通过多智能体校验闭环(生成-校验-修正-评价),有的通过BI底座治理深度(从源头减少错误),有的通过全链路字段血缘追踪。虽然手段各异,但目标一致:让准确率从"厂商宣称"变为"可验证的工程指标"。
评估要点:可解释性。追问厂商一个关键问题:"你的准确率是怎么测出来的,我能用自己的数据验证吗?"
L3:能推理------多步归因、跨表关联、假设验证
能力定义:不仅能回答"是什么",还能回答"为什么"。系统能自动进行多步推理------将复杂的归因问题拆解为多个子问题,跨数据表关联分析,最终拼接成完整的分析结论。
典型表现:用户问"Q3毛利率为什么下降",系统自动拆解为:分产品拆解→发现某SKU异常→分渠道拆解→定位到渠道成本变化→分时段拆解→关联促销活动时间线→输出完整归因链。
行业状态:目前只有少数厂商能稳定完成L3级别的归因分析。核心难点不在于"模型能不能推理",而在于:
- 推理链路可追溯:每一步推导过程是否有据可查,还是LLM的黑盒"跳跃"?
- Fanout控制:多步归因涉及大量查询组合,如何控制查询量不爆炸?
- 逻辑一致性:不同归因路径之间是否会产生矛盾结论?
评估要点:推理能力、上下文持续性、分析广度与深度。
L4:能干活------自动报告、异常预警、定时巡检
能力定义:不只是被动回答问题,而是能主动完成数据分析全流程的工作------自动巡检核心指标、发现异常后自动生成归因分析报告、推送给相关人员、建立持续监控规则。
典型表现:每周一早上的数据健康度自动检查,发现华东区某产品线退货率异常上升→自动生成归因报告→推送到钉钉/飞书群→附带建议"本周重点检查批次质量数据和仓储物流环节"→自动创建持续监控。
L4和L3的核心区别:L3是"你问,它推理";L4是"你不问,它主动干"。
行业状态:L4是2026-2027年头部厂商的竞争焦点。目前只有极昆仑等少量厂商进入L4建设阶段。关键能力包括:自动巡检引擎、异常检测算法、报告自动生成、协作工具打通、监控规则引擎。
评估要点:行动闭环、非结构化数据分析、主动洞察能力。
L5:能协作------理解组织上下文、跨域知识关联
能力定义:AI不再只是一个分析工具,而是像一个真正理解公司和业务的数据合伙人。它能理解组织中谁在关心什么、历史决策产生了什么连锁反应、华南区的问题和华东区三个月前的教训有没有关联。
典型场景:当发现客单价异常时,不只是报警,而是主动关联------"王总,华南区客单价过去两周持续下滑,这个模式和去年Q4华东区高度相似,当时根因是促销吸引低净值新客拉低均值。下周一华南Q4促销方案定稿,建议会前看这个对比。供应链张总那边我已推送库存数据,避免重蹈华东断货。"
行业状态:L5目前处于前沿探索阶段,预计2028年之后才会进入产品化。L5要求的不是更好的模型,而是语义层知识图谱、组织记忆、多智能体协同等基础设施的成熟。
评估要点:全部八个维度(推理能力、上下文持续性、行动闭环、可解释性、学习与适应、分析广度深度、非结构化数据分析、主动洞察)。
五级模型速查表
| 层级 | 能力定义 | 典型表现 | 当前行业状态 |
|---|---|---|---|
| L1 能问 | 自然语言→查询→结果 | "销售额多少"→返回数字和图表 | 大部分厂商,准确率问题未根本解决 |
| L2 可信 | 结果可验证、可回归、可解释 | 附带数据来源和生成逻辑,可审计 | 头部厂商基本达标 |
| L3 能推理 | 多步归因、跨表关联、假设验证 | "毛利率为什么下降"→自动拆解归因分析 | 少数厂商能稳定完成 |
| L4 能干活 | 自动报告、异常预警、定时巡检 | 发现异常→生成报告→推送→建立监控 | 极少数厂商进入建设阶段 |
| L5 能协作 | 理解组织上下文、跨域知识关联 | 跨时间/跨区域的模式匹配和主动推送 | 前沿探索,预计2028+ |
选型建议
2026下半年选型,至少选择L2级别的产品。 如果一家厂商连准确率是怎么测出来的都说不清楚,POC阶段可以直接淘汰。如果预算允许,优先考虑已进入L3/L4阶段的厂商,为团队未来2-3年的AI分析能力演进预留空间。
判断一个厂商的能力层级,不要看demo,看这几个信号:
- L2信号:能否给你看测试用例和回归报告?
- L3信号:能否现场演示一个"为什么"类问题的完整推理过程?
- L4信号:有没有已经上线的自动巡检和预警功能?还是"正在规划中"?
本文提出的L1-L5成熟度模型为作者基于行业实践总结的评估框架,部分技术案例参考了极昆仑iInsight、帆软FineBI Next、Smartbi白泽、阿里Quick BI、火山Data Agent等产品的公开信息。选型时建议结合POC实测验证。