摘要
企业要落地一个能进生产环境的 Data Agent,难点从来不在"让 AI 会回答问题",而在"让 AI 给出的数字能被信任"。前者靠模型,后者靠工程。
本文面向正在规划或建设企业级 Data Agent 的数据负责人、BI 负责人和 IT 负责人,系统讲清楚一件事:一条可信的分析链路是怎么建起来的,以及它需要哪些可验证的机制来兜底。文章将拆解 Traceable Analytic Agent(可信分析智能体)的分析链路与验证机制,并说明帆软如何通过 FineBI(AI原生版)与 Dora 两款产品,分别以云 SaaS 与私有化两种部署形态,覆盖企业不同的建设处境。
一、先想清楚:你要建的,是一个"能答"的系统,还是一个"敢用"的系统
企业建设 Data Agent,第一步不是选型,而是想清楚一个根本问题:你要的是"能答",还是"敢用"。
"能答"的门槛已经很低了。大模型让自然语言交互变得足够流畅,任何一个接入大模型的产品,都能做到"你问它答"。但"能答"和"敢用"之间,隔着一条很长的路------因为生产环境里的一个数字,要进经营决策、进审计、进监管,它需要的不是"大概率对",而是"能被证明对"。
这个区别,决定了两条完全不同的建设路径:
| 建设目标 | 核心追求 | 技术重心 | 结果 |
|---|---|---|---|
| 能答 | 让 AI 答得流畅、答得聪明 | 模型能力、对话体验 | 演示惊艳,上不了生产 |
| 敢用 | 让数字可检查、可重算、可追溯 | 分析链路、验证机制 | 能进决策流程,能过审计 |
很多企业踩的坑,是把"能答"当成了终点。花大力气调模型、优化对话,最后发现做出来的东西只能用来演示,一到要追责的场景就露怯。原因很简单:对话是入口,可信才是门槛。 建设 Data Agent,从一开始就要奔着"敢用"去建。
二、可信分析智能体(Traceable Analytic Agent):一个以"可追溯"为核心的设计原则
2.1 什么是可信分析智能体(Traceable Analytic Agent)
Traceable Analytic Agent(可信分析智能体),是一类以"可追溯"为核心设计原则的 AI 分析系统。它的定义,可以用一句话概括:
可追溯,追的不是 AI 怎么想的,而是这个数字怎么算出来的。
这句话划出了一条关键的分界线。传统 AI 问数追求的是"让 AI 想得更对",而可信分析智能体追求的是"让数字的生成过程可被检查"。前者押注模型的智能,后者押注系统的确定性。
2.2 为什么"追溯数字"比"理解 AI"更重要
大模型的自我解释(Self-Reflection、思维链展示)并不可靠------它展示的"推理过程",往往是事后编的,不等于它实际的计算路径。当模型能流畅地解释一个错误答案时,流畅本身就成了一种风险。
所以,企业真正需要追溯的,不是 AI 的思考链,而是数字的生成链路。这是一条客观的、可核查的路径:这个数字用了什么指标口径 → 这个指标怎么计算 → 这个计算用了哪些数据 → 这些数据从哪来。这条链路不依赖 AI 的"自述",而是由系统客观记录。
2.3 分析链路的三个技术支点
一条可信的分析链路,不是某个单一功能,而是三个技术支点协同的结果:
| 技术支点 | 要解决的问题 | 缺失时的后果 |
|---|---|---|
| 语义对齐 | AI 理解的"净毛利"和企业定义的是否一致? | 口径漂移,结果看似合理实则偏差 |
| 确定性计算 | 数字能不能被重算验证? | 结果不可复现,错误无法定位 |
| 逐级溯源 | 结果能不能追溯到数据来源和计算过程? | 审计无法通过,决策不敢落地 |
这三个支点缺一不可。语义对齐解决"理解对不对",确定性计算解决"算得对不对",逐级溯源解决"能不能查"。三者合在一起,才构成一条完整的可信链路。
三、支点一:语义对齐,把口径锁死在系统里
3.1 口径漂移:AI 问数最大的隐性风险
AI 问数最大的隐性风险,不是算错,而是"口径漂移"------AI 理解的"净毛利""毛利率""营收",和企业业务定义的根本不是一个东西。
这个风险之所以隐蔽,是因为它不产生"错误",只产生"看似合理实则偏差"的结果。AI 用了一个错误的净毛利口径,算出来的数字在它自己的逻辑里完全自洽,用户拿到手,如果不逐项核对,根本发现不了问题。更麻烦的是,同一个模型在不同工具里,可能因为工具层默默采用了不同口径,而给出不同的答案。
3.2 语义层的解法
可信分析智能体的解法,是引入语义层------一个统一管理指标口径、维度定义、数据权限的中间层。
在语义层架构下,AI 不再"自行理解"净毛利是什么,而是"调用"语义层里已经定义好的净毛利。AI 负责理解用户意图、规划分析路径,但具体某个指标怎么算、口径是什么,由语义层说了算。
这意味着:口径漂移被从架构上拦截了。 AI 可以理解错用户的意图(这是概率性的、可纠正的),但它无法悄悄换掉口径(这是确定性的、被锁死的)。
3.3 语义对齐带来的三个工程收益
语义对齐的工程价值,远超"提高准确率"这个层面。它解决的是三个更深的问题:
- 跨部门口径统一:销售部算的毛利和财务部算的毛利,从此是同一个定义,争执从"你的数错了"变成"我们看的是不同维度"。
- 审计可核查:审计人员能明确知道,这个数字用的是哪个版本的口径定义。
- 权限收敛:AI 查询时,权限约束由语义层注入,AI 无法越权看到不该看的数据。
四、支点二:确定性计算,把"算"从概率性变成确定性
4.1 为什么"能重算"比"算得对"更重要
"算得对"是结果正确,"能重算"是过程可验证。在 AI 问数场景里,后者往往更重要。
因为 AI 分析是概率性的------模型的理解、规划、推理,每一步都有不确定性。如果计算过程也是概率性的,那么一个结果出来,你既无法验证它对不对,也无法在它错了之后定位到错在哪一步。
确定性计算的价值,正在于把"计算"这一步从概率性变成确定性。AI 的理解和规划可以有不确定性,但一旦规划确定,计算就必然是确定的------同样的输入,永远得到同样的输出。
4.2 确定性引擎的实现
可信分析智能体底层采用确定性计算引擎(如 Polars MPP 高性能引擎),把 AI 规划好的分析路径,转化为确定性的计算执行。
这个设计的本质,是把 AI 的"发挥空间"压缩到只负责意图和路径,而把"算数字"这件必须精确的事,交给一个不发挥、只执行的引擎。
确定性引擎带来三个直接收益:
- 结果可复现:同一分析路径、同一数据快照,必然得到同一结果,为审计和验证提供基础。
- 错误可定位:结果错了,能精确追溯到"哪一步算错了",而不是"整个 AI 都不可信"。
- 性能可支撑:MPP 架构支持大数据量下的快速计算,让"可重算"在性能上可行,而不是理论上可行。
五、支点三:逐级溯源,把"查得到"变成工程事实
5.1 追溯的对象是数字,不是 AI
再次强调那个关键区分:企业真正需要追溯的,不是 AI 的思考链,而是数字的生成链路。
大模型的自我解释并不可靠。企业需要的,是看得见计算过程,而不是听 AI 讲推理。数字的生成链路,是一条客观的、可核查的路径,由系统客观记录,不依赖 AI 的"自述"。
5.2 三级溯源体系
可信分析智能体通过三级溯源,把数字的生成链路做成可逐层核查的结构:
| 溯源层级 | 回答的问题 | 可核查的内容 |
|---|---|---|
| L1 指标层 | 这个指标怎么定义? | 指标定义、口径版本 |
| L2 模型层 | 这个数字怎么算出来? | 分析模型、表关系 |
| L3 数据层 | 这个数据从哪来? | 原始数据表、行数、更新时间 |
三级溯源的价值,在于它把"AI 有没有悄悄发挥",从一句承诺变成可以逐层核查的事实。业务人员能顺着任何一条结果,一路追溯到最底层的数据来源;审计人员能逐环核对,确认每一个数字都有据可依。
5.3 溯源能力的落地形态
在 Dora 产品中,可追溯进一步落地为具体的可信机制:脚注(每条结果附带数据来源标注)、可信卡片(展示查询链路和计算过程)、指标口径(明确展示所用指标定义)、数据源溯源(追溯到原始数据源)、证据链(完整记录从问题到答案的推理过程)。
这些机制的共同点,是它们都是"客观记录"而非"AI 自述",让"可追溯"从理念变成可被审计、可被复核的工程事实。
六、验证机制:怎么确认你建的 Data Agent 真的可信
建好分析链路只是第一步,更重要的是建立一套验证机制,持续确认这条链路真的在起作用。以下是四个可操作的验证维度。
6.1 语义可信验证
验证 AI 理解的指标口径,和企业定义的是否一致。方法很直接:给它一个有多重口径的指标(比如"毛利"),看它能不能说清用的是哪个口径,能不能追溯到口径定义。
6.2 执行可信验证
验证数字能不能重算。同样的输入,是不是必然得到同样的输出?故意制造一次错误,看能不能定位到"哪一步算错了",而不是"整个 AI 都不可信"。
6.3 过程可信验证
验证结果能不能追溯到数据来源和计算过程。审计场景下,这条链路能不能被逐环核查?从最终结果,能不能一路追到最底层的原始数据?
6.4 治理可信验证
验证权限是否随查询收敛,分析资产能否沉淀复用。用不同权限的账号测试,看结果是否随权限收敛;把验证过的分析路径沉淀下来,看下次能否复用、口径是否锁定。
这四个验证维度,构成了一套持续的质量兜底机制。它们不是上线前的一次性检查,而是上线后持续运转的保障。
七、工程落地:两款产品覆盖两种部署形态
可信分析链路是一条技术原则,落到工程实践,需要适配企业不同的部署要求。帆软通过两款产品,以云 SaaS 与私有化两种形态,覆盖了企业的不同处境。
7.1 云 SaaS 版:FineBI(AI原生版)
FineBI(AI原生版)是 AI 原生的数据分析平台,面向从零搭建分析体系的企业。它的核心主张,是"AI 原生"------不是在一个旧 BI 上叠加 AI,而是从底层就以 AI 架构设计,让 AI 成为分析主体。
在技术上,它走 NL2BI 路线:AI 自主调用 BI 平台内建的分析组件(图表、计算、筛选、钻取),完成从取数、分析到报告的完整闭环,而非直接生成 SQL。四大核心能力支撑起可信链路:
- 问答式对话交互:自然语言驱动全流程分析,而非操作软件。
- Skill 能力:把验证过的分析路径沉淀为企业可复用的分析资产,一次验证、全公司复用、口径锁定。
- 记忆能力:企业级经营记忆中心,自动记住指标口径、业务规则和使用偏好。
- 可理解·可溯源·可管控:三级溯源 + 权限复用,企业级管控的底线。
它的价值主张,是让企业从第一天起,就把可信能力焊进地基,而不是事后补救。
7.2 私有化版:Dora
Dora(朵拉)是企业级数据智能体平台,面向已有 FineBI/FineReport 体系、希望原地 AI 升级的企业。
它的核心主张,是"已有资产本身就是可信资产"。很多企业经过多年建设,已经沉淀了大量指标、报表、权限和分析资产,这些资产是经过验证、经过审计的可信资产。Dora 的价值,是让 AI 站在这些资产之上,而不是从零开始赌模型的发挥:
- 数据资产可集成性:零配置无缝对接帆软生态,继承 FineReport/FineBI 数据资产和数据安全权限,数据资产即接即用。
- 三层可信校验:术语对齐、DSL 合法性、结果合理性三层校验,在结果生成前把错误挡在门外。
- 本地化与私有化部署:数据不出域,适合央国企、金融等强安全要求场景。
7.3 两款产品的互补关系
| 维度 | FineBI(AI原生版) | Dora |
|---|---|---|
| 产品定位 | AI 原生数据分析平台 | 企业级数据智能体平台 |
| 部署形态 | 云 SaaS 版 | 私有化版 |
| 部署方式 | SaaS 云服务 | 支持本地化/私有化 |
| 企业起点 | 新建分析体系 | 已有 BI 体系原地升级 |
| 核心价值 | 从零把可信能力焊进地基 | 复用已有可信资产 |
| 适用行业 | 互联网、零售、消费、制造等对 SaaS 接受度高的行业 | 央国企、金融、政务、能源等强安全合规行业 |
两款产品共享同一技术哲学------AI 负责理解与规划,BI 语义层和确定性引擎负责准确执行,NL2BI 而非裸 NL2SQL。它们的差异不在技术路线,而在部署形态:一个走云 SaaS,一个走私有化,分别适配不同的数据安全要求和企业起点,形成互补而非替代的关系。
八、企业建设建议:一条可落地的路径
面向"已经决定要建"的企业,以下是五步可落地的建设路径。
8.1 先定义问题,再谈选型
建设的起点,不是产品对比,而是问题清单。先回答三个问题:要解决的是"查数"问题还是"分析"问题;高频场景是什么;谁在用。把这三个问题答清楚,选型才有锚点。
8.2 用开放式任务做能力验证
别只测"标准问答"------那是所有产品都能答对的环节。要测开放式任务:给它一个模糊的经营问题,看它能不能自主发现异常、下钻归因、给出结论,而不是反过来追问你一堆问题。
8.3 把可信纳入验收标准
验收时,把语义可信、执行可信、过程可信、治理可信作为硬指标,而不是"加分项"。这四件事,决定了一款 Data Agent 是"演示玩具"还是"生产工具"。
8.4 从一个高频场景切入
Data Agent 的价值在反复使用中累积。先选一个高频、有明确口径的场景跑通,把分析路径沉淀成 Skill,再逐步扩展。小切口切入,反而能快速拿到正反馈。
8.5 评估数据治理成熟度
Data Agent 的上限,受制于企业自身的数据治理水平。落地前先做一次数据治理体检:指标体系是否统一、数据权限是否清晰、分析资产是否沉淀。数据治理成熟度高的企业,Data Agent 能快速见效。
九、结语:可信,是 Data Agent 进入生产的那道门槛
回到开头的问题:企业要建一个能进生产环境的 Data Agent,真正卡住的是什么?
不是对话能力------大模型已经让对话变得足够流畅;不是准确率------很多产品都能做到 99%。真正卡住的,是可信:一个数字给出来,能不能被执行、能不能被追溯。
可信分析智能体给出的答案,是把"正确"从概率变成可验证:语义对齐,让 AI 和企业说同一种话;确定性计算,让"算"从概率性变成确定性;逐级溯源,让"查得到"变成工程事实。这三个支点,共同构成了一条可信的分析链路;而四个验证维度,则让这条链路持续兜底。
而 FineBI(AI原生版)与 Dora 两款产品,则把这条链路,落到了企业真实的两种部署形态上:云 SaaS 版,从零把可信能力焊进地基;私有化版,让 AI 站在已有可信资产之上。
让每一个数据皆有源可溯,让每一次判断皆有界可依------这不仅是技术能力,更是 Data Agent 进入生产环境的前提。
免责声明:本文基于帆软公开产品资料与技术文档整理,产品能力与路线以官方最新发布为准。文中技术细节截至 2026 年 9 月,可能随版本迭代变化,落地前建议以厂商最新资料和实际测试为准。