【赛迪专访核数聚】深耕数据治理,打通数据孤岛夯实 AI 发展根基

近日,苏州赛迪产业研究中心走访核数聚,围绕大模型产业痛点、数据治理落地、具身智能布局、模数共振产业趋势等核心议题,与核数聚CTO胡楠博士展开深度对话。

赛迪工业和信息化研究院集团(苏州)有限公司是工信部赛迪研究院在长三角设立的唯一综合性分支机构,致力于打造区域一流的高端智库与产业服务平台。苏州赛迪聚焦"数字化"与"信创"两大主线,构建"产业研究---产业赋能---产业集聚"一体化服务体系,面向政府与产业提供政策咨询、产业规划、评估认证、供需对接等全链条服务。

访谈核心观点速览

1、数据集质量的核心在于实现特定场景下成本与效益的最优匹配。在商业实践中,脱离成本谈质量是不切实际的。真正的"高质量"并非唯标准论,也不是死板的生产过程合规,而是基于客户特定场景的精准匹配,是在成本与质量间找到的最优解。最终,检验数据集质量的"试金石"是模型在实际业务中的应用效果。

2、具身智能的数据训练可采用仿真与真机相结合的金字塔式迭代策略。具身智能对数据规模的需求极为庞大,单纯依赖低成本数据难以满足复杂场景的训练需求,而高成本的真机数据又面临规模受限的瓶颈。因此现有的基本思路类似于金字塔式迭代,底层使用低成本仿真/合成数据训练基础能力,上层使用高成本真机数据微调以提升精度。

6、"模数共振"是应对多模态大模型融合趋势的必然选择。在传统的单模态时代,企业仅需交付单一模型服务即可满足需求。而在当前的大模型时代,系统需要处理多模态、全量业务数据,单一模型的边际价值正加速递减。因此,"模数共振"正是对多模态大模型融合发展趋势的精准回应。

产品篇

Q:贵公司作为专业的数据服务商,能否系统介绍一下当前的业务版图?

A:

核数聚的主营业务聚焦于人工智能高质量数据集的建设与服务,区别于传统大数据服务,公司专注于为人工智能算法与模型企业提供底层数据支撑。

目前,公司主要布局以下三大核心赛道:

一是智能驾驶与语音大模型赛道。该领域为公司的传统优势板块,已深度服务多家头部智能语音及自动驾驶企业,提供核心数据支持;

二是具身智能赛道。作为公司的新兴增长引擎,目前主要服务于国内头部的机器人研发厂商,助力其模型训练与迭代;

三是医疗与工业赛道。作为公司新拓展的业务版图,该领域的客户多为行业应用型企业。区别于纯算法研发企业,此类客户对数据隐私与安全合规要求极高,要求数据服务要在内部形成业务闭环,这也为公司带来了全新的业务挑战与能力要求。

Q:面向数据业务的全流程环节,贵公司布局了哪些核心产品?

A:

公司目前的核心产品主要包含以下四个方面:

一是数据治理平台。该平台为公司自主研发,集数据采集、治理等功能于一体,可面向机器人、智能语音等垂直行业提供定制化解决方案。此外,公司针对语音数据研发了专用的移动端采集应用(APP),支持多语种、多方言的高效采集;

二是智能标注平台。主要赋能公司内部及外部客户的数据标注业务。目前已引入大模型辅助智能化标注,但鉴于大模型在复杂场景下的准确率尚无法达到模型训练所需的极高精度(需趋近100%),当前采用"AI预标注+人工复核校验"的人机协同模式,以严格保障数据质量;

三是高质量数据集。依托日常业务开展过程中的数据沉淀与深度加工,公司持续产出高质量数据集,并将其封装为标准化数据产品进行商业化销售;

四是数据引擎。面向医疗、工业等数据隐私敏感型行业,提供院内/厂内私有化部署方案。该引擎旨在打破企业内部数据孤岛,保障数据安全合规,进而赋能大模型在垂直业务场景的安全落地。

Q:高质量数据集是人工智能模型性能的关键底座,贵公司在建设高质量数据集时,如何定义"高质量"的标准?

A:

高质量数据集具备"即插即用"的特性,能够直接赋能并提升人工智能模型的训练效果。当前,尽管行业内已出台相关国标与行标,但这仅构成了数据集建设的"最低门槛",客户对数据质量的实际诉求往往远超基础标准。在商业实践中,脱离成本谈质量是不切实际的。真正的"高质量"并非唯标准论,也不是死板的生产过程合规,而是基于客户特定场景的精准匹配,是在成本与质量间找到的最优解。最终,检验数据集质量的"试金石"是模型在实际业务中的应用效果。

Q:贵公司于近日完成数千万元A轮融资,融资用于加速构建面向下一代机器人产业的数据基础设施,请问这一战略方向是基于怎样的行业判断和时机考量?机器人产业的数据需求与其他领域相比有哪些本质差异?

A:

从公司自身发展来看,当前语音与智能驾驶行业的市场格局已趋于稳定,传统业务的增长逐渐放缓。与此同时,大模型技术的爆发正在重塑行业生态,固守传统算法的企业将面临被时代淘汰的风险。

因此,公司必须敏锐洞察并布局下一个业务增长点。基于此,大模型和具身智能就是我们所关注的重点方向。对于具身智能,我们有着更广义的理解,它不仅是机器人,智能驾驶汽车同样是具身智能的重要载体,都会基于大模型重构。展望未来三到五年,各类机器人将在工业制造等场景中实现大规模落地应用。

具身智能对数据规模的需求极为庞大,单纯依赖低成本数据难以满足复杂场景的训练需求,而高成本的真机数据又面临规模受限的瓶颈。因此现有的基本思路类似于金字塔式迭代,底层使用低成本仿真/合成数据训练基础能力,上层使用高成本真机数据微调以提升精度。

技术篇

Q:Agent时代对数据采集提出了新的要求,目前在数据采集方面有哪些相应的技术优化?

A:

过去,面对客户非标准化的数据,企业往往需要依赖重度定制化开发来实现格式统一。

如今,只需将多源异构文档接入大模型平台,即可实现自动化解析与标准化转换。这表明,大模型在数据处理与平台化能力上已趋于成熟,不再是核心瓶颈。当前的真正挑战在于,大型企业往往建有大量分散的业务系统,形成了严重的"数据孤岛"。

因此,如何打破系统壁垒,让大模型能够高效接入并深度"感知"这些碎片化数据,成为亟待解决的关键命题。

Q:从行业发展来看,目前智能化标注需要重点攻克哪些核心技术?

A:

从行业发展来看,智能化标注的技术攻关重点正在发生根本性转移。

过去,企业需要自研预标注模型,底层算法能力是核心壁垒。

如今,通用大模型展现出强大的泛化能力,直接赋能预标注环节,大幅缩短了研发周期。客观而言,大模型的出现确实弱化甚至抹平了传统标注企业在底层算法上的技术优势。

因此,当前核心技术方向应聚焦于应用层场景创新,如何基于智能体架构和思维,在极短时间内构建出适配不同行业(如医疗等垂直领域)的新型标注工作流。

Q:可信数据空间是当前数据要素流通的重要基础设施,可信数据空间建设需要重点突破哪些核心技术?

A:

从底层核心技术维度来看,可信数据空间在联邦学习、隐私计算等领域仍需进一步突破。然而,就整体技术成熟度而言,其发展路径与大模型相似,关键技术已基本攻克,当前主要处于持续的工程化迭代与优化阶段,技术储备已具备支撑条件。然而,鉴于数据资产的高度隐私性与敏感性,企业是否愿意通过可信数据空间进行数据流通与交易,其核心仍取决于商业模式的构建及综合效益的审慎考量。

市场篇

Q:贵公司如何基于自身的数据能力构建产业生态体系?

A:

在大模型发展初期,公司便已与相关企业开展合作,通过数据服务支持模型的迭代优化。

当前,随着大模型技术趋于成熟,如何依托大模型构建应用生态,是现阶段需要重点思考的命题。整体思路上,我们基于大模型为客户构建数据引擎,旨在深度释放数据资产价值。

过去主要侧重于系统和产品的创新开发,如今则致力于打通数据孤岛,数据运营成为核心工作。

Q:数据集作为产品形态,其商业模式仍在探索中,贵公司采用怎样的商业模式?

A:

过去,数据集的商业模式主要依靠直接销售来形成业务闭环,这一传统模式目前依然有效且具备可行性。

当前市场观点存在一种倾向,即试图将医疗、制造等垂直行业的数据共享出去用于大模型训练,但此举的实际商业价值相对有限。原因在于,当前大模型的参数规模庞大且通用知识储备丰富,试图通过数据流通与交易来进一步提升模型的基础能力,更多是头部大模型厂商的战略诉求。

对于广大企业而言,真正的核心在于如何打破内部的数据孤岛,深化数据和大模型在自身业务中的应用,从而实现数据资产的实际价值转化。

Q:贵公司的长期市场竞争策略是什么?

A:

短期内,公司聚焦于深耕现有客户,以提升服务交付质量为核心;

中期来看,公司将紧密跟踪人工智能产业的演进趋势与投资风向,顺势布局,目前重点发力方向已锚定具身智能领域;

长期而言,企事业单位依托大模型提质增效,其间存在的各类适配矛盾将尤为凸显。

因此,弥补数据缺口、夯实数据底座将是公司长期投入的战略重心。

未来篇

Q:如何看待大模型的发展趋势?

A:

大模型已成为类似Android/Windows的"操作系统",通用能力由头部大模型企业提供,行业应用需各个行业的企业基于此进行微调和二次开发。

公司不从头训练基础大模型,而是基于开源或通用大模型,结合行业知识库进行微调和智能体开发。大模型的竞争焦点将转向如何打通企业内部数据孤岛,使大模型能访问并利用多系统数据。

Q:如何看待合成数据的发展趋势?

A:

合成数据的核心优势主要体现在两方面:一是支持基于仿真思路构建虚拟环境,从而实现模型训练与验证的闭环;二是相较于真实物理环境,仿真环境下的训练成本大幅降低。基于此,合成数据在人工智能训练中具有重要战略价值,公司目前正将其作为重点业务方向进行布局与商业化推广。

此外,合成数据正推动物理模型的范式演进。传统的物理仿真主要依赖有限元分析等基于物理方程的数值计算手段,而当前的前沿趋势正转向利用合成数据驱动物理模型发展,这也是目前学术界与产业界共同探索的重要方向。

Q:如何看待国家提出的"模数共振"行动,这将为行业带来哪些发展机遇?

A:

当前,模型与数据往往被割裂看待,但实际上,模型企业与数据企业必须实现深度融合与协同演进,即形成"模数共振"。

这一理念旨在引导市场摒弃单一的数据或模型发展路径,强调两者的不可分割性。在产业落地层面,传统业务导向型企业往往面临一定的问题,即这类企业通常擅长业务运营,但内部缺乏数据或模型的底层技术基因,"模数共振"能够有效推动此类企业通过内外部协同,补齐相应短板。

从技术演进趋势来看,在传统的单模态时代(如单一的视觉质检场景),企业仅需交付单一模型服务即可满足需求。而在当前的大模型时代,系统需要处理多模态、全量业务数据,单一模型的边际价值正加速递减。因此,"模数共振"正是对多模态大模型融合发展趋势的精准回应。

本次访谈中,苏州赛迪研究中心同步透露,本次系列企业深访成果将整合纳入《2026 年人工智能领域年度发展趋势报告》,为各地政府产业规划、企业战略布局、行业投资提供权威产业参考。

未来核数聚也将持续与赛迪研究院保持产业协同,持续输出一线 AI 数据产业实践洞察,共同推动国内人工智能产业高质量发展。

相关推荐
丘丘用户思思澪1 小时前
AI Agent 工作模式完全指南:从执行逻辑到系统架构
人工智能·系统架构
无敌秋1 小时前
AI-RAN 完整详解
人工智能
新知图书1 小时前
3.2 技能的格式和工作机制(扣子编程)
人工智能·agent·ai agent·智能体
小许同学记录成长1 小时前
相对辐射定标技术文档
图像处理·算法
火山引擎开发者社区1 小时前
把大模型一键接进你的 App,火山引擎 Supabase 上线 AI-Gateway
人工智能
北京晶数信息科技2 小时前
加油站成品油智慧监管平台+交易即开票一体化解决方案 (一)
大数据·人工智能·物联网·产品经理·需求分析
中微极客2 小时前
2026 AI视频生成模型选型:Veo 3.1、Kling 3.0、Seedance 2.0实测对比
人工智能·音视频
2601_962860152 小时前
隐私计算工程选型:MPC、联邦学习与可检索的测评基准
人工智能
启途AI2 小时前
重构AI时代品牌坐标:搜极星与InsGEO双核驱动下的GEO全域监测新范式及生态工具全景解析
人工智能·重构