**导读:**AI / Agent 时代,数据平台的变化同时发生在数据、算力和训练范式上:数据从结构化、半结构化扩展到图片、视频、文本等多模态数据;计算从单一 CPU 转向 CPU + GPU 异构分布式;企业模型工作逐步转向基于私有数据的后训练。传统数据工程强调确定性和长期稳定,AI 系统则需要持续收集数据、观测结果和反馈,再进入下一轮训练与运行。
数据处理、模型训练、在线推理和 Agent 运行因此需要在同一条链路上衔接。AI DLC 围绕支持异构、AI 原生开发、数据算力同底座、面向 Agent 进化四项设计,完成计算范式、引擎能力、元数据系统和 Agentic 能力升级。
从确定性数据工程到持续迭代的AI链路


传统数据系统以 SQL、ETL 和数据服务的稳定运行为主要目标:开发产出结构化表,分析通过 BI / OLAP 回答"发生了什么",服务侧强调 API 上线后的稳定性。AI 场景中,开发扩展到 Python-first 的异构计算 pipeline,产物增加了可训练语料、Agent 轨迹、记忆与上下文;分析侧加入特征工程和后训练;服务侧扩展到 MaaS、在线推理和 Agent Runtime。开发、分析、服务由相对独立的环节连接成持续迭代链路。

对应的平台能力包括四部分:CPU / GPU 与多模态数据的统一纳管;面向 Python 和分布式框架的 AI 原生开发环境;训练、分析、推理共享数据与元数据;Agent 运行产生的轨迹、记忆和反馈能够沉淀并回流到后训练。

资源层将 CPU / GPU 抽象为统一资源池,并通过资源包、资源组封装底层集群。任务按工作负载动态分配资源,支持自动扩缩、滚动升级和故障自愈;Serverless 模式按任务或时长使用资源,减少固定集群运维和资源预留。
存储侧按 AI 全生命周期组织:训练阶段承接多模态数据、模型权重和 Checkpoint 的高吞吐加载;推理阶段处理 KVCache、Embedding 等低时延状态;Agent 的轨迹、记忆和产物就地留存,并可回流为下一轮语料。统一资源和存储底座使上层 Spark、Ray 与 Agent Runtime 无需分别处理硬件和数据格式差异。
Spark+Ray:统一数据处理、后训练与推理

腾讯云智能数据湖计算 AI DLC 采用 Spark + Ray 的双引擎路径,两者分别承接适合的数据并行和任务并行工作负载,同时共享资源、数据与治理体系。

Spark 负责结构化与半结构化数据处理,包括表 Join、聚合、清洗、数仓建设、特征工程、数据准备和 Spark MLlib 等任务;Ray 负责多模态数据处理、大模型 SFT / RLHF / RL、在线推理、Agent Runtime、强化学习和复杂计算。两者通过统一元数据、存储和内存格式互换衔接,形成"Spark 数据准备 → Ray 训练 / 推理"的连续流程,并统一权限、配额、日志、指标与追踪。

Ray 侧由 TCRay 承接企业级运行。应用层覆盖多模态数据处理、传统机器学习、大模型 SFT、强化学习和 GenAI 应用,支持 Jupyter、VSCode、Web Shell、CLI、SDK、REST API 等接入方式。内核层增强 Ray Data、Ray Train、Ray Serve 和 Ray Core,包括向量化与 JIT 优化、读数优化、Checkpoint 容错恢复、Worker 故障重启、动态扩缩、流量弹性伸缩、服务滚动升级、对象存储优化和分布式调度。

平台层统一提供作业与集群管控、CPU / GPU 拓扑感知和 Gang 调度、Spot 实例、模型与镜像分发、高性能网络、存储与元数据集成、租户隔离与 RBAC 权限,以及日志、监控、告警、Profiling 和 Tracing,将资源管理、容错、可观测和运维能力纳入同一体系。
Spark 完成数据清洗和特征生成后,可直接进入模型后训练。训练既支持通过选择数据集完成定制,也支持在数据实验室中以 Job 方式提交分布式作业。数据实验室封装 Ray 资源,并集成 VSCode、Jupyter 等开发入口,可统一查看集群节点、日志和监控。
训练完成后,模型进入模型仓库并部署为在线推理服务。部署可选择 CPU 或 GPU 资源,保留 Head / Worker 等开源概念,并提供高级参数。服务运行后统一提供访问地址、部署信息、节点日志、在线调试,以及请求状态、延迟、CPU / GPU 使用率、GPU 缓存利用率等监控。
Xpark+Meson:多模态与结构化计算分别优化
引擎层分别面向多模态 AI 处理和结构化数据计算进行优化。
Xpark 基于 Ray 构建,向上提供 SQL(AI Function)、Jupyter Notebook 和 Python Client;接口层包括 DataSet API、DataFrame API 和 AI API,算子层覆盖多模态算子、LLM Function 和 ML Function,底层 Runtime 为 TCRay,存储可接入 TCLake、HDFS 和 COS。SQL 和 Python 可以直接编排多模态与 LLM 流水线。
测试数据显示,Xpark 相比开源 Data-Juicer 的推理吞吐提升 3 倍,GPU 资源利用率长期稳定接近 100%;CPU / GPU 协同调度采用 Zero-Copy 与 Ray Data 任务并行,并提供 50+ 多模态 / LLM / LM 算子。

视频抽帧任务中,先创建数据实验室和 Ray 集群,将代码持久化到 COS,选择资源包、资源组和 Xpark Ray 镜像,再设置 Head / Worker 节点及自动弹缩范围。任务从对象存储扫描视频,由 Xpark 分布到多个 Ray 节点执行抽帧,关键帧写回对象存储,后续继续进入标注、视觉模型训练、再训练和 Serving。
结构化数据由 Meson 向量化引擎承接。1TB TPC-DS 对比中,Spark on Meson 端到端查询分析性能为社区 Spark 的 3.6 倍,q23、q24、q64、q78 等计算密集型查询最高加速 5 倍,CPU 使用率由 80% 降至 40%;Meson 已稳定支撑 100+ 客户生产作业。其 API、SQL 语法、UDF 和生态组件与 Spark 兼容,并支持原生增量计算。上述性能数据来自 1TB TPC-DS 的社区 Spark 与 Spark on Meson 对比,生产环境实际收益以具体 workload 为准。

TCLake:统一Data+AI元数据与全流程血缘
Spark、Ray 共享计算底座后,数据对象、模型对象、训练状态和推理服务还需要统一管理。TCLake 将数据对象与 AI 对象纳入同一元数据层。
统一元数据覆盖数据加工、特征工程、模型训练和模型服务。数据加工管理表、文件、Topic、作业状态和数据质量;特征工程管理特征集、版本、血缘和统计;模型训练管理模型、版本、训练作业、Checkpoint、超参数和指标;模型服务管理服务端点、推理日志、Agent 轨迹与记忆。

TCLake 提供统一纳管、直接注册、端到端治理和多引擎接入。引擎主动注册元数据与运行状态,访问控制、审计、发现和血缘追踪贯穿数据到模型链路,Spark、Ray、Xpark、Meson 等引擎统一接入。模型可关联训练数据集和推理服务,形成从数据加工到模型服务的连续血缘。
面向Agent进化:运行闭环与外部调用
Agentic 能力包含两条路径:客户 Agent 运行在平台上并持续迭代,外部 Agent 通过标准接口调用平台能力。

Open Engine 承接客户 Agent。Agent 接入后,平台拉起 GPU 资源和 Agent Runtime,持续采集运行轨迹、记忆与反馈,经过数据处理和特征提取后,由 Ray Train 发起后训练,结果重新入库并反哺 Agent。Trace 数据可直接发起后训练任务,底层执行 Ray Train,训练完成后自动入库,形成"运行---采集---处理---训练---再运行"的闭环。


平台同时通过 MCP、Skills、SDK 和 Open API 对外提供能力,WorkBuddy、CodeBuddy、Claude Code 等 Agent 可直接调用。示例中,用户以自然语言创建 Ray 或 Spark 任务;WorkBuddy 还可分析慢任务并生成优化建议,或对 orders 表执行数据导出并生成数据看板。平台交互由控制台操作扩展到自然语言驱动。


TCInsight 用于平台自身的智能自治,覆盖自感知、自诊断、自处理和自复盘,并包含自主调优 Agent、自主运维 Agent、预测治理 Agent。Agent 可参与资源规划、智能迁移、日常管控和运维调优。阶段性结果包括资源降低 15%、根因定位时间从 4.5 小时缩短到 30 分钟,相关成果标注为 VLDB 2025 收录。
结语:让数据、算力、模型与Agent形成闭环
从数据处理到 Agent 运行,腾讯云智能数据湖计算 AI DLC 的四项升级共同指向一条连续链路:Spark 与 Ray 协同计算,Xpark、TCRay、Meson 分别承接不同工作负载,TCLake 统一元数据与血缘,Open Engine 和 MCP / Skills / SDK 承接 Agent 运行、反馈与调用。

2026 年下半年,规划继续围绕产品演进、客户共建验证、数据核心资产和开放生态推进,并在生产环境中验证上述链路。平台建设重点保持在数据、算力、模型和 Agent 的统一流转,以及运行数据向后训练和下一轮服务的持续回流。