git4data

MatrixOrigin11 天前
人工智能·aiagent·矩阵起源·git4data
MatrixOne Git4Data 技术详解(十二)·大模型篇:RLHF 偏好数据——分歧、裁决与可复现上一篇我们做了一轮完整的 SFT 数据 curation:在分支上做六步过滤,每步先计数,DIFF 留下审计记录,先登记后快照发布。这一篇沿着大模型的训练链路往下走一步,进入偏好对齐——RLHF / DPO 依赖的那份偏好数据。
MatrixOrigin17 天前
人工智能·矩阵起源·数据底座·git4data
MatrixOne Git4Data 技术详解(十一)·大模型篇:SFT 数据 curation——可审计、可复现的数据清洗前十篇里,我们把 MatrixOne 的 Git4Data 能力从概念一路带到了 AI 训练现场:前四篇建立技术坐标,第五到第七篇是数据运维(误操作救援、多人协作、Write-Audit-Publish),第八、九篇讲传统机器学习(全流程总图、数据集发布与泄漏),第十篇转向深度学习的文件型数据,让 lakeFS 管文件、MatrixOne 管元数据。
MatrixOrigin2 个月前
sql·数据平台·ai-native·矩阵起源·git4data·matrixone
MatrixOne Git4Data 技术详解(七)·数据运维实践篇:Write-Audit-Publish——给 ETL 流水线装一道发布门禁数据流水线有一个老大难问题:上游来的数据,质量不归你管,但出了事算你的。凌晨三点,定时 ETL 把昨天的一批新数据灌进生产表 events——报表、看板、下游作业、特征管道全都在读它。这批数据里混着上游常见的脏东西:空 user_id、负数金额、一眼假的离群值、对不上维表的用户。等白天有人发现时,晨会看板已经算错、下游作业已经跑完、模型已经拿它训了一轮。然后是更难的部分:脏数据和好数据已经混在同一张表里,事后把它摘干净,比当初挡在门外难十倍——那又回到了第五篇的事故救援。
我是有底线的