数据清洗

东莞市云毅网络有限公司1 天前
python·数据清洗·rag·企业知识库·文档解析
用 SQLite FTS5 给企业文档建本地全文索引:中文分词与权重调优企业内部的文档检索,多数场景并不需要上 Elasticsearch。几千到几万份文档的规模,用 SQLite 的 FTS5 扩展就能做到毫秒级响应,且零部署成本、单文件可迁移。这篇文章记录一套可直接运行的实现:中文预分词 + FTS5 索引 + BM25 权重调优 + 查询改写。
Patrick在香港3 天前
python·自然语言处理·正则表达式·claude·数据清洗
Claude Prompt 香港场景:公文里「今日」落在 6 个日历日上,「翌日」锚错了 5 天香港政府新闻公报每天发布,正文里到处是「今日」「明日」「翌日」这种相对时间。我把最新 100 条抓下来逐条扫了一遍:
2601_962382437 天前
数据清洗·python自动化办公·报表生成·文档处理·邮件分发
Python自动化办公实战指南:从入门到精通办公自动化实战指南, 从入门迈向精通, 于数字大潮席卷职场当下, 重复性、低价值机械劳动渐成效率阻碍, 每位职场人日常要面对庞大数量数据Excel表, 邮件附件需手动复制粘贴, Word报告格式杂乱, 诸多场景成为人们工作痛点。作为一种编程语言, 语法简洁且生态强大, 不仅作为技术而存在, 更是已成为现代办公自动化关键之核心武器。去掌握自动化办公, 实际上是要把人从那种繁琐的执行者转变成为策略的制定者, 让机器去向处理那些枯燥的数据搬运这一工作, 进而释放人类所能拥有创造力的核心价值。自动化办公它的起步并
沙淘金数据服务10 天前
大数据·人工智能·数据治理·数据清洗·电商·外贸
电商订单数据整合难题拆解:多源异构数据如何实现自动化治理?电商企业普遍面临多平台订单数据分散、格式异构、口径混乱、重复错漏等问题,传统人工整合效率低下、复盘数据失真、财务对账偏差大。本文深度拆解电商订单数据整合的行业痛点,分析传统处理方式的局限性,并提供可落地的自动化数据治理方案,帮助商家实现全渠道订单统一归集、标准化清洗、精准复盘、高效对账,彻底解决多渠道数据孤岛问题。
东莞市云毅网络有限公司11 天前
python·数据清洗·rag·企业知识库·文档解析
企业非结构化资料拆分成可引用片段:一套能跑通的预处理流水线做检索增强(RAG)的人都知道一句话:检索质量的上限,是切分质量决定的。但企业侧的文档和公开语料完全不同——PDF 是扫描件混杂排版文本,Word 是十几年攒下来的各种模板,表格嵌在段落里,图片里还压着关键参数。直接按固定长度切,切出来的块要么截断在半句话上,要么把三件不相关的事揉在一起。
Patrick在香港16 天前
python·pandas·etl·claude·数据清洗
把 Claude 塞进 pandas 管道:7 条脏地址实测,5 条自动清洗、2 条被闸门拦下每个数据团队都有一列不敢动的脏数据。香港地址是重灾区:flat 5, 3/f, wing on house, 123 queen's road central、銅鑼灣謝斐道123號5樓B室、g/f, 88 nathan rd, tst, kln——中英混杂、缩写、漏区,正则写两百行也覆盖不全。这篇用实测说明一个架构:把 Claude 当成 pandas 管道里的一个 transform 步骤——它负责把乱七八糟的字符串变成结构化 JSON,但进库之前必须过一道确定性校验闸门。
whcyhhh23 天前
大数据·开发语言·python·数据清洗
头歌实践教学平台:数据科学与大数据技术导论(十二)任务描述 本关任务:完成泰坦尼克号遇难数据的清洗。相关知识 案例背景 泰坦尼克号遭遇的灾难震惊世界,如何避免灾难甚至预测灾难呢? 要实现首先要做好泰坦尼克号的损失数据统计,才能为数据分析打下基础。
CodexDave2 个月前
java·python·自动化·json·数据清洗·python自动化·csv处理
Python 自动化接单实战(一):把 CSV 需求做成配置驱动解析器很多 Python 自动化需求看上去不同,拆开后却很相似:客户给一批 CSV 或 JSON 数据,希望改字段名、转换类型、补默认值、做校验,再输出一份干净文件。
想你依然心痛2 个月前
随机森林·django·数据清洗·特征工程·电力负荷预测·时序数据·能耗管理
预测未来用电趋势,机器学习算法在能耗管理中的落地你跟别人的差距,不在于你走得慢,而在于别人走的时候,你只是一直在看。 很多人把差距归结为天赋或条件,但本质是是否进入行动状态。走得慢的人也在积累经验,而“只看不走”的人连试错的机会都没有。差距是从“我还没准备好”到“我先动起来”之间的那条分界线。
RestCloud2 个月前
数据仓库·etl·数据清洗·数据处理·etlcloud·数据集成工具
ETL是什么?全域数据集成平台核心能力解析ETL是企业数据流转的核心机制,负责从异构数据源抽取数据、按业务规则清洗转换、最终加载至目标系统。随着企业数字化从"报表驱动"迈向"实时驱动",传统ETL工具在实时同步、数据质量治理、信创合规等方面暴露出结构性短板。
nothing&nowhere2 个月前
开发语言·python·数据清洗·数据处理·问卷星·问卷星脚本·刷问卷
用 Python 做问卷数据清洗:无效样本检测与处理实战做问卷研究的人都知道,回收数据里一定有垃圾。直线作答、秒填、规律选择、前后矛盾……这些数据如果不清理掉,分析结果会被严重污染,信效度也过不了关。
potion()4 个月前
笔记·数据清洗·用户行为分析·助睿数智·商业数据分析·浏览器行为分析
基于助睿平台的浏览器用户行为分析与流失预测 —— 数据加工实验在这次数据分析实训中,我需要处理一批典型的互联网用户行为日志数据。这些数据都是半结构化的 TXT 文本,不能直接拿来分析,所以我要完整走一遍数据加工流程:从日志解析、结构化转换,到数据清洗、字段衍生、多维度聚合,最终产出可以用来做用户行为分析、浏览器市场格局研究,甚至后续流失预测建模的标准数据集。通过这次实操,我也能真正掌握企业里常用的 ETL 数据处理思路和平台操作方法。
毋语天4 个月前
python·数据分析·pandas·数据清洗·透视表
Pandas 数据处理进阶:缺失值、合并、分组聚合与透视表在完成 pandas 的基础操作(索引、筛选、赋值、函数应用)之后,下一步便是处理真实数据中常见的问题:缺失值、多表合并、分组统计以及数据透视。本文带你系统掌握这些核心技能,并提供可直接运行的代码示例。
Serendipity_Carl4 个月前
爬虫·python·数据可视化·数据清洗
爬虫实战进阶-穷游论坛网清洗与可视化分析我们的目标是获取穷游网论坛首页的游览贴列表(即“精选游记”部分)打开目标页面:https://bbs.qyer.com/
带娃的IT创业者5 个月前
重构·数据清洗·逆向工程·数字考古·架构重构·friendster·技术迁移
逆向工程与数字考古:以3万美元收购Friendster为例的技术重构实战在互联网的浩瀚历史中,无数平台如流星般划过,留下的不仅是用户的回忆,还有庞大的数据残骸和架构遗产。最近,Hacker News 上一个热门话题引发了技术圈的剧烈讨论:一位开发者以 3 万美元的价格收购了曾经的社会网络巨头 Friendster。
Trouvaille ~5 个月前
数据库·mysql·面试·数据清洗·数据处理·dql·基础入门
【MySQL篇】内置函数:数据处理的利器💬 这一篇讲什么:MySQL 的内置函数🚀 核心内容:在前一篇中,我们学会了基本的 CRUD 操作和聚合函数。现在需要学习 MySQL 提供的各种内置函数,这些函数能大大简化数据处理的复杂度。MySQL 提供了数百个内置函数,这一篇讲解最常用的几类。
Westward-sun.6 个月前
人工智能·算法·机器学习·数据清洗
矿物分类实战(一):从异常值到标准化——数据清洗全流程拆解本文基于真实矿物分类项目,完整拆解工业级表格数据清洗全流程:异常值处理、6种缺失值填充、标准化、SMOTE过采样,严格遵循“无数据泄露”原则。所有代码均来自项目源码,可直接复用。
阿钱真强道6 个月前
pandas·数据清洗·数据集成·merge·数据合并·重复数据处理·drop_duplicates
11 数据预处理-数据集成与重复数据处理适合人群:Python 初学者 / 数据分析入门 / 数据预处理学习者 / 教学案例分享在真实的数据分析工作中,我们很少只面对一张“干净完整”的表。 更多时候,数据会来自多个系统、多个部门、多个文件。
xcLeigh6 个月前
数据库·oracle·架构·集群·数据清洗·kingbasees
从 Oracle RAC 到金仓高可用集群:平滑切换的架构对比与落地指南做金融、政务、运营商等行业的数据库架构师,对Oracle RAC一定不陌生——作为业内成熟的高可用集群方案,Oracle RAC凭借多节点共享存储的架构,支撑了无数核心系统的7×24小时运行。但在国产化替代的大趋势下,“去O”不仅要解决单库的兼容问题,更要攻克高可用集群的平滑迁移难题:毕竟核心系统对停机时间的容忍度几乎为0,一旦集群切换出问题,轻则业务中断,重则引发数据错乱、监管风险,这也是很多企业在“去O”过程中最不敢触碰的环节。
gz7seven7 个月前
人工智能·大模型·数据清洗·质量过滤
大模型学习笔记------数据清洗(质量过滤)这类模型适用于处理海量原始数据(如 Common Crawl),其核心优势是速度极快、计算成本低。fastText (Facebook) 用途:最主流的质量过滤模型。常用于识别语种、过滤低质量文本(如广告、乱码)。 案例:FineWeb、Ultra-FineWeb 等知名数据集均使用 fastText 训练质量分类器。 原理:基于简单的 n-gram 和线性分类,能够以每秒处理数十万文档的速度运行。