医疗数据分析

我待过2家大公司做医疗的,发现了他们的共性,有很多通用的方法,先说数据,医疗数据中最麻烦的,我觉得就是检验数据。

为什么?因为检查的指标项多,占所有数据的百分之50以上。

指标歧义:

血红蛋白、白蛋白、糖蛋白、光蛋白质就有很多,还有血糖,空腹血糖,胰高血糖,血液葡萄糖空腹。

这些有很多名称代表的是同一个意思,这些需要清洗。

导致的原因:医生人工手写、使用了不同的机器、使用了不同的his系统、不同的医院定义的指标不一样、新合并的医院

单位转换

pmol/L nmol/L g/l

这种很多是同一种,但是单位不一样,分析就没法分析。


分析之前一定要做的,提取数据,数据清洗,产生新数据表


提取数据:检验项、数据名称、单位、指标值

**这几个一定要有,**为什么?如果没有检验项,至少名称必须有。

有时候不同的检验项目,但是数据名称可能相同,那数据清洗的时候就不好区分是哪一批数据。

名称和数值必须要有,这个不用说了,单位必须有,因为不同单位的指标值差异很大,没有单位的检验数据,和脏数据没有区别。


数据清洗: 根据检验项目、名称、做聚合,让医生做判断,得到唯一的检验项目。

注意:医生判断完,一定要自己判断一遍!一定要自己判断一遍!一定要自己判断一遍!如果他说的有重复或者还是有歧义,那么数据分析了,你用它的数据就全是有问题的,责任还是你。记住一句话:医生他只负责看病,处理数据是你的工作

得到了医生确定和你自己检查后:多个歧义名称对应唯一检查的表后就能聚合了

聚合:

就是去掉歧义的指标,方法很多,自己想办法,做之前一定要先分析数据分布,和指标的数据情况。然后进行单位转换保证唯一指标。这一步是比较耗时的


数据分析,现在看你的业务了,是用随机森林呢,还是方差,还是其他的统计学算法。

相关推荐
Aloudata42 分钟前
从Apache Atlas到Aloudata BIG,数据血缘解析有何改变?
大数据·apache·数据血缘·主动元数据·数据链路
水豚AI课代表1 小时前
分析报告、调研报告、工作方案等的提示词
大数据·人工智能·学习·chatgpt·aigc
拓端研究室TRL4 小时前
【梯度提升专题】XGBoost、Adaboost、CatBoost预测合集:抗乳腺癌药物优化、信贷风控、比特币应用|附数据代码...
大数据
黄焖鸡能干四碗4 小时前
信息化运维方案,实施方案,开发方案,信息中心安全运维资料(软件资料word)
大数据·人工智能·软件需求·设计规范·规格说明书
编码小袁4 小时前
探索数据科学与大数据技术专业本科生的广阔就业前景
大数据
WeeJot嵌入式5 小时前
大数据治理:确保数据的可持续性和价值
大数据
zmd-zk6 小时前
kafka+zookeeper的搭建
大数据·分布式·zookeeper·中间件·kafka
激流丶6 小时前
【Kafka 实战】如何解决Kafka Topic数量过多带来的性能问题?
java·大数据·kafka·topic
测试界的酸菜鱼6 小时前
Python 大数据展示屏实例
大数据·开发语言·python
时差9536 小时前
【面试题】Hive 查询:如何查找用户连续三天登录的记录
大数据·数据库·hive·sql·面试·database