疑似肺癌,概率92”的判断,再由医生进一步确认。
现在国内很多三甲医院的胸外科,已经用这种模型辅助诊断,早期肺癌的检出率提升了40以上,很多患者因为“早发现”而保住了生命。
慢性病管理:对糖尿病、高血压这类慢性病患者来说,数据挖掘能帮医生制定“个性化治疗方案”。比如医院收集糖尿病患者的“年龄、体重、血糖波动数据、饮食习惯(爱吃甜不甜、有没有按时吃饭)、用药记录”,用聚类算法找出“血糖控制不好的共性”
- 针对这类患者,医生会调整方案:除了增加用药剂量,还会安排营养师制定“低糖食谱”,并让护士每周提醒患者“按时吃药”。
新药研发:以前开发一种新药,要花10年时间、几十亿美元,还不一定成功;现在用数据挖掘,能把研发时间缩短一半。比如研发抗癌药时,科学家会用数据挖掘分析“肿瘤细胞的基因数据、现有药物的分子结构数据”,快速筛选出“可能对肿瘤有效的药物分子”,不用再像以前那样“逐个试药”,大大降低了研发成本和风险。
4 短视频平台:“越刷越上瘾”算准了你的喜好
你刷抖音、快手时,为啥总停不下来?其实是平台的“推荐算法”(本质是数据挖掘的组合拳)把你的喜好“摸得透透的”,让你每刷到下一个视频,都大概率是你喜欢的内容。
这个推荐算法的工作流程,藏在你看不见的后台:
1 给视频打标签:用分类算法给每条视频贴标签——比如“搞笑”“美食”“宠物”“科技”,甚至会贴更细的标签,比如“宠物”下再分“猫”“狗”“柯基”“布偶猫”
2 给你画“用户画像”:根据你“点赞、评论、转发、停留时间”这些行为,算你的偏好——比如你给100条“柯基拆家”的视频点了赞,给“科技测评”视频只停留3秒就划走,算法就会给你画一个“喜欢柯基搞笑内容,不喜欢科技内容”
3 精准匹配:用神经网络算法算“你和每条视频的匹配度”度高的视频推给你;
4 实时调整:如果你今天突然看了几个“烘焙教程”视频,算法会立马捕捉到你的“新兴趣”,下一页就给你推更多“蛋糕做法”“饼干教程”,让你“越刷越有新鲜感”。
平台还会用“时序知识挖掘”算你的“活跃时间”——比如发现你每天晚上8点准时刷视频,就会把“当天最火、最可能让你点赞的视频”留到这个时间段推给你,进一步提升你的“上瘾度”。
5 零售行业:从“瞎进货”到“精准备货”
以前小卖部、超市老板进货,全靠“经验和感觉”:夏天多进饮料,冬天多进泡面,但经常要么“卖断货”(比如夏天突然降温,没多进热饮),要么“积压过期”(冬天进太多雪糕,没人买)。现在用数据挖掘,就能实现“精准备货”,减少浪费还能多赚钱。
比如一家社区超市的老板,会用数据挖掘做这些事:
1 收集数据:过去一年的销售记录(每天卖多少瓶可乐、多少袋面包)、天气数据(当天温度、有没有下雨)、周边人流数据(小区里有没有学校,学生放假与否);
2 挖掘规律:用回归算法分析“气温和可乐销量的关系”,可乐销量涨5”;用关联规则发现“下雨天,泡面销量会比平时多30”
3 预测销量:根据明天的天气预报(比如明天35c,晴天),预测明天可乐销量会达200瓶,比今天多50瓶,于是提前备200瓶可乐;
4 优化促销:用聚类算法给周边居民分群,发现“小区里有30是上班族,喜欢早上买面包当早餐;20是老人,喜欢晚上买打折蔬菜”,于是针对性搞促销——早上给面包打“买二送一”,晚上7点后蔬菜打8折,既提升了销量,又没浪费库存。
五、聊问题:数据挖掘再牛,也有“搞不定”
虽然数据挖掘已经很先进,能解决很多生活和工作中的问题,但它不是“万能的”,还有一堆“头疼的难题”没解决,这些也是科学家们正在努力攻关的方向。咱们挑最关键的3个,说说它的“痛点”。
1 数据“质量差、不完整”为无米之炊
数据挖掘的效果,全看“原料”——也就是数据的质量。要是原始数据里全是“缺失、错误、重复”的数据,再厉害的算法也挖不出有用的东西,就像用烂菜、坏肉做饭,再牛的厨子也做不出好菜。
现在很多企业和机构都面临两个数据问题:
- 数据质量差:比如医院的病历数据,有的医生会漏填“患者过敏史”,有的会把“血糖值105”写成“105”(多写一个小数点);电商的用户数据里,有的用户会填“假手机号”“假地址”,这些错误数据会让模型“学偏”——比如把“血糖值105”当成真实数据,会让糖尿病风险预测模型的准确率下降30。
- 数据孤岛:不同部门、不同机构的数据“不互通”——比如你在银行的“贷款记录”,医院查不到;你在医院的“健康数据”,保险公司也拿不到。这导致数据挖掘时“原料不全”:比如保险公司想给你推荐“