健康险”,却没有你的体检数据,只能靠“年龄、职业”这些简单信息判断,推荐的产品自然不精准。
2 “黑盒子”问题:算法说“对”,但说不出“为啥对”
现在最火的神经网络算法,有个致命缺点:像个“黑盒子”——它能给出正确答案,但你问它“为啥这么判断”,它说不清楚。这在“需要解释”的关键领域,比如医疗、金融,特别要命。
比如医疗ai模型说“这个患者有肺癌,概率95”,医生得知道“模型是根据哪些特征判断的”——是看肿瘤的大小?还是密度?还是边界形状?如果模型说不出来,医生根本不敢信,更不敢根据这个结论给患者做手术;再比如银行用模型拒绝了你的贷款申请,你问“为啥拒绝”,银行只说“模型判断你风险高”,却不说“是因为你有两次逾期,还是因为你收入不稳定”,你肯定不服气,甚至会觉得“银行在歧视我”。
这个“可解释性差”的问题,是现在数据挖掘领域的一大痛点。科学家们正在研究“可解释ai”(xai),想让算法“开口说话”——比如让模型在判断“有肺癌”的同时,用红圈标出ct片里的“异常区域”,并说明“这个区域密度异常,符合早期肺癌特征”,就像医生一样给出理由。
3 隐私和伦理:挖数据不能“没底线”
数据挖掘得用大量数据,其中很多是“个人数据”——比如你的身份证号、手机号、健康记录、消费习惯、甚至是你每天的行动轨迹(手机定位数据)。要是这些数据被滥用,就会严重侵犯你的隐私,甚至引发伦理问题。
比如有的app会偷偷收集你的“聊天记录”“浏览历史”,用来做精准推荐——你在微信里和朋友说“想买个跑步机”,过会儿打开购物app,首页全是跑步机推荐,这就是app在偷偷挖你的隐私数据;更严重的,有人会用数据挖掘“预测用户的行为”,比如用你的“社交数据”“消费数据”预测你的“性格和收入”,然后卖给诈骗分子,给你带来安全风险。
还有伦理问题:比如用数据挖掘做“信用评分”时,要是模型把“性别、种族、年龄”当成重要特征——比如认为“女性比男性信用差”“30岁以下的人还款能力弱”,就会导致“算法歧视”,这显然不公平;再比如用数据挖掘分析“求职者数据”,要是模型认为“某所大学的毕业生能力差”,就会拒绝给这些毕业生面试机会,这也是典型的“算法歧视”。
现在各国都在出台法律管这事,比如中国的《个人信息保护法》、欧盟的《通用数据保护条例》(gdpr),要求“收集个人数据必须征得用户同意,不能滥用,更不能买卖”。但怎么在“挖数据创造价值”和“保护个人隐私”之间找平衡,还是个很难的问题——比如医院想用电解质患者的病历数据做研究,既能帮更多患者,又不能泄露患者的隐私,这就需要更先进的“隐私保护技术”(比如联邦学习,让医院不用拿到原始数据,也能一起挖规律)。
六、追历史:数据挖掘是怎么从“小工具”变成“大热门”的?
数据挖掘不是突然火起来的,它跟着“数据量”和“技术”的发展,走了几十年,就像从“小铲子”进化成“大型挖土机”,一步步变得更强大、更实用。
1 萌芽期(1960s-1980s):从“数据库”
这个阶段电脑刚普及,数据量很少,主要存在“关系型数据库”里(就是像excel表格一样,按行和列存储数据的数据库)。那时候还没有“数据挖掘”这个词,叫“知识发现”(kdd),主要用简单的统计方法(比如计算平均值、百分比)找数据里的规律。
比如1970年代,美国的大型超市会用数据库存“销售记录”,然后用简单的关联分析找“哪些商品一起卖得多”发现“买面包的人里,有30会买黄油”,于是把面包和黄油放在相邻的货架上,提升销量。但那时候的数据量很小,一次只能分析几千条记录,算法也很简单,只能处理结构化数据(表格数据),对图片、语音这些非结构化数据还没辙。这时候的“挖宝工具”很简陋,就像用小铲子挖沙子,只能挖表面的小石子。
2 发展期(1990s-2000s):算法爆发,开始“规模化挖宝”
1990年代,互联网开始兴起,数据量开始“爆炸式增长”——比如1995年,全球互联网用户突破1000万,每天产生的数据包比1980年代全年还多。数据多了,就需要更高效的工具来挖规律,于是各种数据挖掘算法开始爆发:
- 1993年,apriori算法(关联规则挖掘的核心算法)被提出,能快速找“商品之间的关联关系”
- 1995年,决策树算法的升级版c45算法出现,让分类更精准;
5年,“数据挖掘”这个词在国际会议上被正式提出,标志着它从“知识发现”的分支,变成了独立的研究领域。
这个阶段,企业开始大规模用数据挖掘解决实际问题:银行用决策树算法做信用评分,把审核时间从“3天”缩短到“1小时”;电商平台用apriori算法做商品推