给外行讲机器学习?这三个版本,总有一个能让他“秒懂”

1 阅读2分钟

机器学习名声在外,但真要说清楚它是什么,却难倒了不少数据科学从业者。本文提供三套解释方案,从专业到通俗,任君选用。 版本一:专业“劝退”型 机器学习是一门交叉学科,涉及概率论、统计学、逼近论等多领域。它研究计算机如何模拟人类学习行为——利用已有数据归纳出模型,再用模型预测未来。它不靠演绎推导,而是基于归纳与综合,是人工智能实现智能的根本途径。应用覆盖数据挖掘、计算机视觉、NLP、医学诊断、证券分析、战略游戏等众多领域。 这个版本的特点是:每句话都对,但听完基本等于没听。 版本二:以小见大型 想象一个漆黑的房间里漂浮着无数小球,你想知道它们的位置是否有规律——比如是否集中在某些区域。你带着闪光灯从不同角度拍照:正面拍、侧面拍、高处拍,都看不出名堂。最后从低角度拍,终于发现小球集中在屋顶和地面附近,中间是空的。 这就是“找到好角度”的价值。现实中,医院病人的病历可能有500个维度的数据——年龄、体重、血压、胆固醇等。人眼不可能看到500维空间的结构,就像黑屋里看不见小球。只有通过算法从“合适角度”降维“拍照”,才能发现心脏病患者是否聚集、新病人有无类似风险。所谓大数据洞察,就是找到那个正确的“角度”。 版本三:买芒果的故事 你第一次买芒果,奶奶说“嫩黄的甜”,你照做,回家发现有的不甜。后来你总结出:大个+嫩黄一定甜,小个+嫩黄只有一半甜。下次去换了个摊位,产地不同,规则全废——原来小个暗黄才最甜。 这就是手动写规则的困境:环境一变就得重来。你开始写程序,把颜色、大小、产地、软硬都设成规则,但规则越来越多,永远跟不上变化。 机器学习换了个思路:你挑一批芒果,记录所有属性(颜色、大小、产地、软硬度)和结果(甜不甜、多汁不),扔给算法。算法自动学习出一个模型,下次输入新芒果的属性,就能预测它甜不甜、多汁不。更重要的是——随着数据增加,模型会自我修正、越来越准。换个水果?同一套算法,喂苹果数据就学苹果,喂香蕉数据就学香蕉。 这就是机器学习:不用你写规则,让数据自己说话。