-
熊节:算法推荐终于可关闭,中国《互联网信息服务算法推荐管理规定》开世界先河
算法推荐的技术原理
各种形式的算法推荐,包括《规定》中列举的“生成合成、个性化推送、排序精选、检索过滤、调度决策”等形式,当下主流的实现方式都是采用机器学习(machine learning),背后的原理都是基于贝叶斯统计(Bayesian statistics)方法的预测——听起来很高深,其实通过一个简单的例子很容易就能理解。
假设你丢一个以前没用过的骰子,你认为有多大概率丢出6点?当然,在没有任何额外信息的情况下,你的预测是“1/6”。然后,你连续丢了20把,每把都是6点,这时候你认为下一把继续丢出6点的概率是多大?经典概率论说,每次丢骰子都是一个独立随机事件,过去丢出的点数不影响未来丢出的点数,所以你的预测仍然应该是“1/6”。但很明显正常人不会这么想。
“这个骰子连丢了20把6点”这项信息很明显会影响对未来的决策(例如可能说明这个骰子被灌了铅),因此你会预测下一把有很大概率还是会丢出6点。简化地说,贝叶斯统计就是“基于过去已经发生过的事件预测未来将要发生的事件”。各种算法推荐都是在进行这样的预测:
知乎的个性化推送就是预测用户可能喜欢看什么问题和回答;
百度的检索过滤就是预测用户可能对哪些搜索结果感兴趣;
淘宝的排序精选就是预测用户可能购买哪些商品。
这些预测所基于的“过去已经发生过的事件”则是与用户相关的、非常宽广的数据集,不仅包含“用户看过/赞过/收藏过哪些回答”这种直接的用户行为,还包含大量用户本身的属性信息:年龄、性别、地域、教育程度、职业、上网设备、买过什么东西、发过什么言论、住多大房子、家里几口人、喜欢张信哲、反感蔡徐坤……这些信息都会被用于预测用户的偏好。
每一项类似这样的属性信息也被称为“特征”(feature),对于一个普通用户,互联网公司通常拥有数千、数万项特征信息。其中一些特征信息来自该公司本身的业务,更多的特征信息来自其他平台,三大运营商、微博、腾讯、阿里、手机制造商等企业都会SDK(软件开发包)的方式与其他互联网应用共享用户个人特征信息。
知乎与第三方共享个人信息的清单(部分)
在所有这些特征信息中,给定一项具体的预测,有些特征与这项预测的相关度较高,有些特征的相关度则较低。如果能从预测的结果回溯到哪些特征产生了重要的影响,我们就可以说这种算法“具备可被审核性”(auditable)。例如最简单、最基础的机器学习算法线性回归(linear regression),其原理就是根据过去的事件给每项特征打一个权重分数,然后根据这些权重分数预测未来的事件。从一个线性回归的预测模型中,可以直观地看到每项特征的在预测中的权重,因此线性回归是特别容易审核的一种算法。
当然,最简单、最基础的算法,也就存在预测能力不够强的问题。形象地说,只用简单的线性回归,无法把特征值里隐含的信息全都榨取出来,所以预测效果不见得特别好。于是科学家和工程师们想了很多办法来压榨特征值里的信息。一种办法叫“特征工程”(feature engineering),说白了就是从已知的特征值推导出新的特征值,例如根据用户的手机型号、购物清单给用户打上“购买力强”或者“时尚潮人”的新标签,这就是一种简单的特征工程。
另一种压榨特征值的办法是把起初的特征信息视为一“层”输入,然后用各种数学方法把输入层变换成新的信息节点,从而形成一个多层的“网络”。这个变换的过程可以重复进行,变换的层数越多,就说这个网络越“深”——这就是“深度学习”(deep learning)这个词的由来。
尽管科学家经常用“神经元”、“神经网络”来类比这些数学变换的结果,但很多时候,经过这些变换得到的信息节点几乎没有现实世界中的含义,纯粹是一种数学工具的产物。所以业界有一种说法:深度学习就像炼金术(国内也称“炼丹”),把数据丢进神经网络,不知道什么原因就炼出结果了——如果结果不理想,就再加几层神经网络。
正因为深度学习常有“炼金术”的神秘感,使用它们的工程师经常自己都不知道为什么一个算法有效。例如谷歌曾发表过一篇论文介绍他们的图像识别算法,其中使用了一个深达19层的神经网络(VGG19)。然而谷歌的照片服务(Google Photos)却多次被曝暗含种族歧视,甚至把黑人照片识别为“大猩猩”。事后谷歌根本无法找出算法中的问题出在哪里,只好删除“大猩猩”标签了事。
VGG19:深度为19层的卷积神经网络,主要用于图像识别
尽管有谷歌的前车之鉴,类似的问题仍然在各家互联网巨头的产品中反复出现。2020年,部分脸书用户在观看一段以黑人为主角的视频时收到推荐提示,询问他们是否愿意“继续观看有关灵长类动物的视频”。2018年MIT媒体实验室的研究员Joy Buolamwini发现,微软、IBM和Face++的人脸识别算法在识别黑色人种的性别的错误率要远远高于白色人种,而且肤色越黑,识别率就越低,黑人女性的识别错误率高达35%。过度依赖“炼金术”式的深度学习算法,是这些互联网巨头对算法审核态度冷淡的原因,同时也导致它们难以修正其算法中隐含的系统性歧视。
标签-
本文仅代表作者个人观点。
- 责任编辑: 周远方
-
1谁在阻碍中国人了解印度的饮食评论 84 赞 2
2拼低工资?我认识好几个造船厂的管理者,太了解造船了评论 81 赞 53
3粤语童谣纳入了人教版音乐课,让外省孩子们多学方言,这是文化自信的表现评论 57 赞 5
4胡塞武装势如破竹!美国力不从心,沙特危矣评论 40 赞 38
5张雪称儿子考60分就很好,并劝年轻人努力搬砖,如何看待他的观点?评论 32 赞 3
6中东战争给美国亚太盟友上了一堂地缘课评论 27 赞 5
7初中没上完的发小相信大明统治了全世界评论 27 赞 0
8暴雨夜,两个壮汉当街拖走一个18岁女孩,谁在给“卖女儿”开绿灯?评论 23 赞 23
9一次打坏12架战机!美空军基地遭伊朗导弹重击,伊朗导弹越打越准!评论 23 赞 19
10全世界把英语纳入基础教育的确实很普遍评论 20 赞 12最新闻 Hot-
“胡塞主动联系,希望美国‘不要介入’”
-
36年来首次!智利政府不举行阿连德纪念仪式
-
“瑞典民主党若首次入阁,将进一步呼应欧洲极右翼”
-
欧洲央行行长:当前通胀冲击将持续更长时间
-
“特朗普说给美国选民听的”
-
“小博索纳罗有份反华文件,背后藏着万斯的影子”
-
沙特关键输油管道遇袭,“预防性关闭”
-
乌方放风:正准备于10月恢复谈判,三方一起谈
-
法拉奇不到24小时吸金7200万英镑,“远超英国两大党”
-
“我乐见爱尔兰统一”,英国:???
-
俄罗斯警告:在切尔诺贝利禁区,乌军有大动作
-
离谱!特朗普:人类灭绝?我就担心中国…
-
“这是一次又一次的背叛”
-
911纪念仪式,穆斯林市长还是去了
-
“瑞典不得不服软,中国太硬”
-
日本前外相岩屋毅等将访华,“感谢中方接受”
-

观察员









上海市互联网违法与不良信息举报中心