人工智能伦理 · 研究
性别阴影:商业性别分类系统中的交叉性准确性差异
Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification
2018年发表在FAccT会议上的开创性研究,揭示了商业面部识别系统中对深色皮肤女性的严重偏见,错误率高达34.7%,而浅色皮肤男性仅为0.8%。
摘要
本研究提出了评估自动面部分析算法和数据集中与表型亚组相关的偏见的方法。使用皮肤科医生认可的菲茨帕特里克皮肤分型系统,研究者发现商业性别分类系统存在严重的性别和肤色偏见,深色皮肤女性的错误率高达34.7%,而浅色皮肤男性仅为0.8%。这一发现揭示了人工智能系统中的交叉性歧视问题,对构建公平、透明和可问责的面部分析算法提出了紧迫要求。
研究导读
《性别阴影》是乔伊·布拉姆维尼(Joy Buolamwini)和蒂姆尼特·格布鲁(Timnit Gebru)于2018年发表在首届公平、问责与透明度会议(FAccT)上的开创性研究论文。这篇论文首次系统地量化了商业面部识别系统中存在的严重性别和肤色偏见,揭示了人工智能算法如何系统性地歧视深色皮肤女性——这一发现不仅震动了学术界,更推动了全球范围内关于AI伦理和算法公平的政策讨论。
乔伊·布拉姆维尼是麻省理工学院媒体实验室的计算机科学家,也是算法正义联盟(Algorithmic Justice League)的创始人。蒂姆尼特·格布鲁是斯坦福大学人工智能实验室的计算机科学家,曾是谷歌伦理AI团队的联合负责人。两位研究者都是黑人女性计算机科学家,她们的个人经历与这项研究有着深刻的联系——布拉姆维尼曾亲身经历过面部识别系统无法识别她深色皮肤的经历,这直接启发了本研究的开展。作为少数族裔女性研究者,她们在这个由白人和男性主导的领域中的存在本身,就是对技术多样性重要性的最好证明。
这项研究的核心方法是创建了一个名为“试点议会基准数据集”(Pilot Parliaments Benchmark, PPB)的新数据集,该数据集在性别和肤色分布上实现了平衡。与当时主流的IJB-A数据集(79.6%浅色皮肤)和Adience数据集(86.2%浅色皮肤)相比,PPB数据集包含了来自非洲和欧洲国家议会成员的照片,确保了深色皮肤和浅色皮肤、男性和女性的均衡代表。研究者使用皮肤科医生认可的菲茨帕特里克皮肤分型系统(Fitzpatrick Skin Type Classification)对图像进行分类,将皮肤类型分为较浅(I-II型)和较深(III-VI型)两类。
研究的发现令人震惊。在评估了三家主要的商业性别分类系统(微软、IBM和Face++)后,数据显示深色皮肤女性是错误率最高的群体,错误率高达20.8%至34.7%。相比之下,浅色皮肤男性的错误率最高仅为0.8%。这种差异不是细微的技术问题,而是系统性的歧视——深色皮肤女性的错误率比浅色皮肤男性高出40倍以上。研究还发现,所有系统在分类女性时的错误率普遍高于男性,分类深色皮肤时的错误率普遍高于浅色皮肤,而深色皮肤女性则承受着双重惩罚。
布拉姆维尼和格布鲁的分析揭示了这些偏见产生的结构性原因。首先,用于训练这些系统的基准数据集本身就存在严重的代表性偏见,主要包含浅色皮肤男性的图像。其次,面部识别技术中的性别分类往往依赖于二元性别框架,忽视了跨性别和非二元性别群体的存在。第三,商业系统的开发缺乏对交叉性(intersectionality)的理解——即种族和性别歧视如何交织产生独特的影响。
这篇论文的方法论贡献同样重要。研究者提出了“交叉性审计”(intersectional auditing)的方法框架,强调在评估AI系统时必须同时考虑多个身份维度,而不是将它们孤立看待。这种方法论创新为后续的大量研究奠定了基础,推动了算法公平性评估从单一的“准确性”指标向多维度的“公平性”指标转变。
《性别阴影》发表后产生了巨大的社会影响。2018年,这项研究直接导致IBM、微软和亚马逊宣布暂停或限制向执法部门出售面部识别技术。美国国会举行了关于算法问责的听证会,多位参议员引用了这篇研究的发现。欧盟的《人工智能法案》草案也将面部识别列为“高风险”应用,要求进行严格的公平性评估。
在学术界,这篇论文开创了“算法正义”(algorithmic justice)这一新兴研究领域。它启发了数百篇后续研究,涉及招聘算法、刑事司法风险评估、医疗诊断AI等多个应用领域。研究者的后续工作,包括布拉姆维尼的《Gender Shades》纪录短片和格布鲁对大型语言模型环境成本的批判,继续推动着关于AI伦理的公共讨论。
在当代语境下,这篇研究的重要性愈发凸显。随着生成式AI(如ChatGPT、DALL-E)的普及,算法偏见的问题从“识别不准确”扩展到了“生成有害内容”。从面部识别到文本生成,从图像合成到语音合成,AI系统的偏见问题无处不在。《性别阴影》提醒我们,技术进步并不自动带来社会进步——如果不有意识地解决算法中的偏见,AI系统将成为现有社会不平等的强化器,而不是消除器。
正如布拉姆维尼和格布鲁所强调的,“如果我们希望商业公司构建真正公平、透明和可问责的面部分析算法,就必须紧急关注这些严重的准确性差异”。这不仅是技术问题,更是关于谁的技术为谁服务的问题。在一个日益由算法决策的社会中,这项研究为我们提供了一个关键视角:技术的“客观性”往往只是权力关系的伪装,而揭示这些伪装,是实现技术正义的第一步。
读者回应
研究讨论
回应这项研究,或补充一篇值得共同阅读的论文。
加入讨论
加载评论中...
支持我们
如果您觉得这些内容有价值,欢迎支持FemRes的持续运营。