FemRes持續生長的評論

人工智能倫理 · 研究

性別陰影:商業性別分類系統中的交叉性準確性差異

Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification

2018年發表於FAccT會議的開創性研究,揭示了商業面部識別系統中對深色皮膚女性的嚴重偏見,錯誤率高達34.7%,而淺色皮膚男性僅為0.8%。

00

摘要

本研究提出了評估自動面部分析演算法和數據集中與表型亞組相關的偏見的方法。使用皮膚科醫生認可的菲茨帕特里克皮膚分型系統,研究者發現商業性別分類系統存在嚴重的性別和膚色偏見,深色皮膚女性的錯誤率高達34.7%,而淺色皮膚男性僅為0.8%。這一發現揭示了人工智能系統中的交叉性歧視問題,對構建公平、透明和可問責的面部分析演算法提出了緊迫要求。

關鍵詞演算法偏見面部識別交叉性機器學習公平性
閱讀全文
01

研究導讀

《性別陰影》是喬伊·布拉姆維尼(Joy Buolamwini)和蒂姆尼特·格布魯(Timnit Gebru)於2018年發表在首屆公平、問責與透明度會議(FAccT)上的開創性研究論文。這篇論文首次系統地量化了商業面部識別系統中存在的嚴重性別和膚色偏見,揭示了人工智慧演算法如何系統性地歧視深色皮膚女性—這一發現不僅震動了學術界,更推動了全球範圍內關於AI倫理和演算法公平的政策討論。

喬伊·布拉姆維尼是麻省理工學院媒體實驗室的電腦科學家,也是演算法正義聯盟(Algorithmic Justice League)的創始人。蒂姆尼特·格布魯是史丹佛大學人工智慧實驗室的電腦科學家,曾是谷歌倫理AI團隊的聯合負責人。兩位研究者都是黑人女性電腦科學家,她們的個人經歷與這項研究有著深刻的聯繫—布拉姆維尼曾親身經歷過面部識別系統無法識別她深色皮膚的經歷,這直接啟發了本研究的開展。作為少數族裔女性研究者,她們在這個由白人和男性主導的領域中的存在本身,就是對技術多樣性重要性的最好證明。

這項研究的核心方法是創建了一個名為「試點議會基準資料集」(Pilot Parliaments Benchmark, PPB)的新資料集,該資料集在性別和膚色分佈上實現了平衡。與當時主流的IJB-A資料集(79.6%淺色皮膚)和Adience資料集(86.2%淺色皮膚)相比,PPB資料集包含了來自非洲和歐洲國家議會成員的照片,確保了深色皮膚和淺色皮膚、男性和女性的均衡代表。研究者使用皮膚科醫生認可的菲茨帕特里克皮膚分型系統(Fitzpatrick Skin Type Classification)對圖像進行分類,將皮膚類型分為較淺(I-II型)和較深(III-VI型)兩類。

研究的發現令人震驚。在評估了三家主要的商業性別分類系統(微軟、IBM和Face++)後,資料顯示深色皮膚女性是錯誤率最高的群體,錯誤率高達20.8%至34.7%。相比之下,淺色皮膚男性的錯誤率最高僅為0.8%。這種差異不是細微的技術問題,而是系統性的歧視—深色皮膚女性的錯誤率比淺色皮膚男性高出40倍以上。研究還發現,所有系統在分類女性時的錯誤率普遍高於男性,分類深色皮膚時的錯誤率普遍高於淺色皮膚,而深色皮膚女性則承受著雙重懲罰。

布拉姆維尼和格布魯的分析揭示了這些偏見產生的結構性原因。首先,用於訓練這些系統的基準資料集本身就存在嚴重的代表性偏見,主要包含淺色皮膚男性的圖像。其次,面部識別技術中的性別分類往往依賴於二元性別框架,忽視了跨性別和非二元性別群體的存在。第三,商業系統的開發缺乏對交叉性(intersectionality)的理解—即種族和性別歧視如何交織產生獨特的影響。

這篇論文的方法論貢獻同樣重要。研究者提出了「交叉性審計」(intersectional auditing)的方法框架,強調在評估AI系統時必須同時考慮多個身份維度,而不是將它們孤立看待。這種方法論創新為後續的大量研究奠定了基礎,推動了演算法公平性評估從單一的「準確性」指標向多維度的「公平性」指標轉變。

《性別陰影》發表後產生了巨大的社會影響。2018年,這項研究直接導致IBM、微軟和亞馬遜宣佈暫停或限制向執法部門出售面部識別技術。美國國會舉行了關於演算法問責的聽證會,多位參議員引用了這篇研究的發現。歐盟的《人工智慧法案》草案也將面部識別列為「高風險」應用,要求進行嚴格的公平性評估。

在學術界,這篇論文開創了「演算法正義」(algorithmic justice)這一新興研究領域。它啟發了數百篇後續研究,涉及招聘演算法、刑事司法風險評估、醫療診斷AI等多個應用領域。研究者的後續工作,包括布拉姆維尼的《性別陰影》紀錄短片和格布魯對大型語言模型環境成本的批判,繼續推動著關於AI倫理的公共討論。

在當代語境下,這篇研究的重要性愈發凸顯。隨著生成式AI(如ChatGPT、DALL-E)的普及,演算法偏見的問題從「識別不準確」擴展到了「生成有害內容」。從面部識別到文本生成,從圖像合成到語音合成,AI系統的偏見問題無處不在。《性別陰影》提醒我們,技術進步並不自動帶來社會進步—如果沒有意識地解決演算法中的偏見,AI系統將成為現有社會不平等的強化器,而不是消除器。

正如布拉姆維尼和格布魯所強調的,「如果我們希望商業公司構建真正公平、透明和可問責的面部分析演算法,就必須緊急關注這些嚴重的準確性差異」。這不僅是技術問題,更是關於誰的技術為誰服務的問題。在一個日益由演算法決策的社會中,這項研究為我們提供了一個關鍵視角:技術的「客觀性」往往只是權力關係的偽裝,而揭示這些偽裝,是實現技術正義的第一步。

讀者回應

研究討論

回應這項研究,或補充一篇值得共同閱讀的論文。

加入討論

回應

載入評論中...

支持我們

如果這些內容對你有幫助

支持 FemRes