隐私、合规与伦理——人脸识别不只是技术问题

隐私、合规与伦理——人脸识别不只是技术问题 人脸识别可能是AI领域里最具争议的技术没有之一。它能帮警察找到走失老人也能被用来在商场里偷偷记录你的行踪它能让你刷脸进站省去排队时间也能让你的生物特征在不知情的情况下被采集和贩卖。同一个技术用在不同场景里是便民还是侵权完全取决于谁来用、怎么用、为什么用。第一部分法律法规这堵墙比技术难题更难翻2021年《个人信息保护法》实施之后人脸信息被明确归类为敏感个人信息——收集和处理必须获得用户的单独同意而且要有明确的目的和充分的必要性。单独同意是什么意思就是你App的用户协议里不能夹带一句我同意采集人脸信息——那不行。必须单独弹窗、单独签字、明确告知你的脸会被用来干什么、存多久、存哪儿、谁能看。每一条都要用户点我明确知悉并同意。充分的必要性又怎么界定如果你是做刷脸支付的人脸信息是完成支付的唯一可行手段那算必要。但如果你只是做个考勤系统其实指纹或者门禁卡也能实现那你让人家刷脸法律上就站不住脚——有其他替代方案为什么非要采集我的脸这些合规要求在具体落地项目里直接限制了技术能使用的边界。比如某个商场想做顾客画像分析在入口装了个带人脸识别的摄像头想统计每天的客流和回头客。这技术本身没问题但法律上不允许——因为顾客进商场没有单独同意采集人脸而且客流统计这件事完全可以用更原始的红外线计数来实现没必要动用人脸识别。所以现在做To B或To G的人脸识别项目项目启动之前要先过合规评审数据来源是否合法采集是否有单独授权存储是否有加密和访问日志数据保留期限是否明确告知外传或共享是否有脱敏处理这些评审过不了技术方案再牛也白搭。第二部分数据安全——存着几百万张人脸就像扛着一箱现金走夜路人脸数据一旦泄露比密码泄露严重得多——密码可以改指纹可以重录但你的脸换不了。脸被泄露了你这辈子就永远暴露在被冒用的风险里。所以人脸识别系统的数据安全要求比普通IT系统高出几个等级传输加密从摄像头到中心服务器的所有数据必须走加密通道TLS或者国密SM系列绝对不允许明文传输抓拍图片。存储加密人脸图像和特征向量在数据库里必须加密存储存储密钥跟业务系统物理隔离。即使黑客攻破了数据库拿到的也是一堆密文没有密钥无法还原。特征不可逆性特征向量必须是单向哈希的——从特征向量无法反向重构出原始人脸图像。这一点在主流的深度学习特征提取里天然成立512维的embedding远远不足以还原出112x112的图像但你要确保这个特征向量本身是有损的、不可逆的。访问日志审计任何人对人脸数据库的每一次查询和修改都必须有完整的日志记录——谁、什么时间、为什么查、查了谁、返回了什么结果。这些日志要保存至少半年供事后追溯和审计。第三部分算法偏见——你以为的公平其实满是窟窿算法偏见这个话题在学术界已经热了好几年了。你训一个人脸识别模型用的训练数据如果90%是亚洲男性那它在亚洲女性、非洲裔人群、儿童、老人等群体上的识别率会明显偏低。这不是算法的恶意是数据的偏差。2018年有研究指出当时几个主流商业人脸识别系统在识别深肤色女性时的错误率是浅肤色男性的几十倍。这事儿被媒体曝光之后亚马逊、微软、IBM等公司被迫停售了面向警方的人脸识别产品整个行业迎来了一场道德恐慌。后来的解决方案是公平性约束训练——在训练的时候强制要求模型在不同子群体按性别、族裔、年龄段划分上的识别准确率的方差不能超过某个阈值。实现方式是在损失函数里加一个公平性正则项惩罚那些在某些子群体上表现好、在其他子群体上表现差的偏科模型。但这事儿在工程上极难落地——你怎么定义公平是要求所有群体的准确率绝对相等这几乎不可能因为不同群体的数据量和数据质量本身就不同还是允许微小的差异只要不超过某个容忍范围这个容忍范围是多少谁来定这些都不是技术问题是价值观问题。做工业级产品时我的做法是在模型评估报告里明确列出在不同子群体上的性能指标并且让客户自行签字确认知悉了群体间差异并接受。至少在法律层面做到充分告知而不是偷偷摸摸把有偏见的模型推上线。第四部分公共场所使用边界——机场车站能装人脸商场公园凭什么不能关于公共场所能不能装人脸识别摄像头的争论一直在持续。支持者说公共场所本来就没有隐私期待摄像头拍到的都是你在公共空间里的活动有什么不能识别的反对者说虽然人在公共空间但我的脸跟我的身份是绑定的我不希望你随便识别我是谁。目前的司法实践里公认的一条分界线是是否有明确的公共利益。机场安检、车站入口、大型活动安保——这些场景装人脸识别是为了公共安全有明确的法律依据和行政授权可以获得公共利益豁免。但商场、餐厅、写字楼大堂这些商业场景人脸识别服务于商业利益而非公共利益就必须获得用户明示同意。在实践中这意味着什么意味着商业写字楼的访客系统可以让人脸识别——因为访客要进入大楼必须先登记、刷脸、获取授权这个流程里访客已经完成了明示同意。而商场的客流分析摄像头如果没有让顾客事先知情和同意那就不能做身份识别只能做人头计数。第五部分从业者的良知——技术不中立选择在你最后说点虚的。作为一个在计算机视觉行业干了十几年的人我越来越觉得技术中立论站不住脚。人脸识别这个技术本身可能没有善恶但你选择把它用在什么场景、卖给什么客户、设定什么功能