




当你用手机刷脸解锁、用语音助手查天气时,背后有一群人在给海量数据“打标签”——圈出图片中的人脸、转写语音内容、判断文本情绪。他们就是数据标注从业者。然而,这份工作的背后隐藏着一个严峻的问题:标注员每天接触的,往往是大量包含个人隐私的原始数据。
为什么数据标注容易成为隐私泄露的“重灾区”?
数据标注被誉为人工智能的“粮食加工”,是数据要素流转的关键关口。但风险恰恰潜藏在细节之中。一线标注人员直接接触原始数据,而行业人员流动性大,权限管控稍有松懈就可能发生信息外泄;部分中小标注企业追逐产出效率,安全管理制度薄弱,脱敏、去标识化流程流于形式。多地已查处标注外包人员私自导出人脸图像、病患病历等敏感样本,在网络黑市倒卖牟利的案例。
一张“罚单”敲响了怎样的警钟?
2025年9月,在“护网2025”专项行动中,一家主营人工智能模型训练基础数据的算料公司,被属地公安机关行政处罚并责令整改。原因很具体:该公司在处理人脸等生物识别类敏感个人信息前,未按《个人信息保护法》规定进行个人信息保护影响评估。这是数据标注行业早期一张有代表性的合规罚单。
国外的教训同样深刻。Meta旗下Ray-Ban智能眼镜采集的视频数据,被曝由合作方在肯尼亚的标注团队处理,员工频繁接触包含裸体、银行卡信息及亲密行为场景的私人录像,引发集体诉讼。数据标注正在从“幕后工序”走向“台前风险”。
法律怎么说?
我国《个人信息保护法》明确规定,人脸、行踪轨迹等属于敏感个人信息,处理这类信息必须具有特定目的和充分必要性,并采取严格保护措施。而“取得本人同意”是处理个人信息的核心合法性基础之一。此外,《数据安全法》《网络安全法》以及《生成式人工智能数据标注安全规范》(GB/T 45674-2025)等国家标准,共同构建了数据标注的合规框架。
行业怎么做才能守住安全底线?
从技术层面,企业应建立全流程安全体系:原始数据加密存储、对敏感信息进行脱敏处理(如人脸、车牌精准脱敏),并通过分级分类访问控制实现“数据可标不出域”。联邦学习、差分隐私等隐私计算技术也已逐步落地,能够在数据不出本地的情况下完成标注任务,保障数据的机密性和模型的可用性。
从管理层面,所有接触数据的人员必须签署专项保密协议,严格禁止未经书面许可的项目转包或二次外包。项目验收后,服务商须在指定期限内彻底擦除所有服务器、终端及备份介质中的数据,并出具销毁证明。
从合规层面,处理敏感个人信息前必须进行个人信息保护影响评估,这是法律规定的“入场券”,而非可选项。
数据标注行业正从“粗放增长”走向“合规发展”。安全不是成本,而是数据标注企业长远生存的生命线。只有守住这条线,AI才能“吃得健康”,行业才能走得更远。