一个模型总体准确率达到 92%,听起来已经很好。但如果常见场景达到 97%,某个设备或人群只有 65%,总体数字会把真实差异隐藏起来。
AI公平的数据策略,不是追求所有群体的每个数字完全相同,而是先明确任务造成的影响,再检查数据和模型是否让某些人系统性地更容易被误判、遗漏或得到较差服务。
## 公平问题常在标签出现前就开始
数据采集目标决定谁会进入数据集。只在市中心采集语音,郊区网络与口音可能缺失;只记录成功完成流程的人,系统看不到中途退出者遇到的困难。
抽样框要列出重要场景、设备、时间、地区和用户特征,并检查覆盖。覆盖不等于简单配成相同人数,真实频率、错误代价和最低样本量都要考虑。
少数群体样本太少时,平均指标波动很大。报告应给出样本量和置信区间,而不是把一个不稳定百分比当作确定结论。
## 标签可能记录历史流程,而非真实目标
很多监督学习标签来自已有决定、点击和人工记录。它们并不天然客观。
“是否获得服务”可能受过去资源分配影响;“是否点击”可能受页面位置影响;客服标注的“问题已解决”也可能只是工单被关闭。模型如果学习这些标签,会复制旧流程,而不是预测真正关心的结果。
数据策略要为每个标签写明来源、生成过程、时间窗口和可能偏差。能直接测量目标时,不要用方便但含义不同的代理变量。

## 缺失值不是空白那么简单
某字段缺失可能因为用户没有设备、流程没有提供入口、记录系统故障,或当事人主动不填写。不同原因对应不同含义。
直接删除缺失记录,会让本来就难被记录的人进一步消失。用总体均值填补,又可能抹平真实差异。
团队应记录缺失机制,按群体和场景观察缺失率,并把“未知”作为可能有意义的状态。必要时用多种处理方式做敏感性分析,查看结论是否变化。
## 先选与任务相符的公平指标
人口统计均等关注不同群体获得正向预测的比例是否相近;机会均等关注真正符合条件的人被正确识别的概率;均等化机会同时观察真阳性率与假阳性率。
这些指标表达不同价值,通常不能同时完美满足。若基础发生率不同,强行让选择率相同可能改变错误分布。
选择指标要从任务后果出发。字幕识别更关心各类口音的漏词;推荐系统可能关心内容曝光与满意度;故障检测则要分别看漏报和误报。
指标应与总体效用一起呈现,避免只优化公平数字却让所有人的服务都下降。
## 交叉切片能发现平均值看不见的问题
只分别比较年龄和设备,可能看不到“高龄用户使用旧手机”这一组合的困难。交叉群体越细,样本又越少,需要在发现问题和统计稳定之间平衡。
可以先用业务知识定义关键交叉切片,再用错误聚类和决策树探索未知薄弱区域。探索发现的问题应在独立数据上验证,避免对小样本过度解释。

## 合成数据不是公平性的快捷键
生成模型可以扩充罕见场景,但它从已有数据学习,可能重现同样偏差。合成样本过于规则,还会让测试显得比现实简单。
Fairness GAN 等研究尝试在生成数据时加入人口统计均等或机会均等等目标,说明合成数据可以成为实验工具,但最终仍需在真实独立样本上验证。
使用合成数据时要标记来源,比较真实与合成分布,并单独测试仅靠合成样本改善的群体。不能把“数量变多”当作“代表性变好”。
## 数据文档让假设可以追踪
Datasheets for Datasets 提议像硬件数据表一样记录数据集动机、组成、采集、预处理、用途和维护。Model Cards 则把模型用途、评测条件和群体表现连接起来。
实用文档不需要冗长,但要能回答:数据从哪里来,谁缺失,标签如何产生,允许做什么任务,版本变化了什么,哪些切片尚未充分评测。
每次重采样、重标或合并来源都应产生新版本。模型结果只有和明确的数据版本绑定,才能复现。
## 上线后仍要观察差异
实验数据不能覆盖所有现实变化。新设备、季节、交互入口和用户行为会改变输入分布。
线上监控应跟踪输入覆盖、缺失率、人工转交、错误反馈和任务成功率,并按经过批准的最小必要切片观察。没有即时真值时,可以用抽样复核和延迟结果补充。
发现差异后,先定位来自覆盖、标签、模型还是界面,不要默认继续增加某类样本就能解决。
AI公平数据策略的核心,是把“总体表现不错”拆成可以核查的问题:谁被数据看见,标签代表什么,错误落在何处,变化能否被持续发现。公平不是训练末尾的一次修补,而是数据生命周期中的质量维度。
## 参考资料