# 🧑 开源免费的中国/亚洲人人脸数据集汇总（含法律风险分析）

> 生成时间：2026-07-30
> ⚠️ **重要前提：本文所有数据集的分析基于公开信息，不构成法律意见。使用前建议咨询专业律师。**

---

## 一、核心结论：绝大多数人脸数据集 **不能免费商用**

经过逐一核查，**几乎全部公开人脸数据集的图片都是从互联网爬取的，数据集作者本身不拥有图片版权，因此无法授予商业许可。** 它们都仅限"非商业学术研究用途"。

**⚠️ 如果用在 id-photo 这样的商业产品上，面临 3 大法律风险：**
1. **侵犯肖像权** — 被拍者未授权商用
2. **侵犯版权** — 原图版权属于摄影师/发布方
3. **GDPR 违规** — 欧盟《通用数据保护条例》要求生物特征数据需明确同意

---

## 二、✅ **可免费商用的数据集（极少）**

### 1. FairFace — CC BY 4.0 ✅
- **许可**：**Creative Commons Attribution 4.0 (CC BY 4.0)** — 可商用，只需注明来源
- **规模**：**108,501 张图片**，7 个种族平衡
- **亚洲数据**：含 **East Asian（东亚人）** + **Southeast Asian（东南亚人）** 两个类别，约 31,000 张亚洲人脸
- **标注**：年龄、性别、种族
- **下载**：https://huggingface.co/datasets/nateraw/fairface
- **GitHub**：https://github.com/dchen236/FairFace
- **说明**：专为解决人脸数据集种族偏误问题而设计，是目前极少数真正可以商用的开源人脸数据集
- **局限**：图片来自互联网（Flickr），CC BY 4.0 对发布者有效，但被摄者的肖像权仍需自行评估

### 2. 合成人脸数据集（生成的虚拟人脸）✅
**不含任何真实人物照片，法律风险最小**

| 数据集 | 说明 | 许可 | 
|--------|------|------|
| **VariFace** | 扩散模型生成的虚拟人脸，超越 CASIA-WebFace | 开源 |
| **VIGFace** | 特征空间预分配身份的虚拟人脸 | 开源 |
| **DigiFace-1M** | 1M 张虚拟人脸 | 学术免费 |

### 3. LFW（Labeled Faces in the Wild）
- **许可**：无明确限制（Adam Harvey 2022 年分析：可用作任何用途）
- **规模**：13,233 张，5,749 人
- **亚洲偏向**：⭐⭐（全球化，含少量亚洲名人）

---

## 三、❌ **学术免费，不可商用的数据集**

### CASIA-WebFace
| 项目 | 内容 |
|------|------|
| 规模 | 10,575 人 / 494,414 张 |
| 亚洲偏向 | ⭐⭐⭐⭐⭐ 纯中国人 |
| ⚠️ **许可** | **仅限学术研究，不可商用** |
| 隐忧 | 从互联网爬取，未经授权；官方下载链接已不稳定 |

### Glint360K
| 项目 | 内容 |
|------|------|
| 规模 | 360K 身份 / 17M 张 |
| 亚洲偏向 | ⭐⭐⭐⭐ 含大量亚裔 |
| ⚠️ **许可** | **明确标注 "non-commercial research purposes only"** |
| 隐忧 | 从 MS1MV2 + CASIA-WebFace + VGGFace2 等清洗融合，原始数据本身就有版权问题 |

### WebFace260M / WebFace42M
| 项目 | 内容 |
|------|------|
| 规模 | 2M 身份 / 42M 张（清洗版） |
| 亚洲偏向 | ⭐⭐⭐⭐⭐ 中国人发布，数据来源中文互联网 |
| ⚠️ **许可** | **仅限学术研究** |
| 隐忧 | 4M 人名从互联网收集 + 260M 人脸下载，无任何授权 |

### CelebA
| 项目 | 内容 |
|------|------|
| 规模 | 10,177 人 / 202,599 张 |
| 亚洲偏向 | ⭐⭐⭐⭐ 香港中文大学，大量亚洲明星 |
| ⚠️ **许可** | **明确标注 "non-commercial research purposes only"** |
| 隐忧 | 官网声明："所有图片来自互联网，非 MMLAB 财产，MMLAB 不承担责任" |

### VGGFace2
| 项目 | 内容 |
|------|------|
| 规模 | 9,131 人 / 3.31M 张 |
| 亚洲偏向 | ⭐⭐ 全球化 |
| ⚠️ **许可** | **仅限学术研究** |

### UTKFace
| 项目 | 内容 |
|------|------|
| 规模 | 20,000+ 张 |
| 亚洲偏向 | ⭐⭐ 含 Asian 和 Indian |
| ⚠️ **许可** | **明确标注 "non-commercial research purposes only"** |
| 隐忧 | 官网声明："所有图片来自互联网，非 AICIP 财产" |

### CASIA-FaceV5
| 项目 | 内容 |
|------|------|
| 规模 | 500 人 / 2,500 张 |
| 亚洲偏向 | ⭐⭐⭐⭐⭐ 纯中国人 |
| ⚠️ **许可** | **仅限学术研究** |

### CAS-PEAL-R1
| 项目 | 内容 |
|------|------|
| 规模 | 1,040 人 / 99,594 张 |
| 亚洲偏向 | ⭐⭐⭐⭐⭐ 纯中国人 |
| ⚠️ **许可** | **需签署协议，仅限非商业学术** |

### RAF-DB
| 项目 | 内容 |
|------|------|
| 规模 | 29,672 张 |
| 亚洲偏向 | ⭐⭐⭐⭐ |
| ⚠️ **许可** | **仅限学术研究** |

---

## 四、⛔ **已下架/有重大争议的数据集**

### MS-Celeb-1M（微软）
- **现状**：**微软已强制下架**，官方声明"研究挑战已结束"
- **原因**：被控侵犯隐私 —— 数据集包含记者、艺术家、活动家、政策制定者的人脸，未经本人同意
- **学术文章称其为 "Zombie Dataset"（僵尸数据集）**—— 官方虽已下架，但盗版仍通过学术种子流传
- ⚠️ 使用该数据集有**极高的法律风险**

### MegaFace
- **现状**：**已下架**，存在类似隐私争议
- **说明**：美国华盛顿大学发布，含 4M+ 人脸

---

## 五、📋 许可状况速查表

| 数据集 | ⚠️ 可否商用 | 许可类型 | 亚洲人脸 |
|--------|-----------|---------|---------|
| **FairFace** | ✅ **可商用**（CC BY 4.0） | CC BY 4.0 | ~31K 张东亚/东南亚 |
| **VariFace（合成）** | ✅ 可商用 | 开源 | 按需生成 |
| **LFW** | ✅ 基本无限制 | 无明确许可 | 少量 |
| **Glint360K** | ❌ 不可商用 | 非商业研究 | 大量 |
| **WebFace42M** | ❌ 不可商用 | 非商业研究 | 大量 |
| **CASIA-WebFace** | ❌ 不可商用 | 非商业研究 | 全部 |
| **CelebA** | ❌ 不可商用 | 非商业研究 | 大量 |
| **VGGFace2** | ❌ 不可商用 | 非商业研究 | 少量 |
| **AFD** | ❌ 不可商用 | 非商业研究 | 全部 |
| **UTKFace** | ❌ 不可商用 | 非商业研究 | 约 25% |
| **CAS-PEAL-R1** | ❌ 不可商用 | 签署协议 | 全部 |
| **RAF-DB** | ❌ 不可商用 | 非商业研究 | 多数 |
| **MS-Celeb-1M** | ⛔ **已下架** | — | 大量 |

---

## 六、💡 针对 id-photo 项目的建议

你需要为证件照/形象照生成产品训练模型，场景特殊：

### 方案 A：使用 FairFace（成本最低）
- CC BY 4.0 许可，可商用
- 含东亚人 + 东南亚人两类亚洲面孔，约 31K 张
- **局限**：不够专门针对证件照场景，需要额外筛选和处理

### 方案 B：自建数据集（合规但成本高）
- **招募真人拍摄**，签署肖像权授权协议
- 包含不同性别、年龄、脸型的中国人证件照
- 完全合规，无任何法律风险
- **成本**：约 50-200 元/人

### 方案 C：使用合成数据（新兴趋势）
- **VariFace**、**VIGFace**、**DigiFace-1M** 等扩散模型生成的虚拟人脸
- 不存在真实人物肖像权问题
- 2025 年的研究表明合成数据**已可超越真实数据**的识别准确率

### 方案 D：使用商业授权数据集
- 向专业数据标注公司购买授权，如：
  - 国内：百度、商汤、旷世等有商业化授权的人脸数据
  - 海外：Appen、Scale AI、Sama 等提供合规数据标注服务
  - 成本：约 $0.5-5/张

### 方案 E：混合策略（推荐）
1. **原型验证阶段**：使用 FairFace（CC BY 4.0）+ 合成数据进行模型开发
2. **正式上线前**：自建少量有授权的核心数据集做 fine-tune
3. **持续优化**：通过产品用户上传的图片（经用户协议授权）持续迭代

---

## 七、⚠️ 免责声明

1. 本文中的许可分析基于各数据集的官网声明和公开学术资料
2. **CC BY 4.0 仅解决图片版权问题，肖像权/隐私权仍需自行评估**
3. 法律环境因国家/地区而异（中国《民法典》第 1018-1023 条、欧盟 GDPR、美国各州法）
4. **建议在使用任何数据集前咨询专业律师**，尤其是用于商业产品时
