faker

一行代码生成各种逼真假数据,测试开发不用愁

Faker 是一个 Python 库,用于生成各种逼真的假数据,如姓名、地址、邮箱、电话、文本、日期、公司信息等。它解决了开发、测试和演示阶段需要大量真实感数据但又不便使用真实数据的问题。核心能力包括支持多种语言和地区(如中文、英文、日文等),提供丰富的 Provider 扩展机制,可自定义生成规则,并支持命令行工具快速生成数据。通过简单的 API 调用,开发者可以快速生成符合特定格式的测试数据,提高开发效率。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 19405
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队joke2k
所属国家
官网地址
定价模式free
价格说明完全免费的开源Python库,用于生成假数据,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型dataset,fake,fake-data,faker,faker-generator,python,test-data,test-data-generator,testing
GitHub 星标★ 19405
30天Star增速
HF 下载量
上线时间2012-11-12 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数9

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 3 步

环境要求

  • Python 3.8 及以上(Faker 5.0.0 起仅支持 Python 3.8+)
  • 已安装 pip 包管理工具
  • 如需兼容 Python 2,只能安装 Faker 3.0.1

安装与启动步骤

  1. 1确认 Python 版本

    Faker 5.0.0 起只支持 Python 3.8 及以上,先确认本机 Python 版本满足要求。

    python --version
  2. 2安装 Faker

    通过 pip 从 PyPI 安装 Faker 包,README 给出的官方安装命令就是这一条。

    pip install Faker
  3. 3创建 Faker 实例

    导入 Faker 类并实例化,得到可用于生成假数据的对象;README 提到用 faker.Faker() 创建并初始化实例。

    from faker import Faker
    fake = Faker()
    print(fake)

如何确认成功

能正常 import Faker 并成功执行 Faker() 不报错,即表示安装可用。

常见问题

Q:还支持 Python 2 吗?

A:不支持。Faker 从 4.0.0 起放弃 Python 2,5.0.0 起仅支持 Python 3.8+;如需 Python 2 只能用 3.0.1 版本。

Q:安装时报错提示找不到 fake-factory 是什么原因?

A:Faker 早期叫 fake-factory,该包 2016 年底已废弃,请改用 Faker,并检查项目依赖中不要引用旧包名。

Q:对 Python 版本的最低要求是什么?

A:5.0.0 及以后版本要求 Python 3.8 及以上;低版本 Python 请参考官方扩展文档选择合适的 Faker 版本。

注意事项

  • Faker 5.0.0 起仅支持 Python 3.8 及以上,低版本 Python 需选旧版。
  • 旧包名 fake-factory 已弃用,务必确认项目不依赖它。
  • README 节选未包含完整 API 用法,具体生成字段的方法请查阅官方扩展文档。

核心亮点

  • 支持 30+ 语言和地区,中文数据生成完善
  • 提供 100+ 数据提供器,覆盖常用字段
  • API 简洁,可扩展自定义 Provider

不足之处

  • 生成数据随机性高,难以保证唯一性约束
  • 文档/社区待观察

适用场景

  • 单元测试和集成测试中构造测试数据
  • 数据库种子数据填充和演示环境搭建
  • 前端开发模拟接口返回数据

替代项目

Mimesis、Factory Boy、ForgeryPy

项目介绍

faker 是数据集领域的开源项目,由 joke2k 开发,2012 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(19,405)位列前 3%,在数据集分类的 279 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 19,370 增加到 19,405,净增 35。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。完全免费的开源Python库,用于生成假数据,无付费版本。

它主要面向的使用场景是:单元测试和集成测试中构造测试数据。同类可对比的替代方案包括 Mimesis、Factory Boy、ForgeryPy。

上一篇:deepfabric

下一篇:exercises-dataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09