marcap

千万行每日市值数据,直接拿来跑量化回测

marcap 是一个开源的市场市值数据集项目,提供 1995 年至 2026 年的每日市值数据,总行数超过 1000 万。它解决的是量化研究、金融分析和回测中缺乏统一、长时间跨度市值数据的问题。核心能力包括:覆盖全球主要市场股票的每日市值记录,数据以 Python 友好的格式组织,便于直接加载到 pandas 或数据库中进行因子计算、组合构建和趋势分析。项目用 Python 编写,适合数据科学家和量化研究员快速获取历史市值面板数据,无需自行从多个来源拼接和清洗。数据集时间跨度长、粒度细,可用于研究市值因子、规模效应、市场结构变化等。

开源 unknown 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 293
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类数据集
开发团队FinanceData
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 293
30天Star增速
HF 下载量
上线时间2018-10-02 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 覆盖1995至2026年每日数据,时间跨度长且粒度细
  • 超过1000万行,适合大规模因子研究和回测
  • Python 项目,便于与 pandas、numpy 等数据工具链集成

不足之处

  • 数据来源和更新机制未在简介中说明,需自行验证时效性
  • 仅293星,社区规模和文档完善度待观察

适用场景

  • 量化研究员构建市值因子和规模效应回测
  • 金融数据科学家分析长期市场结构变化
  • 学生或爱好者学习金融时间序列数据处理

替代项目

yfinance、pandas-datareader

项目介绍

marcap 是数据集领域的开源项目,由 FinanceData 开发,2018 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 293。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。

它主要面向的使用场景是:量化研究员构建市值因子和规模效应回测。同类可对比的替代方案包括 yfinance、pandas-datareader。

上一篇:crackmes-re-dataset

下一篇:VPSCI-Dataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09