marcap 是数据集领域的开源项目,由 FinanceData 开发,2018 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 293。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。
它主要面向的使用场景是:量化研究员构建市值因子和规模效应回测。同类可对比的替代方案包括 yfinance、pandas-datareader。

千万行每日市值数据,直接拿来跑量化回测
marcap 是一个开源的市场市值数据集项目,提供 1995 年至 2026 年的每日市值数据,总行数超过 1000 万。它解决的是量化研究、金融分析和回测中缺乏统一、长时间跨度市值数据的问题。核心能力包括:覆盖全球主要市场股票的每日市值记录,数据以 Python 友好的格式组织,便于直接加载到 pandas 或数据库中进行因子计算、组合构建和趋势分析。项目用 Python 编写,适合数据科学家和量化研究员快速获取历史市值面板数据,无需自行从多个来源拼接和清洗。数据集时间跨度长、粒度细,可用于研究市值因子、规模效应、市场结构变化等。
yfinance、pandas-datareader
marcap 是数据集领域的开源项目,由 FinanceData 开发,2018 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 293。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。
它主要面向的使用场景是:量化研究员构建市值因子和规模效应回测。同类可对比的替代方案包括 yfinance、pandas-datareader。
下一篇:VPSCI-Dataset
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models