FinGLM

开源金融大模型,让智能投顾和风控更普惠

FinGLM 是一个专注于金融领域的开源大模型项目,旨在通过开放协作的方式构建公益性的金融 AI 基础设施。它解决的是金融行业对专业、可信、可定制 AI 模型的需求,同时降低金融机构使用大模型的技术和成本门槛。项目核心能力包括:基于金融语料训练的领域大模型、针对金融场景优化的推理能力、以及支持私有化部署的轻量化方案。FinGLM 强调数据透明和模型可解释性,适合用于智能投顾、财报分析、风险控制等场景,通过开源社区持续迭代,推动金融 AI 的普惠发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2269
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队MetaGLM
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用,无付费版本。
访问状态
是否开源
开源协议
主要语言HTML
技术栈/模型chatglm,finacial,gpt,llama,llm
GitHub 星标★ 2269
30天Star增速
HF 下载量
上线时间2023-09-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 15 分钟 部署方式:库/依赖 6 步

环境要求

  • 已安装 git 和 git lfs(需先执行 git lfs install)
  • Python 环境可用 pip3 安装依赖
  • modelscope SDK 需为 v1.7.2rc0
  • datasets 版本限制为 >=2.8.0, <=2.13.0
  • 可访问 ModelScope 与阿里云 OSS 下载源

安装与启动步骤

  1. 1安装 git lfs

    README 明确要求安装 git lfs,用于拉取大体积数据集文件,先完成初始化再克隆。

    git lfs install
  2. 2克隆数据集仓库

    从 ModelScope 克隆 FinGLM 金融原始数据集仓库,体积较大,请预留足够磁盘空间。

    git clone http://www.modelscope.cn/datasets/modelscope/chatglm_llm_fintech_raw_dataset.git
  3. 3升级 modelscope SDK

    README 标注为重要步骤,必须升级到 v1.7.2rc0,并使用官方 releases 源安装。

    pip3 install "modelscope==1.7.2rc0" -f https://modelscope.oss-cn-beijing.aliyuncs.com/releases/repo.html
  4. 4固定 datasets 版本

    datasets 版本需限制在 >=2.8.0 且 <=2.13.0,README 示例使用 2.13.0,避免版本冲突。

    pip3 install datasets==2.13.0
  5. 5流式加载数据集

    使用 MsDataset 以流式方式加载数据集,推荐方式,stream_batch_size 可控制批大小。

    from modelscope.msdatasets import MsDataset
    
    ds = MsDataset.load('chatglm_llm_fintech_raw_dataset', split='train', use_streaming=True, stream_batch_size=1)
    for item in ds:
        print(item)
  6. 6按建议处理数据

    README 建议依次做 PDF 文本表格提取、切分、建金融数据库、信息抽取与问答库、向量库。

关键配置

配置项必填说明示例
split指定加载的数据集划分,示例中使用 traintrain
use_streaming是否使用流式方式加载,README 推荐开启以节省内存True
stream_batch_size流式加载时每次返回的样本批大小1

如何确认成功

运行加载脚本后终端持续 print 出数据集条目内容,即表示数据集加载成功。

常见问题

Q:克隆数据集时报错或文件不完整?

A:先确认已执行 git lfs install,否则拉到的只是指针文件而非真实数据,需重新克隆。

Q:modelscope 或 datasets 安装后仍然报错?

A:严格按 README 版本执行:modelscope 用 1.7.2rc0,datasets 限制在 >=2.8.0, <=2.13.0,不要随意升级。

Q:数据量太大内存不够怎么办?

A:使用 MsDataset.load 的 use_streaming=True 流式加载,并配合 stream_batch_size 控制每次读取量。

Q:加载完数据后如何继续用?

A:README 建议用 pdfplumber/pdfminer 提取文本表格,构建金融数据库与问答库,再用 pgvector 等建向量库并接入大模型。

注意事项

  • README 未提供模型权重下载与推理部署命令,本教程仅覆盖数据集获取与加载。
  • modelscope 与 datasets 的版本限制是硬性要求,升级前先确认兼容性。
  • 数据集包含大量年报文件,克隆和加载耗时较长,建议预留充足磁盘与内存。
  • 项目代码目录下有多个参赛方案,可参考 code/ 下各方案实现自行选用。

核心亮点

  • 专注金融领域,模型在财报、研报等专业文本上表现优于通用模型
  • 开源开放,支持私有化部署,满足金融数据安全合规要求
  • 社区驱动,持续迭代,降低金融机构自研大模型的门槛

不足之处

  • 模型规模和能力相比通用大模型(如GPT-4)仍有差距
  • 文档和社区生态尚在建设中,中文资料为主,国际影响力待提升

适用场景

  • 金融机构智能投顾和客户服务
  • 财报分析和金融研报自动生成
  • 金融风控和合规审查辅助

替代项目

BloombergGPT、FinBERT、PaddleNLP-Financial

项目介绍

FinGLM 是行业应用领域的开源项目,由 MetaGLM 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,269)位列前 30%,在行业应用分类的 544 个项目里位列前 12%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。免费使用,无付费版本。

它主要面向的使用场景是:金融机构智能投顾和客户服务。同类可对比的替代方案包括 BloombergGPT、FinBERT、PaddleNLP-Financial。

上一篇:TranslateBooksWithLLMs

下一篇:quant-mind

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13