DB-GPT-Hub

一键微调大模型,让数据库查询更智能

DB-GPT-Hub 是围绕 Text-to-SQL 任务打造的开源模型、数据集与微调技术仓库,旨在提升数据库自然语言查询的准确率。它解决了从模型选型、数据准备到微调训练全流程的工程化难题,核心能力包括提供多种主流大模型(如 Llama、Qwen 等)的微调脚本、高质量 Text-to-SQL 数据集(如 Spider、WikiSQL 等)的整合与处理工具,以及针对不同模型和硬件环境的训练配置。项目基于 Python 实现,与 DB-GPT 生态紧密结合,支持 LoRA、QLoRA 等高效微调方法,帮助开发者快速构建和优化自己的 Text-to-SQL 模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2015
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队eosphoros-ai
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型database,datasets,fine-tuning,gpt,hacktoberfest,llm,nl2sql,sql,text-to-sql,text2sql
GitHub 星标★ 2015
30天Star增速
HF 下载量
上线时间2023-06-02 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 3 步

环境要求

  • 可运行 Python 的环境(README 未指定具体版本)
  • 已安装 pip,可访问 PyPI 下载 dbgpt-hub
  • 运行微调/预测时可用的计算资源(README 快速开始未说明显存要求)
  • 已准备好用于 Text-to-SQL 训练的数据与数据配置信息

安装与启动步骤

  1. 1安装 dbgpt-hub

    README 的 Quick Start 第一步即在命令行安装该库,安装后可导入 dbgpt_hub_sql 下的模块。建议在虚拟环境中执行以避免依赖冲突。

    pip install dbgpt-hub
  2. 2编写并运行流程脚本

    新建 Python 文件,按 README 示例导入数据预处理、训练、预测、评估四个入口,并依次调用,实现从数据到评估的完整微调流程。

    from dbgpt_hub_sql.data_process import preprocess_sft_data
    from dbgpt_hub_sql.train import start_sft
    from dbgpt_hub_sql.predict import start_predict
    from dbgpt_hub_sql.eval import start_evaluate
    
    # Run the whole fine-tuning workflow
    preprocess_sft_data(
          data_folder = data_folder,
          data_info = data_info
    )
    
    start_sft(train_args)
    start_predict(predict_args)
    start_evaluate(evaluate_args)
  3. 3准备参数与数据

    执行前需自行取得 data_folder、data_info 以及 train_args、predict_args、evaluate_args 这几个参数与配置,README 未给出它们的具体字段与示例值。

关键配置

配置项必填说明示例
data_folder是传给 preprocess_sft_data 的数据所在目录,README 未说明目录结构/your/path/to/data
data_info是传给 preprocess_sft_data 的数据信息参数,README 未说明其格式/your/path/to/data_info
train_args是传给 start_sft 的训练参数,README 未列出可用字段train_args
predict_args是传给 start_predict 的预测参数,README 未列出可用字段predict_args
evaluate_args是传给 start_evaluate 的评估参数,README 未列出可用字段evaluate_args

如何确认成功

脚本从数据预处理到评估依次执行完毕且无报错,即表示快速开始流程跑通;README 未给出具体的输出文件或端口验证方式。

常见问题

Q:pip install dbgpt-hub 失败怎么办?

A:确认网络可访问 PyPI、pip 版本正常,并尽量在干净的虚拟环境中安装,避免与已有依赖版本冲突。

Q:必须要有 GPU 吗?

A:README 的 Quick Start 未说明硬件要求。微调大模型通常需要 GPU,请结合所选模型与训练参数自行评估,本节未给出显存数据。

Q:train_args 等参数该怎么填?

A:README 节选只演示了调用方式,未列出参数字段。建议到仓库中查看对应模块的源码或文档,确认可用参数后再填写。

Q:支持哪些数据集和模型?

A:项目定位为 Text-to-SQL 数据集整合与多模型微调,README 中还提到 Text2NLU、Text2GQL 微调,具体支持列表请查阅仓库中的 docs 与各子模块说明。

注意事项

  • 本教程只依据 README 节选中出现的 pip 包名与函数调用整理,未出现的命令、端口、路径均未补写。
  • 参数配置(data_folder、train_args 等)README 未给出字段说明,实际取值需查阅仓库源码或文档。
  • 微调与预测会消耗较多计算资源,建议在独立环境或容器中运行,避免影响本机其他任务。

核心亮点

  • 整合了 Spider、WikiSQL 等多个公开数据集,并提供统一的数据处理脚本,降低数据准备门槛
  • 支持多种主流大模型(Llama、Qwen 等)的 LoRA/QLoRA 微调,适配不同算力环境
  • 与 DB-GPT 项目深度集成,可直接用于增强其 Text-to-SQL 能力,生态联动性强

不足之处

  • 文档和社区支持尚在完善中,新手入门可能遇到问题
  • 对中文 Text-to-SQL 场景的优化有限,主要依赖英文数据集

适用场景

  • 开发基于自然语言的数据库查询助手
  • 针对特定业务数据库微调专用 Text-to-SQL 模型
  • 研究大模型在结构化数据上的推理能力

替代项目

Text-to-SQL 相关:SQLNet、Text-to-SQL 相关:Seq2SQL、Text-to-SQL 相关:T5-SQL

项目介绍

DB-GPT-Hub 是模型训练领域的开源项目,由 eosphoros-ai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,015)位列前 30%,在模型训练分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:开发基于自然语言的数据库查询助手。同类可对比的替代方案包括 Text-to-SQL 相关:SQLNet、Text-to-SQL 相关:Seq2SQL、Text-to-SQL 相关:T5-SQL。

上一篇:simple-llm-finetuner

下一篇:all-rl-algorithms

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13