scikit-llm

用 sklearn 的语法,几行代码让 LLM 加入你的机器学习流程

scikit-llm 是一个将大语言模型无缝集成到 scikit-learn 生态的开源 Python 库。它解决了传统机器学习流程中难以直接调用 LLM 的问题,让开发者可以用熟悉的 scikit-learn API 来使用 GPT 等模型。核心能力包括:提供 ZeroShotClassifier 和 ZeroShotRegressor 等类,支持文本分类、回归等任务;内置动态标注功能,可自动生成训练数据的标签;支持模型缓存和内存持久化,减少重复 API 调用成本;兼容多种 LLM 后端(如 OpenAI、Hugging Face 模型)。通过包装器,用户只需几行代码就能在现有 sklearn 管道中引入 LLM 能力,无需学习新的框架。项目活跃,文档较全,适合希望快速在传统 ML 流程中体验 LLM 的开发者。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3535
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类对话助手
开发团队fnnx-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chatgpt,deep-learning,llm,machine-learning,scikit-learn,transformers
GitHub 星标★ 3535
30天Star增速
HF 下载量
上线时间2023-05-12 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(README 未给出具体版本要求,建议使用较新的 Python 3)
  • 可用的 pip 包管理器
  • 如需调用 ChatGPT 等云端模型,需准备对应服务的访问凭证(README 未给出具体配置方式)

安装与启动步骤

  1. 1安装 scikit-llm

    README 中唯一给出的安装命令,直接通过 pip 从 PyPI 安装该库,建议在虚拟环境中执行以免污染全局环境。

    pip install scikit-llm
  2. 2确认安装结果

    查看已安装包的版本信息,能正常输出名称与版本号即说明安装成功。

    pip show scikit-llm
  3. 3阅读快速开始示例

    README 提供了使用 GPT 做零样本文本分类的 Quick Start 示例,但节选中代码未完整展示,请到仓库主页或官网查看完整代码。

  4. 4按示例编写调用代码

    参考 Quick Start 中 ZeroShotClassifier 等类的用法,用 scikit-learn 风格 API 组织文本数据并调用模型,具体类名与参数以官方文档为准。

如何确认成功

执行 pip show scikit-llm 能显示包名、版本和安装位置,且 Python 中导入该库不报错,即表示安装成功。

常见问题

Q:安装时提示找不到 scikit-llm 包怎么办?

A:确认 pip 可正常联网(必要时配置国内镜像源),并检查 pip 版本是否过旧;仍失败请到项目 issues 区反馈。

Q:库的导入名是什么?

A:README 节选中未给出导入语句,请以官方文档和 Quick Start 示例为准,不要随意猜测模块名。

Q:使用 GPT 需要配置 API Key 吗?

A:README 仅说明可集成 ChatGPT 等模型,未给出 Key 的配置方式;调用云端模型通常需要凭证,具体请查阅官方文档。

Q:如何做零样本文本分类?

A:README 在 Quick Start 中给了零样本分类示例入口,节选代码不完整,请前往项目仓库或官网 https://beastbyte.ai 查看完整示例。

注意事项

  • README 节选中 Quick Start 的示例代码被截断,类名、参数与返回值请以官方文档为准。
  • 调用 ChatGPT 等云端大模型会产生 API 费用,注意控制调用量。
  • 项目支持模型缓存与内存持久化,可减少重复 API 调用带来的开销。
  • 安装命令在虚拟环境(如 venv、conda)中执行更安全,便于后续卸载和版本管理。

核心亮点

  • API 设计贴近 sklearn,学习成本低,可无缝接入现有 pipeline
  • 支持 ZeroShot 分类/回归,无需训练即可用 LLM 处理文本任务
  • 内置缓存与内存持久化,减少 API 调用,节省成本

不足之处

  • 依赖外部 LLM API,可能产生费用且受网络影响
  • 文档/社区待观察

适用场景

  • 快速原型验证:用 LLM 做文本分类而不想训练模型
  • 在 sklearn 流程中补充语义特征或标签
  • 小规模数据标注或动态标签生成

替代项目

LangChain、Haystack、LlamaIndex

项目介绍

scikit-llm 是开发框架领域的开源项目,由 fnnx-ai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,535)位列前 30%,在开发框架分类的 803 个项目里位列前 14%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。

它主要面向的使用场景是:快速原型验证:用LLM做文本分类而不想训练模型。同类可对比的替代方案包括 LangChain、Haystack、LlamaIndex。

上一篇:calfkit-sdk

下一篇:nitrostack

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12