plexe

一句话描述,自动生成机器学习模型,快速验证想法

plexe 是一个基于提示词(prompt)构建机器学习模型的开源工具,旨在让开发者通过自然语言描述即可快速生成可用的模型,大幅降低机器学习开发门槛。它解决了传统建模过程中需要手动编写大量代码、调参繁琐、流程复杂的问题,核心能力包括:从文本提示自动生成模型架构、自动进行数据预处理、训练与评估,并支持导出为常见格式。用户只需输入类似“用逻辑回归预测房价”的指令,plexe 便会自动完成从数据加载到模型训练的全流程,适合快速原型验证和自动化建模场景。项目用 Python 实现,目前处于成长阶段,社区活跃度较高。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2645
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队plexe-ai
所属国家
官网地址https://plexe.ai
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-ai,agents,ai,machine-learning,ml,mlengineering,mlops,multiagent
GitHub 星标★ 2645
30天Star增速
HF 下载量
上线时间2025-01-05 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • Python >= 3.10, < 3.13
  • OpenAI API Key(OPENAI_API_KEY)
  • Anthropic API Key(ANTHROPIC_API_KEY)
  • 一份表格数据集(Parquet、CSV、ORC 或 Avro)
  • 可选:Docker(使用官方镜像时,已内置 PySpark、Java 等依赖)

安装与启动步骤

  1. 1安装 plexe

    使用 pip 安装核心包,默认包含 XGBoost、Keras、scikit-learn。可按需追加可选项。

    pip install plexe
  2. 2安装可选依赖

    按框架或任务追加安装,如 tabular(CatBoost+LightGBM)、pyspark、aws 等,按需选择。

    pip install "plexe[tabular,pyspark]"
  3. 3配置 API 密钥

    导出两个模型服务的密钥作为环境变量,脚本运行时会读取,缺失会无法调用 LLM。

    export OPENAI_API_KEY=sk-xxxxxxxx
    export ANTHROPIC_API_KEY=sk-ant-xxxxxxxx
  4. 4准备数据集

    准备一份表格数据文件,支持 Parquet、CSV、ORC、Avro,例如放在当前目录的 data.parquet。

  5. 5命令行生成模型

    用自然语言描述意图并指定训练数据,max-iterations 控制搜索迭代轮数,数值越大耗时越长。

    python -m plexe.main 
        --train-dataset-uri data.parquet 
        --intent "predict whether a passenger was transported" 
        --max-iterations 5
  6. 6用 Python API 调用

    适合集成到自己的脚本中,main 返回最佳方案、指标与报告三部分结果。

    from plexe.main import main
    from pathlib import Path
    
    best_solution, metrics, report = main(
        intent="predict whether a passenger was transported",
        data_refs=["train.parquet"],
        max_iterations=5,
        work_dir=Path("./workdir"),
    )
    print(f"Performance: {best_solution.performance:.4f}")
  7. 7用 Docker 运行

    官方镜像已预装 PySpark、Java 等依赖,挂载 data 与 workdir 目录并传入密钥即可。

    docker run --rm 
        -e OPENAI_API_KEY=$OPENAI_API_KEY 
        -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY 
        -v $(pwd)/data:/data -v $(pwd)/workdir:/workdir 
        plexe:py3.12 python -m plexe.main 
            --train-dataset-uri /data/dataset.parquet 
            --intent "predict customer churn" 
            --work-dir /workdir 
            --spark-mode local

关键配置

配置项必填说明示例
OPENAI_API_KEY是OpenAI 模型调用密钥,plexe 智能体依赖它sk-xxxxxxxx
ANTHROPIC_API_KEY是Anthropic 模型调用密钥,与 OpenAI 密钥配合使用sk-ant-xxxxxxxx
config.yaml否项目根目录的配置文件,可自定义 LLM 路由、搜索参数、Spark 设置config.yaml

如何确认成功

命令正常结束后会返回最佳方案与指标,并打印 Performance 数值;同时 work_dir 下会生成建模产物。

常见问题

Q:必须同时配置两个 API Key 吗?

A:README 的安装示例中同时导出了 OPENAI_API_KEY 和 ANTHROPIC_API_KEY,建议两个都配置,避免智能体调用模型时失败。

Q:支持哪些数据格式?

A:支持表格型数据集,格式包括 Parquet、CSV、ORC 和 Avro,通过 --train-dataset-uri 指定文件路径即可。

Q:需要自己写预处理和调参代码吗?

A:不需要。plexe 会根据自然语言意图自动分析数据、确定任务类型与评估指标、搜索最佳模型并完成训练。

Q:Docker 方式有什么好处?

A:官方镜像已内置 PySpark、Java 和全部依赖,省去本地环境配置;还提供 Databricks Connect 镜像构建目标。

Q:运行太慢怎么调整?

A:可减小 --max-iterations 的值来加快速度,README 中 Makefile 的 test-quick 目标就是约 1 次迭代的快速检查。

注意事项

  • Python 版本必须满足 >= 3.10 且 < 3.13,版本不符会安装失败。
  • 不安装任何 extras 时只有核心依赖(XGBoost、Keras、scikit-learn),需要 CatBoost、LightGBM、PyTorch、PySpark、AWS 支持时请显式安装对应 extras。
  • Docker 运行时需挂载数据目录和 workdir,项目根目录的 config.yaml 会被自动挂载。
  • plexe 也提供托管云服务(plexe.ai),不想本地部署可以直接使用。

核心亮点

  • 自然语言驱动,无需手写模型代码,上手极快
  • 自动处理数据预处理、训练和评估,简化全流程
  • 支持多种模型类型,可灵活适配不同任务

不足之处

  • 文档/社区待观察
  • 复杂定制场景下灵活性可能受限

适用场景

  • 快速原型验证,用自然语言描述需求即可生成模型
  • 自动化机器学习流水线,集成到现有开发流程
  • 教学演示,帮助初学者理解模型构建过程

替代项目

AutoML、H2O.ai、PyCaret

项目介绍

plexe 是模型训练领域的开源项目,由 plexe-ai 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,645)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,612 增加到 2,645,净增 33。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:快速原型验证,用自然语言描述需求即可生成模型。同类可对比的替代方案包括 AutoML、H2O.ai、PyCaret。

上一篇:neptune-client

下一篇:sklearn-diagnose

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13