spark-nlp

在 Spark 上跑 NLP,海量文本秒级处理,生产级模型开箱即用

spark-nlp 是一个基于 Apache Spark 和 Spark ML 构建的自然语言处理库,提供生产级、可扩展的 NLP 解决方案。它解决了在大数据环境下进行文本处理时面临的性能瓶颈和模型部署复杂性问题,将训练和推理无缝集成到 Spark 管道中。核心能力包括:支持 200+ 种预训练模型(涵盖命名实体识别、情感分析、拼写纠正、词性标注等任务),提供统一的 DataFrame 接口和 Pipeline API,支持 TensorFlow、ONNX 等深度学习模型的导入与微调,并内置模型仓库和版本管理。它尤其适合需要处理海量文本数据、要求高吞吐和分布式计算的企业级场景,如日志分析、用户评论挖掘、智能客服等。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4159
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队JohnSnowLabs
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Scala
技术栈/模型bert,entity-extraction,language-detection,lemmatizer,llamacpp,llm,machine-translation,named-entity-recognition,natural-language-processing,nlp,onnx,part-of-speech-tagger,pyspark,question-answering,sentiment-analysis,spark,spell-checker,tensorflow,text-classification,transformers
GitHub 星标★ 4159
30天Star增速
HF 下载量
上线时间2017-09-24 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Java 运行环境(README 的 Quick Start 第一条命令就是 java -version)
  • Apache Spark / PySpark 环境(Spark NLP 构建于 Apache Spark 之上)
  • Python 与 pip(README 提供 PyPI 包 spark-nlp 的入口)
  • Scala/Java 项目需可解析 Maven Central 依赖(README 给出坐标 com.johnsnowlabs.nlp:spark-nlp_2.

安装与启动步骤

  1. 1检查 Java 环境

    README 的 Quick Start 示例以该命令开头,用于确认本机 Java 可用,NLP 管道运行依赖 JVM。

    java -version
  2. 2安装 Python 包

    README 徽章指向 PyPI 上的 spark-nlp 包,pip 安装后可在 Python/PySpark 中调用。

    pip install spark-nlp
  3. 3准备 Spark 环境

    该库基于 Apache Spark 与 Spark ML,需要先有可用的 Spark/PySpark 环境才能跑管道。

  4. 4ScalaJava 项目引入依赖

    在项目构建文件中声明 README 给出的 Maven Central 坐标 com.johnsnowlabs.nlp:spark-nlp_2.12。

  5. 5获取预训练模型

    README 称自带 100000+ 预训练 pipeline 与模型,可到官网 sparknlp.org 按任务检索下载。

如何确认成功

java -version 能正常输出、pip install spark-nlp 无报错,并在 PySpark 中调用预训练 pipeline。

常见问题

Q:README 里有安装命令吗?

A:README 的 Installation 章节暂无内容,上面的命令依据 README 中出现的 PyPI 包名 spark-nlp 与 java -version 示例整理,请以官网 sparknlp.org 文档为准。

Q:Scala 项目怎么引入这个库?

A:使用 README 中 Maven Central 徽章对应的坐标 com.johnsnowlabs.nlp:spark-nlp_2.12,在 pom.xml 中声明依赖即可。

Q:预训练模型从哪里获取?

A:README 说明库附带 100000+ 预训练 pipeline 与模型、覆盖 200+ 语言和 NER、情感分析等任务,可在官网 sparknlp.org 检索下载。

Q:一定要用分布式环境吗?

A:README 强调其构建在 Apache Spark 之上、可在分布式环境横向扩展,因此运行管道前需要可用的 Spark/PySpark 环境。

注意事项

  • README 的 Installation 章节为空,本文命令仅依据 README 中出现的 PyPI 包名与 Quick Start 示例推断,务必以官网文档为准。
  • Maven Central 坐标为 com.johnsnowlabs.nlp:spark-nlp_2.12(来自 README 徽章)。
  • README 还提供 Anaconda 分发入口,如需 conda 安装请到官网核对具体命令。
  • Spark NLP 支持导入并微调 TensorFlow、ONNX 等深度学习模型,可无缝接入 Spark Pipeline。

核心亮点

  • 原生集成 Spark 和 Spark ML,支持分布式训练和推理,可线性扩展至 PB 级数据
  • 提供 200+ 预训练模型和 300+ 语言支持,覆盖常见 NLP 任务,降低开发门槛
  • 内置模型仓库和版本管理,支持模型热更新和 A/B 测试,便于生产部署

不足之处

  • 依赖 Spark 集群,资源开销大,不适合轻量级或单机小规模场景
  • 文档和示例偏重 Scala/Java,Python 用户上手成本略高

适用场景

  • 大规模日志或用户评论的实时情感分析与实体提取
  • 构建企业级搜索、推荐系统的文本理解底层
  • 在 Spark 数据管道中集成文本清洗、特征工程和模型推理

替代项目

Hugging Face Transformers、spaCy、Stanza

项目介绍

spark-nlp 是开源模型领域的开源项目,由 JohnSnowLabs 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,159)位列前 10%,在开源模型分类的 424 个项目里位列前 14%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:大规模日志或用户评论的实时情感分析与实体提取。同类可对比的替代方案包括 Hugging Face Transformers、spaCy、Stanza。

上一篇:GLM-4.5

下一篇:nixtla

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10