fastembed

轻量快速生成文本向量,让嵌入计算快人一步

fastembed 是一个轻量级、高性能的 Python 库,专注于生成高质量的文本嵌入向量。它基于 ONNX Runtime 和 Transformers.js,将 SOTA 模型(如 BGE、E5 等)优化为高效的 ONNX 格式,提供简洁的 API 接口,支持批量处理、异步调用和多种模型选择。它解决了传统嵌入库(如 sentence-transformers)在推理速度慢、依赖重、部署复杂等问题,特别适合需要快速生成嵌入用于检索、聚类、分类等下游任务的场景。核心能力包括:极快的推理速度(CPU 上比同类库快数倍)、极小的内存占用、支持多种主流嵌入模型、提供向量索引和查询功能(配合 Qdrant 等向量数据库)、以及简单的安装和使用流程。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3213
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队qdrant
所属国家
定价模式free
价格说明开源Python库,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型embeddings,openai,rag,retrieval,retrieval-augmented-generation,vector-search
GitHub 星标★ 3213
30天Star增速
HF 下载量
上线时间2023-07-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • 已安装 Python 环境(README 未指定具体版本,建议使用 pip 可用的 Python 3 环境)
  • 可访问外网:首次使用需下载 ONNX 格式的模型文件
  • 无需 GPU,FastEmbed 基于 ONNX Runtime,在 CPU 上即可运行
  • README 提到可安装带 GPU 支持的版本,但节选中未给出具体命令

安装与启动步骤

  1. 1安装 fastembed

    README 推荐使用 pip 安装。不加额外参数即可安装默认(CPU)版本。

    pip install fastembed
  2. 2验证库可导入

    导入默认文本嵌入类 TextEmbedding,确认安装成功且无导入报错。

    python -c "from fastembed import TextEmbedding"
  3. 3安装 Qdrant 集成版

    若要把 FastEmbed 与 Qdrant 向量库配合使用,安装带 fastembed 扩展的客户端。

    pip install qdrant-client[fastembed]
  4. 4zsh 用户加引号

    在 zsh 下中括号会被解析,命令需用引号包裹,否则可能安装失败。

    pip install 'qdrant-client[fastembed]'

如何确认成功

执行 python -c "from fastembed import TextEmbedding" 无报错,即表示库已正确安装可用。

常见问题

Q:需要 GPU 或 PyTorch 吗?

A:不需要。FastEmbed 依赖 ONNX Runtime,不下载体量巨大的 PyTorch,也不需要 GPU,适合 AWS Lambda 等 serverless 环境。

Q:为什么安装后第一次运行会卡住?

A:首次使用会下载所选模型的 ONNX 权重文件,需要联网并有耐心等待;后续调用会复用本地缓存。

Q:默认的文本嵌入模型是什么?

A:默认 TextEmbedding 使用 Flag Embedding(BGE)模型,支持对输入文本使用 query 和 passage 前缀以适配检索场景。

Q:zsh 下安装 qdrant-client 报错怎么办?

A:中括号被 shell 解析导致,把包名整体加引号:pip install 'qdrant-client[fastembed]'。

Q:想装 GPU 版本怎么装?

A:README 说明支持带与不带 GPU 两种安装方式,但节选内容被截断,未给出确切命令,请查阅官方文档 https://qdrant.github.io/fastembed 确认。

注意事项

  • 本项目是 Python 库,不是独立服务,安装后无需启动进程,直接在代码中导入使用。
  • README 中的 Quickstart 与 GPU 安装部分在节选里被截断,具体 API 用法请以官网文档为准。
  • FastEmbed 主打轻量、快速、准确,官方称其效果好于 OpenAI Ada-002,并支持多种多语言模型。
  • 若需向量检索/索引能力,可结合 Qdrant 使用,README 提供了 Retrieval with FastEmbed 与 Usage With Qdrant 示例链接。

核心亮点

  • 基于 ONNX Runtime,CPU 推理速度比 sentence-transformers 快 2-10 倍,内存占用低
  • API 设计简洁,几行代码即可生成嵌入,支持批量处理和异步模式
  • 内置多种 SOTA 模型(如 BGE、E5),并持续更新,且模型文件自动下载缓存

不足之处

  • GPU 支持有限,主要针对 CPU 优化,大规模 GPU 训练场景不适用
  • 自定义模型转换流程较为繁琐,需手动转换为 ONNX 格式
  • 文档/社区待观察

适用场景

  • 构建 RAG 应用,快速生成文档块向量用于检索
  • 文本相似度计算、语义搜索、推荐系统
  • 在资源受限的环境(如边缘设备、低配服务器)中部署嵌入服务

替代项目

sentence-transformers、text-embeddings-inference、Instructor Embedding

项目介绍

fastembed 是基础设施领域的开源项目,由 qdrant 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,213)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,137 增加到 3,213,净增 76。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源Python库,Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:构建RAG应用,快速生成文档块向量用于检索。同类可对比的替代方案包括 sentence-transformers、text-embeddings-inference、Instructor Embedding。

上一篇:pipeshub-ai

下一篇:examples

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09