duckdb-embedding-search

用DuckDB跑向量搜索,免装向量数据库,小数据量秒级响应

duckdb-embedding-search 是一个基于 DuckDB 的快速向量相似度搜索工具,专为轻量级嵌入检索场景设计。它利用 DuckDB 的列式存储和并行执行能力,将高维向量直接存储于数据库表中,并通过自定义距离函数(如余弦、欧氏)实现高效的暴力扫描式最近邻搜索,无需引入独立的向量数据库。该项目解决的是中小规模数据集(百万级以内)下,开发者希望避免维护复杂基础设施、快速集成嵌入搜索功能的问题。核心能力包括:支持多种向量距离度量、提供简洁的 Python API、与现有 DuckDB 工作流无缝衔接、支持过滤条件与向量搜索结合。其优势在于部署简单、依赖少,适合原型验证、教学演示或数据量可控的生产场景。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 152
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队patricktrainer
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型cosine-similarity,duckdb,embeddings,gpt-4,llm,openai,rag,search-engine,semantic-search,similarity-search,vector,vector-database,vector-search
GitHub 星标★ 152
30天Star增速
HF 下载量
上线时间2024-01-09 00:00:00
最近更新2026-09-15 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 基于DuckDB,无需额外服务,代码轻量易部署
  • 支持余弦、欧氏等多种距离度量,API简洁
  • 与SQL查询结合,可同时做向量检索和结构化过滤

不足之处

  • 暴力扫描方式,数据量增大时性能下降明显
  • 文档/社区待观察

适用场景

  • 中小规模嵌入向量的快速原型验证
  • 在已有DuckDB数据管道中附加相似搜索功能
  • 教学演示或离线批处理相似度计算

替代项目

sqlite-vec、Chroma、FAISS

项目介绍

duckdb-embedding-search 是搜索知识领域的开源项目,由 patricktrainer 开发,2024 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 152。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:中小规模嵌入向量的快速原型验证。同类可对比的替代方案包括 sqlite-vec、Chroma、FAISS。

上一篇:pdfstract

下一篇:SimGRAG

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09