MyScaleDB

用SQL同时搞定向量搜索和全文检索,AI应用数据底座一步到位

MyScaleDB 是一个基于 ClickHouse 二次开发的开源数据库,专注于高性能向量搜索与全文搜索的融合。它解决了传统向量数据库在数据管理、实时更新和复杂查询上的短板,将向量索引与 SQL 分析能力深度整合,使用户能够通过标准 SQL 完成结构化数据过滤、全文检索和向量相似度匹配的混合查询。核心能力包括:支持多种向量索引(如 HNSW)、高效的全文检索(基于 Tantivy)、与 ClickHouse 生态兼容的列式存储和分布式架构,以及针对 AI 应用优化的数据摄取和查询性能。MyScaleDB 旨在为 RAG、推荐系统、智能问答等场景提供一站式的数据底座,降低多系统集成的复杂度和运维成本。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1045
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队myscale
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型ann,big-data,embedding,image-search,llm,myscaledb,rag,search-engine,similarity-search,sql,sql-vector,unstructured-analytics,vector-search,vectordb
GitHub 星标★ 1045
30天Star增速
HF 下载量
上线时间2024-03-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:Docker 7 步

环境要求

  • 已安装 Docker(能执行 docker run / docker compose)
  • 若使用 Docker Compose 方式,需支持 docker compose 命令(宿主目录结构需可写)
  • README 示例建议容器资源上限 16 核 CPU、32GB 内存
  • 默认用户 default 无密码,默认配置仅允许本机 IP(含 ::1、127.0.0.1)与 10.0.0.0/24 网段访问

安装与启动步骤

  1. 1启动单机容器

    拉取并运行 1.8.0 镜像。默认只允许本机访问,docker run 方式必须加 --net=host。

    docker run --name myscaledb --net=host myscale/myscaledb:1.8.0
  2. 2连接数据库命令行

    进入容器内的 clickhouse-client 交互界面,默认用户 default、无密码。

    docker exec -it myscaledb clickhouse-client
  3. 3创建 Compose 目录

    按 README 推荐结构准备目录,用于存放 compose 文件与用户配置。

    mkdir -p myscaledb/volumes/config/users.d
  4. 4编写 compose 文件

    在 myscaledb/docker-compose.yaml 中填入镜像、端口、卷映射与资源限制等配置。

  5. 5配置默认用户

    在 volumes/config/users.d/custom_users_config.xml 中写入 default 用户密码与允许访问的 IP 网段。

  6. 6启动 Compose 服务

    进入 myscaledb 目录后以后台方式启动服务。

    cd myscaledb
    docker compose up -d
  7. 7连接 Compose 实例

    Compose 启动后容器名为 myscaledb-myscaledb-1,用它进入命令行执行 SQL。

    docker exec -it myscaledb-myscaledb-1 clickhouse-client

关键配置

配置项必填说明示例
image指定 MyScaleDB 镜像及版本myscale/myscaledb:1.8.0
ports对外暴露的 HTTP/TCP/指标等端口映射'8123:8123' '9000:9000' '8998:8998' '9363:9363' '9116:91
volumes挂载数据、日志与用户配置文件,保证持久化${DOCKER_VOLUME_DIRECTORY:-.}/volumes/data:/var/lib/clickhou
custom_users_config.xml 的 passworddefault 用户密码,README 示例为空即无密码
custom_users_config.xml 的 networks允许访问数据库的 IP 网段,跨节点访问需自行添加10.0.0.0/24
deploy.resources.limits容器 CPU 与内存上限,按机器配置调整cpus: "16.00" memory: 32Gb

如何确认成功

能通过 docker exec 进入 clickhouse-client 并成功执行 SQL 语句,即表示服务启动正常。

常见问题

Q:用 docker run 启动后从其他机器连不上数据库?

A:MyScaleDB 默认配置只允许本机 IP 访问,docker run 方式需加 --net=host;要跨节点访问建议另行创建可通过其他 IP 访问的用户。

Q:默认的账号密码是什么?

A:默认用户为 default,没有密码(custom_users_config.xml 中为空),可直接用 clickhouse-client 连接。

Q:如何让其他节点访问数据库服务?

A:不要只依赖默认用户,建议按官方 MyScaleDB Create User 文档创建一个允许其他 IP 访问的用户。

Q:如何自定义 MyScaleDB 的配置?

A:把容器内 /etc/clickhouse-server 目录拷贝到本地,修改后在 docker-compose.yaml 中增加该目录映射即可生效。

注意事项

  • docker run 方式必须带 --net=host,否则无法访问容器内服务。
  • 默认用户 default 无密码,生产环境请务必创建受限用户并设置密码。
  • Compose 示例目录挂载依赖 DOCKER_VOLUME_DIRECTORY 变量,未设置时使用当前目录。
  • Compose 示例限制为 16 核 CPU、32GB 内存,可按实际机器规格调整。

核心亮点

  • 基于ClickHouse,SQL语法完整,支持复杂过滤与向量检索混合查询
  • 集成Tantivy全文索引,实现向量+关键词联合搜索,精度更高
  • 列式存储+分布式架构,海量数据下查询性能稳定,扩展性强

不足之处

  • 项目较新,生态和文档相比成熟数据库仍有差距
  • 与ClickHouse版本同步存在滞后,部分新特性可能缺失

适用场景

  • RAG应用:知识库文档的向量检索与关键词过滤结合
  • 推荐系统:用户向量与物品属性的混合查询,实时更新
  • 日志分析:全文检索+时间范围过滤+聚合统计一体化

替代项目

Milvus、Qdrant、Weaviate

项目介绍

MyScaleDB 是基础设施领域的开源项目,由 myscale 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,045)位列前 30%,在基础设施分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:RAG应用:知识库文档的向量检索与关键词过滤结合。同类可对比的替代方案包括 Milvus、Qdrant、Weaviate。

上一篇:chromem-go

下一篇:fastembed-rs

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09