
lizheng-open-context
把立正公开内容变成可溯源的 AI 上下文库
lizheng-open-context 是一个面向中文内容创作者「立正」的公开语料库与上下文工程工具,把分散在 Superlinear 帖子、精选评论、YouTube 视频字幕、Public Axioms V1 以及《真本事》中的内容整理成结构化、可溯源的上下文数据。它解决的是 AI Agent 在做中文知识问答或内容生成时,缺少高质量、可引用、带出处的领域语料的问题。核心能力包括:按来源分类的语料组织、YouTube 字幕抓取与清洗、RAG 友好的文本切分与元数据标注,以及作为 AI Skill 直接接入 Agent 工作流。项目用 Python 实现,适合做中文垂直领域知识库、个人 IP 数字分身或内容检索增强生成的开发者参考。
项目数据
使用教程
核心亮点
- 语料按来源(帖子/评论/YouTube/书籍)分类并保留出处,方便 RAG 引用溯源
- 提供 YouTube 字幕抓取与清洗流程,可直接复用到其他中文视频知识库
- 以 AI Skill 形式封装,能较低成本接入现有 Agent 或 RAG 工作流
不足之处
- 语料范围绑定单一创作者,通用性弱,换领域需大量改造
- 项目早期,文档与社区生态尚不完善,长期维护待观察
适用场景
- 为中文知识博主搭建可溯源的问答机器人
- 做个人 IP 数字分身,用其公开内容回答粉丝提问
- 研究中文 RAG 时作为带出处的垂直语料样例
替代项目
llama_index、langchain、haystack
项目介绍
上一篇:Vera
下一篇:textbook-to-note
同类项目推荐
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
qiaomu-youtube-ai-podcast
开源
一站式索引AI播客,快速找到有文字稿和总结的节目
AI 播客索引:整理 AI 播客、中文简介、Transcript 状态和总结入口 | Curated AI podcast ···