tokenizer
本站收录 15 个带「tokenizer」标签的 AI 开源项目
LLMs-from-scratch手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路★ 105,758
gigatokengigatoken 是一个用 Rust 编写的高性能语言模型分词器,专注于将分词速度提升到 GB/s 级别。它解决了现有分词器(如 Hugging Face T★ 4,116
UniTokUniTok 是一个面向视觉生成与理解任务的统一分词器,由 NeurIPS 2025 Spotlight 论文提出。它解决了传统视觉分词器在生成任务(如自回归图★ 533
sacremosessacremoses 是 Moses 机器翻译工具包中分词器、真大小写转换器和文本规范化器的 Python 移植版本。它解决了 NLP 流水线中文本预处理不统一★ 497
xcodecxcodec 是一个面向音频语言模型的语义编解码器,由香港科技大学等机构在 AAAI 2025 提出。它针对传统音频编解码器(如 EnCodec)在语义信息保留★ 316
text2texttext2text 是一个面向多语言场景的文本到文本生成工具包,旨在简化跨语言 NLP 任务的开发流程。它基于 Python 构建,整合了多种主流语言模型(如 ★ 304
MOSS-Audio-TokenizerMOSS-Audio-Tokenizer 是一个基于因果 Transformer 架构(CAT)的音频分词器,旨在将连续音频信号转换为离散 token,为音频语★ 258
cevahir-aicevahir-ai 是一个全栈开源 AI 引擎,用于构建语言模型,覆盖从分词器训练、Transformer 架构、认知推理到聊天管线的完整流程。它旨在为开发者★ 243
Bert-VITS2-MNNBert-VITS2-MNN 是一个面向 Android 移动端的离线语音合成运行时,基于阿里巴巴的 MNN 推理引擎,将 Bert-VITS2 模型轻量化部署★ 162
On-Device-Stable-Diffusion这是一个在移动设备上运行 Stable Diffusion 的开源项目,基于 Flutter 框架和 Dart 语言实现。它解决了在手机等资源受限设备上部署大规★ 68
tokenutokenu 是一个类似 Unix du 命令的命令行工具,专门用于统计文件和目录的 token 使用量。它解决了开发者在管理大型代码库或文本集时,难以快速了解★ 66
MGVQMGVQ 是一个面向图像生成与重建的通用 tokenizer 模型,核心思路是让 VQ-VAE 在性能上超越传统 VAE。它通过多组量化(multi-group★ 55
py-nltoolspy-nltools 是一组用于口语自然语言处理的基础 Python 模块,旨在为语音相关的 NLP 任务提供轻量级工具集。它解决的是从原始语音或文本中提取语言★ 55
NeuroRVQNeuroRVQ是一个面向生物信号(如脑电、心电、肌电等)的多尺度神经残差向量量化(Residual Vector Quantization)工具库,旨在将连续★ 52
zon-TSzon-TS 是一个 TypeScript 库,提供 ZON(一种紧凑的文本格式)的编解码器,用于替代 JSON 作为 LLM 提示词的数据交换格式。它解决了 ★ 51