tokenization

本站收录 11 个带「tokenization」标签的 AI 开源项目

toonTOON(Token-Oriented Object Notation)是一种面向LLM提示词的紧凑型数据序列化格式,专为减少Token消耗而设计。它解决了传统★ 25,437gigatokengigatoken 是一个用 Rust 编写的高性能语言模型分词器,专注于将分词速度提升到 GB/s 级别。它解决了现有分词器(如 Hugging Face T★ 4,116tokencosttokencost 是一个轻量级的 Python 库,为 400 多个大语言模型提供统一的 token 价格估算。它解决了开发者在选择或调用不同 LLM 时,因★ 2,006llms-from-scratch这是一个从零开始用 PyTorch 构建类 ChatGPT 大语言模型的教学项目,通过 Jupyter Notebook 逐步讲解每个实现细节。它解决的是初学者★ 384TOTEMTOTEM 是一个面向通用时间序列分析的开源模型,核心思路是将连续的时间序列数据离散化为 token(令牌),从而将时间序列分析任务统一转化为类似自然语言处理的★ 373OmniTokenizerOmniTokenizer 是一个用于图像和视频联合分词(tokenization)的统一模型,来自 NeurIPS 2024。它解决了图像和视频生成中分词器不★ 330asset-intel-orchestration-engine这是一个面向机构级资产代币化与多智能体编排的开源平台,旨在解决真实世界资产(RWA)上链过程中的复杂工作流管理问题。它提供基于OAuth 2.1的MCP智能体管★ 251magikarpmagikarp 是一个与论文《Fishing for Magikarp》配套的开源代码库,聚焦于一种新型的模型训练或推理方法。该项目通过特定的算法或框架,旨在★ 191language-ai-engineering-labLanguage AI Engineering Lab 是一个专注于语言AI工程实践的开源学习仓库,旨在帮助开发者从基础原理到生产部署,系统性地理解和构建现代语★ 127llm-docs-builderllm-docs-builder 是一个用 Ruby 编写的开源工具,旨在将 Markdown 格式的文档转换为针对大型语言模型(LLM)和检索增强生成(RAG★ 96tokenutokenu 是一个类似 Unix du 命令的命令行工具,专门用于统计文件和目录的 token 使用量。它解决了开发者在管理大型代码库或文本集时,难以快速了解★ 66