flama 是基础设施领域的开源项目,由 vortico 开发,2018 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 296。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。从国内网络环境看,可直接访问。
它主要面向的使用场景是:快速将HuggingFace模型封装为内部API供团队调用。同类可对比的替代方案包括 vLLM、Triton Inference Server、Ray Serve。

一行命令把模型变成 API,自带聊天界面和 MCP 支持
flama 是一个面向预测式与生成式 AI 的生产级框架,旨在让开发者以极简方式将任意模型快速部署为 API。它解决了模型服务化过程中配置复杂、接口不统一、缺乏交互界面等痛点,核心能力包括:一行命令启动模型服务,自动生成兼容 OpenAI、Anthropic、Ollama 的 API 端点,内置可用的聊天界面,并原生支持 MCP(模型上下文协议),方便与外部工具集成。基于 Python 和 ASGI 构建,采用领域驱动设计,兼顾灵活性与可扩展性,适用于从原型验证到生产部署的多种场景。
vLLM、Triton Inference Server、Ray Serve
flama 是基础设施领域的开源项目,由 vortico 开发,2018 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 296。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。从国内网络环境看,可直接访问。
它主要面向的使用场景是:快速将HuggingFace模型封装为内部API供团队调用。同类可对比的替代方案包括 vLLM、Triton Inference Server、Ray Serve。
上一篇:FreeQwenApi
下一篇:OpenGPT
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···