home-assistant-datasets 是数据集领域的开源项目,由 allenporter 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 252。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源免费,数据集可自由使用。
它主要面向的使用场景是:对比GPT、Claude与本地模型在智能家居指令理解上的准确率。同类可对比的替代方案包括 AgentBench、ToolBench。

用真实家居指令给大模型跑分,选型不靠猜
home-assistant-datasets 是 Home Assistant 官方生态下用于评估 AI 模型在智能家居场景中表现的数据集集合。它解决的核心问题是:大语言模型在控制家居设备、理解用户意图、生成自动化规则时缺乏统一、可复现的评测基准。项目提供结构化的任务样本,涵盖设备控制指令解析、状态查询、场景联动等典型交互,让开发者能横向对比不同模型(如 GPT、Claude、本地开源模型)在 Home Assistant 语境下的准确率与鲁棒性。数据以 Jupyter Notebook 形式组织,便于直接加载、跑分和可视化分析,也可作为微调或提示工程迭代的参考依据。整体定位偏评测工具而非训练数据,适合做模型选型、回归测试和学术研究。
AgentBench、ToolBench
home-assistant-datasets 是数据集领域的开源项目,由 allenporter 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 252。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源免费,数据集可自由使用。
它主要面向的使用场景是:对比GPT、Claude与本地模型在智能家居指令理解上的准确率。同类可对比的替代方案包括 AgentBench、ToolBench。
上一篇:Nepali-Datasets
下一篇:ml-hypersim
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models