遇见数据集

home_assistant_train_ru

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Home Assistant Train RU 是 acon96/Home-Assistant-Requests-V2 数据集的俄语翻译版本,包含 41,798 个示例,专为俄语小型 Home Assistant 模型的微调设计,支持工具调用、意图分类和设备控制等任务。数据集对用户查询和助手面向客户的自然语言文本回复进行了完整俄语翻译(采用非正式的“ты”称呼形式),而系统提示、工具描述、工具调用以及设备状态信息(例如“blinds.kitchen is now shut.”)则保留原始英文,因为这些内容由 Home Assistant 系统内部解析,不应更改。翻译工作使用 nvidia/nemotron-3-ultra-550b-a55b 模型完成,采用每批 50 行、5 个并行会话的处理方式,并完全保留了原始的 JSONL 结构和 messages 字段格式。每条数据记录是一个 JSON 对象,其 messages 字段遵循 OpenAI 聊天格式,其中 content 字段是由 type 和 text 组成的对象数组。数据集中特意未翻译设备状态和实体 ID(如 blinds.kitchen),在适配特定工具时需要单独的实体解析器进行处理。该数据集适用于文本生成任务,主要语言为俄语和英语,规模在 1 万到 10 万样本之间。

Home Assistant Train RU is a Russian translation of the acon96/Home-Assistant-Requests-V2 dataset, containing 41,798 examples, intended for fine-tuning small Home Assistant models in Russian, supporting tasks such as tool calling, intent classification, and device control. The dataset includes a full Russian translation of user queries and assistant-facing natural language text responses (using the informal ты form), while system prompts, tool descriptions, tool calls, and device status information (e.g., blinds.kitchen is now shut.) remain in their original English, as these are parsed internally by the Home Assistant system and should not be altered. Translation was performed using the nvidia/nemotron-3-ultra-550b-a55b model, with a batch size of 50 lines and 5 parallel sessions, fully preserving the original JSONL structure and messages field format. Each data record is a JSON object with a messages field following the OpenAI chat format, where the content field is an array of objects with type and text. Device states and entity IDs (e.g., blinds.kitchen) are intentionally left untranslated in the dataset, requiring separate entity parsers for adaptation to specific tools. The dataset is suitable for text generation tasks, primarily in Russian and English, with a scale between 10,000 and 100,000 samples.

创建时间:
2026-07-14
原始信息汇总

数据集概述

  • 数据集名称: Home Assistant Train RU
  • 许可证: MIT
  • 任务类型: 文本生成
  • 语言: 俄语(ru)、英语(en)
  • 数据集大小: 约41,798个样本,规模在10K到100K之间

描述

该数据集是 acon96/Home-Assistant-Requests-V2 的俄语化版本,专为在俄语环境下微调小型 Home Assistant 模型设计,涵盖工具调用、意图分类和设备管理等任务。

翻译内容

  • User 请求: 完全翻译为俄语,使用非正式的“ты”形式。
  • Assistant 文本回复: 自然语言回复部分已翻译。
  • 未翻译内容: System 提示、工具描述、函数描述、工具调用及设备状态(如 blinds.kitchen is now shut.)保留英文,以确保 Home Assistant 解析不受影响。

翻译方法

采用 NVIDIA 的 nvidia/nemotron-3-ultra-550b-a55b 模型(API,关闭推理模式)进行翻译,批次50行,并行5个会话,原始 JSON 行结构(包含 messages 字段)完全保留。

数据结构

每条数据为一个 JSON 对象,包含 messages 字段,格式为 OpenAI 聊天格式。示例结构如下:

json { "messages": [ { "role": "system", "content": [ { "type": "text", "text": "..." } ] }, { "role": "user", "content": [ { "type": "text", "text": "включи свет на кухне" } ] }, { "role": "assistant", "content": [ { "type": "text", "text": "Сейчас включу свет на кухне." } ] }, { "role": "assistant", "content": [ { "type": "text", "text": "light.kitchen is now on." } ] }, { "role": "tool", "content": [ { "type": "text", "text": "..." } ] } ] }

使用方式

通过 Hugging Face datasets 库加载:

python from datasets import load_dataset ds = load_dataset("RockMan256/home_assistant_train_ru")

注意事项

设备状态和实体 ID(如 blinds.kitchenlight.kitchen)未被翻译,用户需在适配具体工具时通过单独的实体解析器处理。

搜集汇总
数据集介绍
home_assistant_train_ru 数据集图片
构建方式
该数据集基于英文原版数据集acon96/Home-Assistant-Requests-V2构建,通过机器翻译将其中的用户请求和助手文本回复全面转化为俄语,并保留了系统提示、工具描述、设备状态等关键字段的英文原貌。翻译工作采用NVIDIA旗下的nemnotron-3-ultra-550b-a55b模型,以每批50行的方式并行处理,最终生成包含41798条样本的俄语工具调用数据集。原始数据的JSONL结构和messages字段格式完整保留,确保与OpenAI聊天格式兼容。
特点
数据集的核心特点是实现了对Home Assistant场景下用户指令的俄语本地化,同时确保工具调用与设备状态描述等机器可读部分保持原语言不变,从而兼顾自然语言交互的灵活性与系统调用的稳定性。此外,数据采用非正式的‘ты’形式进行翻译,使对话风格更贴近真实俄语用户的日常表达。数据集规模适中,涵盖多种智能家居控制意图,适用于小型模型的俄语指令微调和意图分类任务。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,使用一行代码即可获得完整的训练数据。每条样本包含system、user、assistant及tool角色构成的对话序列,可直接用于微调支持工具调用和意图分类的俄语语言模型。需要注意的是,数据集中的设备状态和实体ID仍为英文,使用者需在具体工具适配时通过额外的实体解析器进行处理,以确保模型输出与实际硬件接口正确匹配。
背景与挑战
背景概述
Home Assistant作为开源智能家居平台,其核心交互依赖于自然语言指令的精准解析与工具调用。然而,现有的高质量训练数据多集中于英语场景,俄语等非英语语言的支持匮乏制约了智能家居系统的本地化普及。为此,RockMan256团队于2023年基于acon96的Home-Assistant-Requests-V2数据集,通过NVIDIA顶尖模型翻译构建了home_assistant_train_ru数据集,包含41,798条俄语样本,覆盖用户请求、系统提示及设备状态生成等任务。该数据集填补了俄语智能家居指令微调数据的空白,为小型模型在设备控制、意图分类等领域的俄语适配提供了关键资源,推动了多语言智能家居技术的边界拓展。
当前挑战
该数据集面临的核心挑战首先在于领域内多语言支持的复杂性:智能家居指令需兼顾自然语言多样性、设备状态唯一性及工具调用的精准性,俄语与英语的语法结构差异加剧了翻译歧义,例如将英语祈使句转化为俄语非正式称呼时需平衡语义正确性与自然人机交互风格。其次,构建过程中的技术挑战显著:采用机器翻译时需严格保留未翻译部分(如设备ID、函数声明)以避免破坏Home Assistant的解析逻辑,而大规模并行翻译中45万余行数据的一致性子句结构维护、以及翻译模型在专业术语上的退化风险,均对数据集质量保障提出了严苛要求。
常用场景
经典使用场景
在智能家居领域,训练一个能够理解自然语言指令并执行设备控制的对话系统是核心挑战之一。home_assistant_train_ru数据集为这一任务提供了高质量的双语训练资源,其经典使用场景是微调小型语言模型,使其在俄语环境下精准解析用户的家居控制请求(如“включи свет на кухне”),并生成相应的工具调用与设备状态指令。通过保留系统提示词、函数描述和工具调用等关键结构的英语原貌,该数据集模拟了真实Home Assistant环境中自然语言与底层API交互的混合场景,为构建端到端的家庭自动化对话代理提供了扎实的基础。
实际应用
在实际应用中,home_assistant_train_ru直接服务于俄语地区智能家居系统的语音助手与文本机器人开发。例如,用户说出“закрой шторы в гостиной”,模型即可正确识别房间与设备实体,调用blinds.living_room的关闭函数,并返回操作确认。该数据集可用于优化智能音箱、家庭自动化APP以及第三方平台(如Home Assistant插件)的自然语言理解模块,实现从照明控制到安防系统的全场景覆盖。其保留设备状态英文原生的设计,便于与现有国际智能家居生态无缝对接,减少了本地化部署中的技术摩擦。
衍生相关工作
围绕home_assistant_train_ru,已衍生出多项开拓性工作。一方面,研究者基于此数据集探索了跨语言模型微调策略,如通过对比学习增强俄语实体识别的鲁棒性;另一方面,衍生工作聚焦于多轮对话中的工具调用优化,例如设计专用解码器来区分自然语言回复与系统状态更新。此外,该数据集还催生了面向俄语Home Assistant的意图分类基准测试,以及将小模型(如TinyLLaMA)适配到资源受限边缘设备的轻量化方案。这些工作共同推动了多语言智能家居助手从实验室走向家庭实际部署。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务