遇见数据集

TigreGotico/search-term-extraction

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多语言搜索词提取数据集,专门用于标记语音助手查询中的搜索词——即传递给知识库或搜索引擎的最小主题字符串。例如,对于查询what is the speed of light?,目标是提取speed of light;而对于set volume to fifty,则没有搜索词(因为没有需要查找的主题)。该任务不是文档关键词提取,也不是完整的意图/槽位自然语言理解,而是专注于回答一个问题:我要搜索什么?——这是OVOS common-query、DuckDuckGo或Wikipedia技能向下游发送的输入。数据集支持多种语言:加泰罗尼亚语、丹麦语、德语、英语、西班牙语、巴斯克语、法语、加利西亚语、意大利语、荷兰语和葡萄牙语。数据采用序列标注格式,每个令牌有三个标签:O(不是搜索词部分)、B-KW(搜索词跨度的第一个令牌)和I-KW(搜索词跨度的延续)。每行数据包含语言、令牌列表、标签序列、原始文本、关键词(目标字符串)和数据来源。数据来源于OpenVoiceOS资源(如模板填充、真实问题)和本地LLM处理(包括生成问题)。测试集为人工标注的黄金标准,训练集部分为LLM标注的银标准。数据集旨在训练或评估位于意图分类和搜索/知识库后端之间的主题/搜索词提取器,适用于序列标注模型(如CRF、令牌分类器)或作为LLM的监督数据。

This is a multilingual search term extraction dataset specifically designed for marking search terms in voice assistant queries — that is, the minimal thematic string passed to a knowledge base or search engine. For example, for the query 'what is the speed of light?', the goal is to extract 'speed of light'; while for 'set volume to fifty', there is no search term as there is no topic to look up. This task is neither document keyword extraction nor complete intent/slot natural language understanding, but focuses on answering the question: What am I searching for? — this is the input sent downstream by OVOS common-query, DuckDuckGo or Wikipedia skills. The dataset supports multiple languages: Catalan, Danish, German, English, Spanish, Basque, French, Galician, Italian, Dutch and Portuguese. The data is in sequence labeling format, with three labels assigned to each token: O (not part of the search term), B-KW (the first token of the search term span), and I-KW (the continuation of the search term span). Each line of data contains the language, token list, label sequence, original text, keywords (target string) and data source. The data is sourced from OpenVoiceOS resources such as template filling and real user questions, as well as local LLM processing including generated questions. The test set is a manually annotated gold standard, while part of the training set is a silver standard annotated by LLMs. The dataset is intended to train or evaluate topic/search term extractors located between intent classification and the search/knowledge base backend, suitable for sequence labeling models such as CRFs and token classifiers, or as supervised data for LLMs.

提供机构:
TigreGotico
搜集汇总
数据集介绍
TigreGotico/search-term-extraction 数据集图片
构建方式
该数据集聚焦于从语音助手查询语句中精准提取搜索词这一核心任务。其构建过程融合了多种数据源与自动化标注流水线:首先,从OpenVoiceOS项目及MASSIVE语料库中获取数十种语言下基于模板的查询语句,这些模板中的内容槽位被填充以来自WikidataMediaEntities的真实实体,通过确定性规则将目标搜索词所在位置标记为B-KW/I-KW序列,其余非搜索词部分则标记为O。其次,对于来自自然对话的“common_query”源,借助本地部署的Gemma模型进行搜索子串的自动标注,并严格验证标注结果是否为原始语句的逐字子串以确保质量。此外,通过Gemma模型合成少量额外自然查询作为补充。最终,所有语料均经过queabra_frases分词器处理,确保标签与token序列对齐,形成结构化数据集。
特点
该数据集的核心优势在于其多语言覆盖与任务专门化设计。它涵盖加泰罗尼亚语、丹麦语、德语、英语、西班牙语、巴斯克语、法语、加利西亚语、意大利语、荷兰语、葡萄牙语共11种语言,每种语言均拥有独立的训练集与人工审核的测试集。数据集中有意保留了大量不包含搜索词的负面样本(如智能家居控制、计时器等指令),旨在训练模型在无从查询时能够正确地输出全O标签,避免幻觉。此外,数据集清晰区分了确定性模板来源(高质量银标)与模型辅助标注来源(需谨慎使用的银标),测试集则完全基于人类编写的标注,为模型评估提供了可靠的基准。
使用方法
该数据集专为训练和评估序列标注模型而设计,适用于基于CRF、Token分类器乃至大语言模型的搜索词抽取任务。用户可通过HuggingFace Datasets库便捷加载,例如使用`load_dataset("TigreGotico/search-term-extraction", "en")`命令获取英语子集。每个数据样本包含语言标签、分词后的token列表、对应的BIO标签序列、原始文本、搜索目标字符串及来源标识。建议将测试集用于模型性能评估,而训练集中的“common_query”与“generated”来源因涉及模型标注,在关键应用中需谨慎对待。该数据集也可作为训练参考模型crf_query_xtract的监督信号,服务于意图分类与搜索/KB后端之间的桥接模块。
背景与挑战
背景概述
在多模态人机交互与智能语音助手技术迅猛发展的当下,如何精准地从自然语言查询中抽取出可供搜索引擎或知识库直接使用的主题词,成为提升智能系统响应效率与用户体验的关键瓶颈。为此,OpenVoiceOS团队于近年推出了一个面向多语言场景的搜索词抽取数据集Search-Term Extraction,该数据集由TigreGotico主导构建,核心聚焦于从语音助手查询中识别出最小主题字符串,例如从“光速是多少?”中提取“光速”。该数据集的发布弥补了传统意图槽位填充与文档关键词抽取之间的技术空白,为跨语言查询理解任务提供了标准化的训练与评估基准,尤其对资源稀缺的欧洲小众语言如加泰罗尼亚语、巴斯克语等具有重要推动意义。
当前挑战
该数据集所应对的核心挑战在于,语音助手场景下的查询往往混杂着无需搜索的指令型语句,如“音量调到五十”,模型需在无主题时正确输出全O标签,避免虚报搜索词。此外,多语言覆盖带来的标注一致性问题尤为突出,尤其巴斯克语等低资源语言缺乏MASSIVE语料覆盖,导致训练数据分布不均。在构建过程中,团队面临标注质量的权衡难题:模板化数据虽能确定性标注槽位,却难以反映真实查询的多样性与噪声;而引入本地Gemma模型进行合成与标注虽扩展了数据规模,但仅约1.5%的行经LLM处理,且需严格校验生成结果是否为输入字符串的字面子串,以确保标签可对齐,这一校验流程对算法精度与计算开销均构成挑战。
常用场景
经典使用场景
在语音助手与自然语言处理领域,准确识别用户查询中的搜索意图核心要素始终是一项关键挑战。search-term-extraction数据集专为序列标注任务而设计,其核心目标是从用户语音指令中精准定位应交付给搜索引擎或知识库的最小主题字符串。该数据集采用B-I-O标签体系(B-KW标记搜索词起始,I-KW标记延续,O标记无关内容),并通过多语言配置覆盖加泰罗尼亚语、丹麦语、德语、英语等11种语言。经典使用场景包括构建介于意图分类与后端检索之间的搜索词提取器,既可比对条件随机场或深度双向编码器序列标注模型,也可作为大型语言模型微调的有监督信号。数据集特意保留了大量无搜索主题的负样本(如智能家居控制指令),确保模型不会在无关场景下产生幻象输出。
衍生相关工作
该数据集派生了一系列具有代表性的后续研究工作,其中最经典的是基于它训练的参考模型crf_query_xtract。研究者以此为基础,系统验证了条件随机场、轻量级Transformer及大型语言模型在搜索词提取任务上的性能差异,并提出了跨语言泛化的负样本对抗训练方案。在社区贡献方面,该数据集启发了多语言搜索词提取领域的基准方法设计,被用于评估预训练语言模型的知识边界识别能力。此外,其构建方法论(包括模板填充确定性标注与本地模型辅助的半自动标注流程)为后续低资源任务的数据集生成提供了可复现的参考框架,尤其影响了面向小众语言的信息抽取数据集设计范式。
数据集最近研究
最新研究方向
在智能语音助手与多模态搜索系统迅猛发展的当下,搜索词提取(Search-Term Extraction)正逐渐成为连接用户意图与知识库检索的关键中间环节。该数据集聚焦于从多语种语音查询中精准抽取代表搜索意图的核心短语,其研究突破了传统意图槽位填充或文档关键词提取的边界,转而关注一种更为简洁、直接的底层问题:“我应该搜索什么?”这一研究方向与当前大语言模型(LLM)在本地推理与边缘设备上的部署热点紧密相连,尤其是通过利用小型开放权重模型(如Gemma)进行无标注数据的弱监督标注与合成,极大拓展了低资源语言(如巴斯克语、加利西亚语)的训练覆盖。该数据集的构建体现了对数据质量与透明性的高度追求,其黄金测试集完全来自人工标注的评测集,同时保留了大量无搜索意图的负样本以抑制模型的幻觉倾向,这对于构建稳健且在智能家居、语音助手等实际场景中可信赖的查询理解系统具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务