遇见数据集

SINAI/Spanish-QC

收藏
Hugging Face2024-03-22 更新2024-06-11 收录
官方服务:

资源简介:

--- license: cc-by-nc-sa-4.0 language: - es tags: - Answer Search classification pretty_name: Spanish-QC --- ### Dataset Description **Paper**: [BRUJA: Question Classification for Spanish. Using Machine Translation and an English Classifier.](https://aclanthology.org/W06-1906.pdf) **Point of Contact**: magc@ujaen.es This resource is 6305 questions in Spanish labeled for Answer Search classification, following the taxonomy defined in the article "X. Li and D. Roth. Learning Question Classifiers", which has the following general and detailed categories: - ABBR: abbreviation, expansion - DESC: definition, description, mode, motif - ENTY: animal, body, color, creation, currency, disease/medical, event, food, instrument, language, letter, other, plant, product, religion, sport, substance, symbol, technique, term, vehicle, word - HUM: description, group, individual, title - LOC: city, country, mountain, other, state, other, state - NUM: code, count, date, distance, distance, money, order, other, percentage, period, speed, temperature, size, weight Starting from a set of labeled questions for English, this resource has been generated with various questions in Spanish labeled and reviewed by 3 people. ### Acknowledgments This work has been supported by the Spanish Government (MCYT) with grant TIC2003-07158-C04-04. ### Licensing Information Spanish-QC is released under the [Apache-2.0 License](http://www.apache.org/licenses/LICENSE-2.0). ### Citation Information ```bibtex @inproceedings{a-garcia-cumbreras-etal-2006-bruja, title = "{BRUJA}: Question Classification for {S}panish. Using Machine Translationand an {E}nglish Classifier", author = "Garc{\'\i}a Cumbreras, Miguel {\'A}. and Ure{\~n}a L{\'o}pez, L. Alfonso and Mart{\'\i}nez Santiago, Fernando", booktitle = "Proceedings of the Workshop on Multilingual Question Answering - {MLQA} {`}06", year = "2006", url = "https://aclanthology.org/W06-1906", } ```

许可证:知识共享署名-非商业性使用-相同方式共享4.0协议(CC BY-NC-SA 4.0) 语言:西班牙语(es) 标签:答案搜索分类(Answer Search classification) 展示名称:西班牙语问答分类数据集(Spanish-QC) ### 数据集说明 **论文**:[BRUJA:西班牙语问句分类。利用机器翻译与英语分类器(BRUJA: Question Classification for Spanish. Using Machine Translation and an English Classifier)](https://aclanthology.org/W06-1906.pdf) **联系人**:magc@ujaen.es 本数据集包含6305条经标注的西班牙语问句,用于答案搜索分类任务,其分类体系源自论文《X. Li与D. Roth:学习问句分类器》,包含以下一级分类及对应二级分类类别: - ABBR:缩写、扩展 - DESC:定义、描述、方式、缘由 - ENTY:动物、身体部位、颜色、创造物、货币、疾病/医疗、事件、食物、工具、语言、字母、其他、植物、产品、宗教、运动、物质、符号、技术、术语、交通工具、词语 - HUM:人物描述、群体、个体、头衔 - LOC:城市、国家、山脉、其他、州、其他、州 - NUM:代码、数量、日期、距离、距离、金额、序号、其他、百分比、时段、速度、温度、尺寸、重量 本数据集以英语标注问句集为基础,通过人工标注并经3名评审人员审核后生成。 ### 致谢 本研究获得西班牙政府(MCYT)资助,资助编号为TIC2003-07158-C04-04。 ### 许可信息 西班牙语问答分类数据集(Spanish-QC)采用Apache-2.0许可证(Apache-2.0 License)发布,详情见:http://www.apache.org/licenses/LICENSE-2.0 ### 引用信息 bibtex @inproceedings{a-garcia-cumbreras-etal-2006-bruja, title = "{BRUJA}:西班牙语问句分类。利用机器翻译与英语分类器", author = "García Cumbreras, Miguel Á. and Ureña López, L. Alfonso and Martínez Santiago, Fernando", booktitle = "Proceedings of the Workshop on Multilingual Question Answering - {MLQA} `06", year = "2006", url = "https://aclanthology.org/W06-1906", }

提供机构:
SINAI
原始信息汇总

数据集描述

论文: BRUJA: Question Classification for Spanish. Using Machine Translation and an English Classifier.

联系人: magc@ujaen.es

该资源包含6305个西班牙语问题,用于答案搜索分类,遵循文章“X. Li and D. Roth. Learning Question Classifiers”中定义的分类法,包括以下一般和详细类别:

  • ABBR: 缩写, 扩展
  • DESC: 定义, 描述, 模式, 主题
  • ENTY: 动物, 身体, 颜色, 创造, 货币, 疾病/医疗, 事件, 食物, 乐器, 语言, 字母, 其他, 植物, 产品, 宗教, 体育, 物质, 符号, 技术, 术语, 交通工具, 单词
  • HUM: 描述, 团体, 个人, 头衔
  • LOC: 城市, 国家, 山脉, 其他, 州, 其他, 州
  • NUM: 代码, 计数, 日期, 距离, 距离, 金钱, 顺序, 其他, 百分比, 时期, 速度, 温度, 大小, 重量

该资源从一组标记的英语问题开始,生成了多种西班牙语标记问题,并由3人进行了审查。

致谢

该工作得到了西班牙政府(MCYT)的资助,授予TIC2003-07158-C04-04。

许可信息

Spanish-QC 在 Apache-2.0 License 下发布。

引用信息

bibtex @inproceedings{a-garcia-cumbreras-etal-2006-bruja, title = "{BRUJA}: Question Classification for {S}panish. Using Machine Translationand an {E}nglish Classifier", author = "Garc{\i}a Cumbreras, Miguel {A}. and Ure{~n}a L{o}pez, L. Alfonso and Mart{\i}nez Santiago, Fernando", booktitle = "Proceedings of the Workshop on Multilingual Question Answering - {MLQA} {`}06", year = "2006", url = "https://aclanthology.org/W06-1906", }

搜集汇总
数据集介绍
SINAI/Spanish-QC 数据集图片
构建方式
在问答系统与信息检索领域,高质量的分类数据集是推动技术发展的基石。SINAI/Spanish-QC数据集应运而生,其构建过程严谨而富有创新性。该数据集包含6305条西班牙语问句,所有问句均依据X. Li与D. Roth提出的分类体系进行标注,涵盖ABBR、DESC、ENTY、HUM、LOC、NUM六大粗粒度类别及若干细粒度子类。为跨越语言障碍,研究者巧妙利用已标注的英语问句作为种子资源,通过机器翻译技术生成西班牙语版本,并经过三名母语者的独立审核与修正,确保了标注的准确性与文化适应性。这一方法不仅高效扩充了西班牙语问答资源,也为低资源语言的分类任务提供了可复现的范式。
特点
该数据集的核心特色在于其双语迁移的构建策略与精细化的分类层次。不同于直接人工标注,SINAI/Spanish-QC通过机器翻译与人工校验的结合,在保留原始英语分类体系完整性的同时,实现了西班牙语问句的自然表达。其分类体系涵盖39个细粒度类型,从具体实体(如动物、货币)到抽象概念(如定义、模式)一应俱全,为细粒度问答分析提供了丰富维度。此外,每条问句均经过多人交叉验证,显著降低了翻译歧义与标注噪声,使得数据集在学术研究中具备高可靠性与可复现性,尤其适用于跨语言问答系统的基准测试。
使用方法
研究者可便捷地通过HuggingFace平台加载该数据集,直接应用于西班牙语问句分类任务的训练与评估。具体而言,用户可利用transformers库中的load_dataset函数,指定数据集标识符SINAI/Spanish-QC,即可获取结构化的训练与测试样本。每条样本包含问句文本及其对应的粗粒度与细粒度标签,适合用于构建多层级分类模型。同时,该数据集也可作为跨语言迁移学习的验证基准,例如评估机器翻译质量对下游分类任务的影响。建议使用时结合西班牙语自然语言处理工具(如分词器与词嵌入)进行预处理,以充分挖掘其语言特征。
背景与挑战
背景概述
在自然语言处理领域,问题分类作为问答系统的核心环节,其目标在于精准识别用户查询的意图类型,从而为后续的信息检索与答案生成提供关键指引。西班牙语作为全球使用广泛的语种之一,其问答系统的发展却长期受限于高质量标注语料的匮乏。为突破这一瓶颈,Miguel Á. García Cumbreras、L. Alfonso Ureña López 及 Fernando Martínez Santiago 等研究人员于2006年构建了 Spanish-QC 数据集,该数据集包含6305条西班牙语问题,并依据 Li 与 Roth 提出的分类体系进行标注,涵盖缩写、描述、实体、人物、地点及数字等六大粗粒度类别及数十种细粒度子类。其发布不仅为西班牙语问题分类研究奠定了基准资源,更推动了多语言问答技术的进步。
当前挑战
Spanish-QC 数据集所面临的挑战主要体现在两个层面:在领域问题层面,问题分类任务需应对西班牙语中丰富的形态变化与句法灵活性,例如动词变位与名词阴阳性对特征提取造成的干扰,同时细粒度类别间边界模糊(如“地点”与“实体”下的子类交叉)增加了分类歧义性;在构建过程中,研究团队采用基于机器翻译的跨语言迁移策略,将英语标注问题自动转换为西班牙语,但机器翻译的误差(如词汇歧义与语序错乱)导致初始标签噪声显著,尽管后续通过三人人工审核进行修正,仍难以完全消除语义失真,且人工校验成本高昂。这些挑战共同制约了模型在真实场景中的鲁棒性与泛化能力。
常用场景
经典使用场景
Spanish-QC数据集是西班牙语问答系统研究中的基石性资源,其核心应用场景在于训练和评估西班牙语问题分类器。该数据集包含6305条经过人工标注的西班牙语问题,遵循Li和Roth提出的经典分类体系,涵盖ABBR、DESC、ENTY、HUM、LOC、NUM六大粗粒度类别及其细粒度子类。研究者常利用此数据集构建基于机器学习的分类模型,将自然语言问题自动映射到预定义的答案类型,从而为后续的答案检索与生成提供精准的语义指引。这一场景下,Spanish-QC不仅作为训练语料,更成为跨语言问题理解技术验证的基准平台,推动了西班牙语信息检索领域的标准化进程。
解决学术问题
该数据集有效解决了西班牙语问答系统中问题语义理解的关键学术难题。在缺乏大规模高质量标注资源的背景下,Spanish-QC通过融合机器翻译与人工校验的创新方法,构建了首个系统化的西班牙语问题分类基准。它突破了语言壁垒,使得研究者能够探索跨语言迁移学习、领域自适应等前沿课题,并验证多语言分类模型的泛化能力。此外,该数据集为问题意图识别、细粒度语义解析等研究方向提供了标准化的评测框架,显著提升了西班牙语自然语言处理任务的评估可靠性,对低资源语言的技术发展具有里程碑式的学术意义。
衍生相关工作
Spanish-QC衍生了一系列具有影响力的经典工作,其中最具代表性的是BRUJA系统,它开创了利用机器翻译将英语问题分类器适配至西班牙语的范式。后续研究在此基础上,探索了基于Transformer的预训练模型(如BETO、RoBERTa-base-es)的微调策略,并引入对比学习以增强细粒度类别区分。此外,该数据集催生了跨语言问题分类的基准测试,推动诸如XLM-R、mT5等模型的西班牙语性能优化。部分工作还将其与问答对生成任务结合,构建了端到端的西班牙语问答流水线,这些成果共同构成了西语NLP领域从分类到生成的技术演进脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务