遇见数据集

d0rj/RuBQ_2.0

收藏
Hugging Face2023-09-15 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: test path: data/test-* - split: dev path: data/dev-* dataset_info: features: - name: uid dtype: int64 - name: question_text dtype: string - name: query dtype: string - name: answer_text dtype: string - name: question_uris sequence: string - name: question_props sequence: string - name: answers list: - name: datatype dtype: string - name: label dtype: string - name: type dtype: string - name: value dtype: string - name: wd_names struct: - name: en sequence: string - name: ru sequence: string - name: wp_names sequence: string - name: xml:lang dtype: string - name: paragraphs_uids struct: - name: all_related sequence: int64 - name: with_answer sequence: int64 - name: tags sequence: string - name: RuBQ_version dtype: string - name: question_eng dtype: string splits: - name: test num_bytes: 1992076 num_examples: 2330 - name: dev num_bytes: 488914 num_examples: 580 download_size: 0 dataset_size: 2480990 license: cc-by-sa-4.0 task_categories: - question-answering language: - ru - en tags: - qa - machine reading source_datasets: - original pretty_name: RuBQ 2.0 size_categories: - 1K<n<10K paperswithcode_id: rubq --- # RuBQ 2.0 ## Dataset Description - **Repository:** https://github.com/vladislavneon/RuBQ/tree/master/RuBQ_2.0 - **Paper:** [RuBQ: A Russian Dataset for Question Answering over Wikidata](https://arxiv.org/abs/2005.10659) For training data see [d0rj/RuBQ_2.0-paragraphs](https://huggingface.co/datasets/d0rj/RuBQ_2.0-paragraphs).

配置项: - 配置名称:默认(default) 数据文件: - 划分集:测试集(test) 路径:data/test-* - 划分集:开发集(dev) 路径:data/dev-* 数据集信息(dataset_info): 特征字段: - 名称:uid,数据类型:64位整数(int64) - 名称:问题文本(question_text),数据类型:字符串(string) - 名称:查询语句(query),数据类型:字符串(string) - 名称:答案文本(answer_text),数据类型:字符串(string) - 名称:问题URI序列(question_uris),数据类型:字符串序列(sequence<string>) - 名称:问题属性序列(question_props),数据类型:字符串序列(sequence<string>) - 名称:答案列表(answers),数据类型:列表(list),列表元素结构: - 名称:数据类型(datatype),数据类型:字符串(string) - 名称:标签(label),数据类型:字符串(string) - 名称:类型(type),数据类型:字符串(string) - 名称:值(value),数据类型:字符串(string) - 名称:维基数据名称(wd_names),数据类型:结构体(struct),结构体字段: - 名称:英语(en),数据类型:字符串序列(sequence<string>) - 名称:俄语(ru),数据类型:字符串序列(sequence<string>) - 名称:维基百科名称(wp_names),数据类型:字符串序列(sequence<string>) - 名称:XML语言标识(xml:lang),数据类型:字符串(string) - 名称:段落UID(paragraphs_uids),数据类型:结构体(struct),结构体字段: - 名称:所有相关段落(all_related),数据类型:64位整数序列(sequence<int64>) - 名称:含答案段落(with_answer),数据类型:64位整数序列(sequence<int64>) - 名称:标签(tags),数据类型:字符串序列(sequence<string>) - 名称:RuBQ版本(RuBQ_version),数据类型:字符串(string) - 名称:英文问题(question_eng),数据类型:字符串(string) 划分集: - 名称:测试集(test),字节大小:1992076,样本数量:2330 - 名称:开发集(dev),字节大小:488914,样本数量:580 下载大小:0 数据集总大小:2480990 许可证:CC BY-SA 4.0 任务类别: - 问答(question-answering) 语言: - 俄语(ru) - 英语(en) 标签: - QA - 机器阅读(machine reading) 源数据集: - 原创数据集(original) 展示名称:RuBQ 2.0 样本规模类别:1000 < n < 10000 PapersWithCode 标识符:rubq # RuBQ 2.0 ## 数据集说明 - **代码仓库**:https://github.com/vladislavneon/RuBQ/tree/master/RuBQ_2.0 - **相关论文**:[RuBQ:面向维基数据(Wikidata)的问答俄语数据集](https://arxiv.org/abs/2005.10659) 训练数据请参考[d0rj/RuBQ_2.0-paragraphs](https://huggingface.co/datasets/d0rj/RuBQ_2.0-paragraphs)。

提供机构:
d0rj
原始信息汇总

RuBQ 2.0 数据集概述

数据集描述

特征信息

  • uid: 数据类型为 int64。
  • question_text: 数据类型为 string。
  • query: 数据类型为 string。
  • answer_text: 数据类型为 string。
  • question_uris: 数据类型为 sequence of string。
  • question_props: 数据类型为 sequence of string。
  • answers: 数据类型为 list,包含以下子特征:
    • datatype: 数据类型为 string。
    • label: 数据类型为 string。
    • type: 数据类型为 string。
    • value: 数据类型为 string。
    • wd_names: 数据类型为 struct,包含以下子特征:
      • en: 数据类型为 sequence of string。
      • ru: 数据类型为 sequence of string。
    • wp_names: 数据类型为 sequence of string。
    • xml:lang: 数据类型为 string。
  • paragraphs_uids: 数据类型为 struct,包含以下子特征:
    • all_related: 数据类型为 sequence of int64。
    • with_answer: 数据类型为 sequence of int64。
  • tags: 数据类型为 sequence of string。
  • RuBQ_version: 数据类型为 string。
  • question_eng: 数据类型为 string。

数据分割

  • test: 包含 2330 个样本,总字节数为 1992076。
  • dev: 包含 580 个样本,总字节数为 488914。

数据集大小

  • 下载大小: 0 字节。
  • 数据集大小: 2480990 字节。

许可

  • 数据集遵循 cc-by-sa-4.0 许可。

任务类别

  • 问题回答 (question-answering)

语言

  • 俄语 (ru)
  • 英语 (en)

标签

  • qa
  • machine reading

数据源

  • 原始数据 (original)

数据集名称

  • RuBQ 2.0

数据集规模

  • 1K<n<10K

相关ID

  • paperswithcode_id: rubq
搜集汇总
数据集介绍
d0rj/RuBQ_2.0 数据集图片
构建方式
RuBQ 2.0数据集是面向俄语知识库问答任务的重要资源,其构建基于Wikidata这一结构化知识图谱。数据集通过人工与自动相结合的方式,收集并标注了涵盖多领域的自然语言问题及其对应的SPARQL查询语句。每个样本包含唯一标识符、问题文本、查询语句、答案文本以及答案的详细结构化信息,如数据类型、标签和值。此外,数据集还关联了与问题相关的段落索引,并提供了英文翻译版本,以增强跨语言适用性。数据划分为测试集(2330条)和开发集(580条),确保了模型评估的可靠性。
特点
该数据集的核心特点在于其丰富的语义标注和结构化信息。每个问题不仅包含俄语原文和英文译文,还附带了问题中涉及的实体URI和属性URI,便于进行细粒度的语义解析。答案部分提供了多种表示形式,包括数据类型、标签、值以及维基数据和维基百科的多语言名称,支持不同粒度的答案检索。此外,数据集还标记了与问题相关的段落,便于进行机器阅读理解任务的扩展。整体规模适中(1K-10K),兼顾了数据多样性与标注质量。
使用方法
RuBQ 2.0可直接用于训练和评估俄语知识库问答系统。用户可通过HuggingFace Datasets库加载数据,指定配置名'default'即可获取测试集和开发集。数据以标准特征格式提供,包括问题文本、SPARQL查询和结构化答案,便于直接输入到序列到序列模型或检索式问答框架中。对于需要训练数据的场景,建议使用配套的RuBQ 2.0段落数据集。模型评估时,可利用答案的结构化信息进行精确匹配或语义相似度计算,以衡量问答性能。
背景与挑战
背景概述
随着知识图谱与问答系统的深度融合,面向特定语言的复杂问题理解成为自然语言处理领域的重要研究方向。RuBQ 2.0数据集由俄罗斯研究团队于2020年发布,依托于维基数据(Wikidata)构建,旨在推动俄语知识图谱问答技术的发展。该数据集包含2910个问题-答案对,覆盖多领域的复杂问题,并提供了问题对应的SPARQL查询语句、答案类型及多语言标注,为跨语言问答系统的训练与评估提供了稀缺的俄语资源。其核心研究问题聚焦于如何将自然语言问题精准映射为结构化查询,并验证模型在俄语环境下的推理能力。RuBQ 2.0的发布填补了俄语知识问答领域的空白,成为该领域基准测试的重要标杆,对低资源语言的知识驱动型问答研究产生了深远影响。
当前挑战
RuBQ 2.0所面临的挑战主要体现在两方面。在领域问题层面,该数据集致力于解决俄语知识图谱问答中的语义解析与实体链接难题,即如何从俄语自然语言问题中准确识别实体、关系及约束条件,并转化为可执行的SPARQL查询,这对模型的跨语言理解与知识推理能力提出了严苛要求。在构建过程中,研究人员需应对俄语语法的复杂性,包括格变化、动词变位等形态学特征对问题解析的干扰,同时要保证答案在维基数据中的准确对齐与多语言一致性,避免因知识库更新导致的标注过时问题。此外,数据集的规模限制与问题类型的分布不均衡,也为模型泛化能力的提升带来了额外挑战。
常用场景
经典使用场景
RuBQ 2.0作为面向俄语的维基数据问答基准数据集,其最经典的使用场景在于评估和推动面向知识图谱的复杂问答系统研究。该数据集精心设计了涵盖多跳推理、数值比较与时序约束等多样化的自然语言问题,并提供了对应的SPARQL查询与结构化答案,为从俄语文本到知识库语义解析的端到端模型训练与评测提供了标准化的实验平台。研究者可借此检验机器在理解俄语复杂表述、准确映射至维基数据实体与关系,以及执行多步逻辑推理方面的综合能力。
实际应用
在实际应用层面,RuBQ 2.0催生了面向俄语用户的智能信息检索系统与对话式知识服务。例如,基于该数据集训练的问答引擎可被集成到俄语搜索引擎、企业级知识管理平台或教育辅助工具中,使用户能够以自然语言直接查询维基数据中关于人物、事件、地理等领域的结构化信息。此外,该数据集还促进了跨语言问答技术的落地,使得非英语用户能够利用母语获取全球知识库中的精确答案,显著降低了知识获取的语言壁垒。
衍生相关工作
RuBQ 2.0的发布衍生了一系列具有影响力的后续工作。在模型层面,研究者基于该数据集提出了专门面向俄语知识图谱的语义解析框架,如结合BERT的序列到序列生成模型与图注意力网络的混合架构。在数据集扩展方面,社区围绕RuBQ 2.0开发了包含上下文段落的多模态版本(RuBQ 2.0-paragraphs),支持机器阅读理解与知识图谱问答的联合建模。此外,该数据集还被用作跨语言迁移学习的基准,推动了英语预训练问答模型向低资源语言的高效适配研究,并催生了针对俄语实体链接与关系抽取任务的专项评测集合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务