BR-TaxQA
收藏资源简介:
该数据集是一个葡萄牙语单语文本检索数据集,包含三个主要配置:1) 'default'配置:存储查询-文档对及其相关性分数(1210个测试样本),字段包括query_id(字符串)、corpus_id(字符串)和score(浮点数);2) 'corpus'配置:包含715篇文档,每篇文档具有_id(字符串)、title(字符串)和text(字符串)字段;3) 'queries'配置:包含715条独立查询,每条查询包含_id(字符串)和text(字符串)字段。数据集适用于文本检索任务,文件以JSONL格式存储,包含明确的训练/测试划分。
This dataset is a Portuguese monolingual text retrieval dataset consisting of three primary configurations: 1) The 'default' configuration: stores query-document pairs along with their relevance scores (1210 test samples), with fields including query_id (string), corpus_id (string), and score (float); 2) The 'corpus' configuration: contains 715 documents, each with fields _id (string), title (string), and text (string); 3) The 'queries' configuration: contains 715 standalone queries, each with fields _id (string) and text (string). This dataset is applicable to text retrieval tasks, with files stored in JSONL format and explicit train/test splits provided.
BR-TaxQA 数据集概述
基本信息
- 数据集名称:BR-TaxQA
- 语言:葡萄牙语 (pt)
- 多语言性:单语
- 主要任务类别:文本检索 (text-retrieval)
- 标签:文本 (text)
数据集配置与结构
数据集包含三个配置,具体结构如下:
1. 配置名称:default
- 数据文件路径:
qrels/test.jsonl - 对应分割:test
- 样本数量:1210
- 特征:
query_id(数据类型:string)corpus_id(数据类型:string)score(数据类型:float64)
2. 配置名称:corpus
- 数据文件路径:
corpus.jsonl - 对应分割:corpus
- 样本数量:715
- 特征:
_id(数据类型:string)title(数据类型:string)text(数据类型:string)
3. 配置名称:queries
- 数据文件路径:
queries.jsonl - 对应分割:queries
- 样本数量:715
- 特征:
_id(数据类型:string)text(数据类型:string)



