ragtruth-translated-hallucinations
收藏资源简介:
该数据集是一个多语言自然语言处理数据集,覆盖13种语言:白俄罗斯语(be)、保加利亚语(bg)、波斯尼亚语(bs)、加泰罗尼亚语(ca)、捷克语(cs)、丹麦语(da)、爱沙尼亚语(et)、芬兰语(fi)、法罗语(fo)、法语(fr)、克罗地亚语(hr)、荷兰语(nl)和阿尔巴尼亚语(sq)。每个语言配置独立,仅包含训练集,样本量在17,500至17,800条之间。每条样本包括以下字段:提示文本(字符串类型)、答案文本(字符串类型)、标签列表(字典列表,每个字典包含起始位置、结束位置和标签)、数据分割标识、任务类型标识、来源数据集标识和语言标识。从数据结构推断,适用于文本序列标注(如命名实体识别、词性标注)或问答相关机器学习任务,旨在支持多语言NLP模型的训练与评估。
This dataset is a multilingual natural language processing dataset covering 13 languages: Belarusian (be), Bulgarian (bg), Bosnian (bs), Catalan (ca), Czech (cs), Danish (da), Estonian (et), Finnish (fi), Faroese (fo), French (fr), Croatian (hr), Dutch (nl), and Albanian (sq). Each language configuration is independent and includes only the training set, with sample sizes ranging approximately from 17,500 to 17,800 entries. Each sample contains the following fields: prompt text (string type), answer text (string type), a list of labels (a list of dictionaries, each containing start position, end position, and label), data split identifier, task type identifier, source dataset identifier, and language identifier. Based on the data structure, it is suitable for text sequence labeling tasks (such as named entity recognition, part-of-speech tagging) or question-answering related machine learning tasks, aiming to support the training and evaluation of multilingual NLP models.
数据集名称
ragtruth-translated-hallucinations
数据集简介
该数据集是 RAGTruth 数据集的多语言翻译版本,专注于检索增强生成(RAG)场景中的幻觉检测任务。数据集中每个样本包含一个提示(prompt)和对应的模型回答(answer),并对回答中的幻觉片段进行了细粒度的标注。
语言覆盖
数据集包含以下 16 种语言配置(config_name):
- 白俄罗斯语(be)
- 保加利亚语(bg)
- 波斯尼亚语(bs)
- 加泰罗尼亚语(ca)
- 捷克语(cs)
- 丹麦语(da)
- 德语(de)
- 希腊语(el)
- 爱沙尼亚语(et)
- 芬兰语(fi)
- 法罗语(fo)
- 法语(fr)
- 克罗地亚语(hr)
- 匈牙利语(hu)
- 荷兰语(nl)
- 阿尔巴尼亚语(sq)
数据规模
每种语言配置包含约 17,551 至 17,789 条训练样本,总样本数超过 28 万条。以下是各语言的具体样本数量:
- be: 17,771
- bg: 17,775
- bs: 17,787
- ca: 17,789
- cs: 17,766
- da: 17,788
- de: 17,776
- el: 17,771
- et: 17,779
- fi: 17,763
- fo: 17,551
- fr: 17,782
- hr: 17,787
- hu: 17,784
- nl: 17,772
- sq: 17,786
数据特征
每条数据包含以下字段:
- prompt: 字符串,表示用户输入的提示。
- answer: 字符串,表示模型生成的回答。
- labels: 一个列表,包含对回答中幻觉片段的标注,每个标注包含:
- start: 整数,幻觉片段在回答中的起始位置。
- end: 整数,幻觉片段在回答中的结束位置。
- label: 字符串,幻觉类型的标签。
- split: 字符串,数据划分(当前仅包含
train集)。 - task_type: 字符串,任务类型。
- dataset: 字符串,来源数据集名称。
- language: 字符串,语言代码。
数据划分
所有语言配置均仅包含训练集(train),无验证集或测试集。
数据文件
每种语言的数据文件存储在对应语言代码的目录下,文件名为 train-*,例如 be/train-*。数据格式为 Parquet 文件。




