KGGen_PURE
收藏资源简介:
该数据集包含18个样本,每个样本由文章主题(essay_topic)、文章内容(essay_content)以及基于文章生成的查询(generated_queries)和答案(generated_answers)组成。查询数量(num_generated_queries)也一并提供。该数据集可用于训练和评估基于文章内容生成查询和答案的模型,适用于问答生成、信息检索、阅读理解等任务。数据集仅提供训练集,文件格式为Parquet或类似格式,总大小约1.2MB。
The dataset contains 18 samples, each consisting of an essay topic (essay_topic), essay content (essay_content), and generated queries (generated_queries) and answers (generated_answers) based on the essay. The number of generated queries (num_generated_queries) is also provided. This dataset can be used to train and evaluate models that generate queries and answers based on essay content, suitable for tasks such as question answering generation, information retrieval, and reading comprehension. The dataset only provides a training set, in Parquet or similar format, with a total size of approximately 1.2MB.
KGGen_PURE 数据集详情
基本信息
- 许可证:Apache-2.0
- 数据集大小:下载大小约 580 KB,总大小约 1.2 MB
- 数据规模:训练集包含 18 个样本
数据配置
- 默认配置名称:default
- 数据文件路径:
data/train-*(采用通配符匹配多个分片文件) - 数据划分:仅提供 train 划分,共 18 个示例
字段说明
| 字段名 | 类型 | 描述 |
|---|---|---|
id |
int64 | 样本唯一标识符 |
essay_topic |
string | 文章主题 |
essay_content |
string | 文章正文内容 |
generated_queries |
list[string] | 基于文章生成的问题列表 |
generated_answers |
list[string] | 对应生成问题的答案列表 |
num_generated_queries |
int64 | 生成的问题数量 |
数据用途
该数据集包含 18 篇文章及其对应生成的问题-答案对,适用于知识图谱生成、问答系统训练、信息抽取等领域的研究与开发。数据以 Apache-2.0 协议开放,可自由使用和修改。




