gdma-qa
收藏资源简介:
Gdma-Qa是一个合成问答数据集,使用Unsloth Recipe Studio基于GDMA PDF概述生成。该数据集包含100条记录,属于小型数据集(记录数少于1000条)。数据包含3个字段,其中1个字段为llm-structured类型(字典格式),另外2个字段为seed-dataset类型。具体来说,llm_structured_1字段为字典类型,包含136个输出token和344个输入token,该字段唯一性为98%,且无空值。数据集通过NeMo Data Designer框架生成,该框架支持多样化数据生成、字段间关系控制、质量验证和LLM评分等功能。该数据集适用于需要合成问答数据的自然语言处理任务,特别是基于PDF文档内容生成的结构化问答数据。
Gdma-Qa is a synthetic question-answering dataset generated using Unsloth Recipe Studio based on GDMA PDF summaries. The dataset contains 100 records, making it a small dataset (with fewer than 1,000 records). It includes 3 fields, with 1 field being llm-structured (in dictionary format) and 2 fields being seed-dataset types. Specifically, the llm_structured_1 field is a dictionary type containing 136 output tokens and 344 input tokens, with a uniqueness of 98% and no null values. The dataset is generated through the NeMo Data Designer framework, which supports diverse data generation, control over field relationships, quality validation, and LLM scoring functions. It is suitable for natural language processing tasks that require synthetic question-answering data, particularly structured QA data generated from PDF document content.
数据集概述:Gdma-Qa
- 数据集名称: Gdma-Qa
- 数据集大小: 少于1000条记录(实际100条)
- 数据类型: 合成数据
- 生成工具: 基于 Unsloth Recipe Studio 和 NeMo Data Designer,从一份 GDMA PDF 概述生成
- 许可证/标签: synthetic, datadesigner
数据集结构
- 配置文件: 包含一个名为
data的配置,数据文件为data/*.parquet - 记录数: 100 条
- 列数: 3 列
- 模式与统计(示例列):
| 列名 | 类型 | 列类型 | 唯一值比例 (%) | 空值比例 (%) | 详情 |
|---|---|---|---|---|---|
llm_structured_1 |
dict |
llm-structured | 98.0% | 0.0% | Token数: 输出136 / 输入344 |
生成详情
- 使用 3 列配置 生成:
- 1 列 使用
llm-structured生成方式 - 2 列 来自种子数据集(seed-dataset)
- 1 列 使用
- 完整配置信息见
builder_config.json,详细元数据见metadata.json
快速使用
python from datasets import load_dataset
加载主数据集
dataset = load_dataset("cogniai-dev/gdma-qa", "data", split="train") df = dataset.to_pandas()
引用信息
如果使用 Data Designer,请按以下格式引用:
bibtex @misc{nemo-data-designer, author = {The NeMo Data Designer Team, NVIDIA}, title = {NeMo Data Designer: A framework for generating synthetic data from scratch or based on your own seed data}, howpublished = {url{https://github.com/NVIDIA-NeMo/DataDesigner}}, year = 2026, note = {GitHub Repository}, }




