AppliedCourse_SFT_datasets
收藏资源简介:
本数据集是一个专注于结构化输出(如CSV、JSON、XML)的监督微调(SFT)学习数据集,旨在进行形式转换和信息提取任务。数据集采用OpenAI messages格式的JSONL文件,每个样本包含用户和助手之间的对话,助手的输出严格遵循指定的格式规范。数据集来源于多个公开数据源,使用时需遵守各原始数据集的许可和条款。数据集包含多个配置,如tabular(CSV与JSON转换)、xml(XML到JSON转换)、gtfs(GTFS风文本到JSON提取)和hard_mixed(复合高难度任务),分别针对不同的任务和难度级别。
AppliedCourse SFT Datasets 数据集概述
数据集简介
本数据集是专注于结构化输出(CSV / JSON / XML)格式转换及信息提取任务的监督微调(SFT)学习数据集。各样本以OpenAI / ShareGPT 兼容的 messages 格式([{role, content}, ...])的 JSONL 文件提供,assistant 的输出被设计为严格遵循指定的格式规范。
数据集详情
- 目的:用于高质量学习结构化输出任务中的格式转换(CSV ↔ JSON、XML → JSON 等)和信息提取(Text / CSV / XML → JSON)。
- 语言:日语(ja)。
- 任务类别:文本生成(text-generation)。
- 标签:sft, instruction-tuning, structured-data, json, csv, xml。
- 格式:OpenAI messages 格式的 JSONL(1行 = 1个样本)。
- 主要任务示例:
- CSV ↔ JSON
- XML → JSON
- Text → JSON
- GTFS 风格文本 → JSON(关系提取)
数据集结构
数据集采用基于目录的配置结构,每个配置由 Hugging Face Datasets Viewer 自动识别。
配置(Configurations)
- tabular:CSV ↔ JSON 转换,包含扁平至简易层次表格,为 Colab 执行设计了安全的令牌长度。
- xml:XML → JSON 转换,使用仅由安全列生成的合成 XML,不使用原始标记文档。
- gtfs:GTFS 风格文本 → JSON 提取,属于关系导向的结构化提取任务。
- hard_mixed:复合高难度任务,包含约束条件多或对抗性的结构转换,适用于高级学习和评估用途。
数据格式
每个样本具有以下格式: json { "id": "...", "category": "C1", "subcategory": "csv_to_json", "task": "extract", "seed": "openfoodfacts", "messages": [ {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ] }
推荐顶级列:
id: string(稳定哈希)category: string(内部类别)subcategory: string(任务名例:csv_to_json)task: string(extract / transform / filter)seed: string(标识原始数据来源/组合的标识符)messages: list(OpenAI messages 格式)
预期用途
- 结构化输出任务的监督微调(SFT)
- 教育用途(讲座、练习、学生竞赛)
- 格式耐受性(CSV / JSON / XML)的实验与评估
数据收集过程
- 仅使用 Hugging Face 上公开数据集中安全且非敏感的列。
- 经过轻微的正规化和格式化后转化为任务。
- 在每个任务中:
- 通过提示明确输入输出格式规范。
- 设计基于结构上合理输出的前提。
来源与条款(重要)
本数据集依赖于多个上游公开数据集,包括:
- OpenFoodFacts product-database
- 数据库:Open Database License (ODbL 1.0)
- 内容:Database Contents License (DbCL 1.0)
- 参考:https://world.openfoodfacts.org/data
- Shopify/product-catalogue
- 使用条件请参考数据集卡片
- 参考:https://huggingface.co/datasets/Shopify/product-catalogue
- ontologicalapple/vrts-gtfs-archive
- 遵循各 GTFS 提供方的 Open Data Terms
- 参考:https://huggingface.co/datasets/ontologicalapple/vrts-gtfs-archive
注意:本仓库并非直接重新分发上游数据。即使是衍生数据(任务化、格式化),用户仍需遵守原始数据的许可义务(如署名要求)。
许可信息
- 许可证:
other - 使用本数据集时,必须遵守各上游数据集的许可证和使用条款(如 ODbL / DbCL 等)。
- 本 README 旨在帮助理解遵守事项。
局限性
- 不保证对模糊或规范未定义的指令的输出质量。
- 有意包含多种困难案例(如空值混合、结构波动等)。
使用方法
python from datasets import load_dataset
ds = load_dataset("daichira/AppliedCourse_SFT_datasets", split="train") print(len(ds), ds.column_names) print(ds[0]["messages"][0]["content"])
维护者
- daichira




