simp-training-data
收藏资源简介:
该数据集是一个结构化指令-输出对集合,包含6082个训练样本。数据集包含八个核心字段:instruction(自然语言指令)、output(对应输出)、source(数据来源)、skill(所需技能类别)、subtype(技能子类型)、confidence(质量置信度分数)、domain(应用领域)和text(可能为完整文本内容)。数据覆盖多个领域和技能类型,通过结构化标注支持对指令遵循能力、任务完成质量和技能掌握程度的分析。数据集适用于指令微调、文本生成模型训练、技能评估基准构建等自然语言处理任务。
This dataset is a structured instruction-output pair collection containing 6082 training samples. It includes eight core fields: instruction (natural language instruction), output (corresponding output), source (data source), skill (required skill category), subtype (skill subtype), confidence (quality confidence score), domain (application domain), and text (possible complete text content). The data covers multiple domains and skill types, supporting analysis of instruction-following ability, task completion quality, and skill mastery through structured annotations. The dataset is suitable for natural language processing tasks such as instruction fine-tuning, text generation model training, and skill evaluation benchmark construction.
数据集概述
数据集名称: simp-training-data
来源平台: Hugging Face Datasets
数据集地址: https://huggingface.co/datasets/automationkasey/simp-training-data
数据集详情
特征字段
该数据集包含8个字段:
- instruction (
string): 指令文本 - output (
string): 输出文本 - source (
string): 数据来源 - skill (
string): 技能分类 - subtype (
string): 子类型 - confidence (
float64): 置信度 - domain (
string): 领域 - text (
string): 文本内容
数据集划分
数据集仅包含一个划分:
- train: 训练集,共6,082个样本,数据大小为3,362,670字节约3.21 MB
数据大小
- 下载大小:1,505,625字节约1.44 MB
- 数据集总大小:3,362,670字节约3.21 MB
配置
数据集默认配置为 default,数据文件路径为 data/train-*。




