hr_policy_asst_non_instruction_dataset_v0
收藏资源简介:
该数据集包含从文档或网页中提取的文本段落数据,每个样本代表一个独立的文本段落,并附带相关的元数据信息。数据集共包含112个样本,划分为训练集(95个样本)和验证集(17个样本)。每个样本包含四个字段:text(文本内容,字符串类型)、source_page(来源页面编号,整型)、paragraph_id(段落标识符,整型)和char_count(文本的字符计数,整型)。这些元数据可用于追踪文本来源和结构。数据集适用于文本分析、信息检索、自然语言处理中的段落级建模或作为其他任务的预处理数据。
This dataset comprises text paragraph data extracted from documents or webpages. Each sample represents an independent text paragraph and is accompanied by relevant metadata. The dataset includes a total of 112 samples, split into a training set (95 samples) and a validation set (17 samples). Each sample contains four fields: text (text content, string type), source_page (source page number, integer type), paragraph_id (paragraph identifier, integer type), and char_count (character count of the text, integer type). This metadata can be used to trace the source and structure of the text paragraphs. This dataset is applicable for text analysis, information retrieval, paragraph-level modeling in natural language processing, or as preprocessed data for other downstream tasks.
数据集概述
- 数据集名称: hr_policy_asst_non_instruction_dataset_v0
- 数据集地址: https://huggingface.co/datasets/Pycoder156/hr_policy_asst_non_instruction_dataset_v0
- 数据集类型: 非指令格式的文本数据集
数据特征
该数据集包含以下字段:
- text: 字符串类型,存储文本内容。
- source_page: 整数类型,表示来源页面编号。
- paragraph_id: 整数类型,表示段落编号。
- char_count: 整数类型,表示字符数量。
数据划分
数据集分为训练集和验证集:
- 训练集 (train): 95 个样本,字节数为 43990。
- 验证集 (validation): 17 个样本,字节数为 7871。
数据集规模
- 下载大小: 38012 字节
- 数据集总大小: 51861 字节
配置文件
- 配置名称: default
- 数据文件路径:
- 训练集: data/train-*
- 验证集: data/validation-*





