uuno_mid-training_fi_official
收藏资源简介:
Mid-training Finnish Corpus 是一个规范化的芬兰语文本语料库,数据以 Parquet 文件格式存储,包含四个字段:id(全局唯一的规范化标识符)、text(用于训练的文本内容)、source(指明原始 Hugging Face 数据集的标识符)以及 metadata(一个包含特定数据来源元数据的 JSON 字符串)。目前,该数据集仅包含一个名为 fi 的配置,其训练数据文件位于 data/fi/train/ 目录下。
Mid-training Finnish Corpus is a normalized Finnish text corpus. The data is stored in Parquet format, containing four fields: id (a globally unique normalized identifier), text (text content for training), source (an identifier indicating the original Hugging Face dataset), and metadata (a JSON string containing metadata specific to the data source). Currently, the dataset only includes one configuration named fi, with its training data files located in the data/fi/train/ directory.
数据集概述
数据集名称:Mid-training Finnish Corpus
语言:芬兰语(fi)
数据内容
该数据集包含经过归一化处理的文本语料,专为训练语言模型设计。
数据结构
每条数据包含以下字段:
- id:全局唯一的归一化标识符。
- text:用于训练的文本。
- source:原始数据来源(对应Hugging Face数据集ID)。
- metadata:JSON格式的字符串,包含来源特定的元数据。
配置及文件
- 配置:仅包含
fi(芬兰语)一个配置。 - 数据文件:位于
data/fi/train/目录下,文件格式为 Parquet,所有文件均属于训练集(train split)。





