oshizo/japanese-wikipedia-paragraphs
收藏资源简介:
--- license: cc-by-sa-4.0 dataset_info: features: - name: id dtype: int64 - name: pageid dtype: int64 - name: revid dtype: int64 - name: title dtype: string - name: section struct: - name: dt dtype: string - name: h2 dtype: string - name: h3 dtype: string - name: h4 dtype: string - name: text dtype: string splits: - name: train num_bytes: 7388520171 num_examples: 10473325 download_size: 3987399592 dataset_size: 7388520171 configs: - config_name: default data_files: - split: train path: data/train-* language: - ja --- A slightly modified version of the parsing and chunking method for [singletongue/wikipedia-utils](https://huggingface.co/datasets/singletongue/wikipedia-utils). Pre-processing was performed using [oshizo/wikipedia-utils](https://github.com/oshizo/wikipedia-utils), which is a fork of the original repository, [singletongue/wikipedia-utils](https://github.com/singletongue/wikipedia-utils). The Wikipedia data was crawled between 2023/12/5 and 2023/12/8.
许可证:CC BY-SA 4.0 数据集信息: 特征字段: - 字段名:id,数据类型:int64 - 字段名:pageid,数据类型:int64 - 字段名:revid,数据类型:int64 - 字段名:title,数据类型:字符串 - 字段名:section,数据类型为结构体,包含以下子字段: - 子字段名:dt,数据类型:字符串 - 子字段名:h2,数据类型:字符串 - 子字段名:h3,数据类型:字符串 - 子字段名:h4,数据类型:字符串 - 字段名:text,数据类型:字符串 数据划分: - 划分名称:train,字节数:7388520171,样本数量:10473325 下载大小:3987399592 数据集总大小:7388520171 配置项: - 配置名称:default,数据文件: - 对应划分:train,文件路径:data/train-* 语言:日语(ja) 本数据集是针对[singletongue/wikipedia-utils](https://huggingface.co/datasets/singletongue/wikipedia-utils)的解析与分块方法的小幅改进版本。 预处理流程基于原始仓库[singletongue/wikipedia-utils](https://github.com/singletongue/wikipedia-utils)的分支项目[oshizo/wikipedia-utils](https://github.com/oshizo/wikipedia-utils)完成。 本次数据集所使用的维基百科数据采集时间为2023年12月5日至2023年12月8日。
数据集概述
许可证
- 本数据集遵循 CC BY-SA 4.0 许可证。
数据集信息
-
特征:
id: 数据类型为int64。pageid: 数据类型为int64。revid: 数据类型为int64。title: 数据类型为string。section: 结构化数据,包含以下字段:dt: 数据类型为string。h2: 数据类型为string。h3: 数据类型为string。h4: 数据类型为string。
text: 数据类型为string。
-
数据分割:
train: 包含 10,473,325 个样本,总字节数为 7,388,520,171 字节。
-
数据大小:
- 下载大小:3,987,399,592 字节。
- 数据集大小:7,388,520,171 字节。
配置
- 默认配置:
- 数据文件路径:
data/train-*。
- 数据文件路径:
语言
- 数据集语言为日语(ja)。




