wisenut-nlp-team/namu
收藏资源简介:
--- license: cc-by-4.0 dataset_info: features: - name: title dtype: string - name: text dtype: string - name: contributors sequence: string - name: id dtype: string splits: - name: train num_bytes: 8757569508 num_examples: 867023 download_size: 4782924595 dataset_size: 8757569508 --- ``` from datasets import load_dataset raw_dataset = load_dataset( "wisenut-nlp-team/namu", "raw", use_auth_token="<your personal/api token>" ) processed_dataset = load_dataset( "wisenut-nlp-team/namu", "processed", use_auth_token="<your personal/api token>" ) ```
### 数据集元数据 许可协议:知识共享署名4.0国际许可协议(CC BY 4.0) 数据集信息: 特征项: - 标题(title):字符串类型(string) - 文本(text):字符串类型(string) - 贡献者(contributors):字符串序列(sequence of string) - 标识符(id):字符串类型(string) 数据划分: - 训练集(train):字节占用量 8757569508,样本总数 867023 下载大小:4782924595 字节 数据集总大小:8757569508 字节 ### 数据集加载示例 python from datasets import load_dataset # 加载原始版本namu数据集 raw_dataset = load_dataset( "wisenut-nlp-team/namu", "raw", use_auth_token="<您的个人/API访问令牌>" ) # 加载预处理后namu数据集 processed_dataset = load_dataset( "wisenut-nlp-team/namu", "processed", use_auth_token="<您的个人/API访问令牌>" )
数据集概述
许可证
- 该数据集遵循CC BY 4.0许可证。
数据集信息
-
特征:
title:字符串类型text:字符串类型contributors:字符串序列id:字符串类型
-
数据分割:
train:- 字节数:8757569508
- 样本数:867023
数据集大小
- 下载大小:4782924595字节
- 数据集大小:8757569508字节



