udmurtNLP/zerpal
收藏资源简介:
--- dataset_info: features: - name: document_id dtype: int64 - name: string_id dtype: int64 - name: source dtype: string - name: title dtype: string - name: date dtype: string - name: url dtype: string - name: string dtype: string - name: file_name dtype: 'null' - name: card_badge dtype: string - name: genre dtype: string splits: - name: train num_bytes: 474023597 num_examples: 1402350 download_size: 129254034 dataset_size: 474023597 configs: - config_name: default data_files: - split: train path: data/train-* language: - udm task_categories: - fill-mask size_categories: - 1M<n<10M ---
数据集信息: 特征项: - 字段名:文档标识符(document_id),数据类型:64位整数 - 字段名:字符串标识符(string_id),数据类型:64位整数 - 字段名:source(来源),数据类型:字符串 - 字段名:title(标题),数据类型:字符串 - 字段名:date(日期),数据类型:字符串 - 字段名:统一资源定位符(URL),数据类型:字符串 - 字段名:string(文本内容),数据类型:字符串 - 字段名:file_name(文件名),数据类型:空值 - 字段名:卡片徽章(card_badge),数据类型:字符串 - 字段名:体裁(genre),数据类型:字符串 数据集划分: - 划分名称:train(训练集),总字节数:474023597,样本数量:1402350 下载大小:129254034,数据集总大小:474023597 配置项: - 配置名称:default(默认配置),数据文件: - 数据集划分:train(训练集),文件路径:data/train-* 语言:乌德穆尔特语(udm) 任务类别:fill-mask(掩码填充) 样本规模类别:1M<n<10M(100万<样本数<1000万)
数据集概述
数据集特征
- document_id: 数据类型为 int64
- string_id: 数据类型为 int64
- source: 数据类型为 string
- title: 数据类型为 string
- date: 数据类型为 string
- url: 数据类型为 string
- string: 数据类型为 string
- file_name: 数据类型为 null
- card_badge: 数据类型为 string
- genre: 数据类型为 string
数据集分割
- train:
- 数据量: 474023597 字节
- 示例数量: 1402350
数据集大小
- 下载大小: 129254034 字节
- 数据集大小: 474023597 字节
语言
- udm
任务类别
- fill-mask
大小类别
- 1M<n<10M



