遇见数据集

udmurtNLP/zerpal

收藏
Hugging Face2024-04-03 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: document_id dtype: int64 - name: string_id dtype: int64 - name: source dtype: string - name: title dtype: string - name: date dtype: string - name: url dtype: string - name: string dtype: string - name: file_name dtype: 'null' - name: card_badge dtype: string - name: genre dtype: string splits: - name: train num_bytes: 474023597 num_examples: 1402350 download_size: 129254034 dataset_size: 474023597 configs: - config_name: default data_files: - split: train path: data/train-* language: - udm task_categories: - fill-mask size_categories: - 1M<n<10M ---

数据集信息: 特征项: - 字段名:文档标识符(document_id),数据类型:64位整数 - 字段名:字符串标识符(string_id),数据类型:64位整数 - 字段名:source(来源),数据类型:字符串 - 字段名:title(标题),数据类型:字符串 - 字段名:date(日期),数据类型:字符串 - 字段名:统一资源定位符(URL),数据类型:字符串 - 字段名:string(文本内容),数据类型:字符串 - 字段名:file_name(文件名),数据类型:空值 - 字段名:卡片徽章(card_badge),数据类型:字符串 - 字段名:体裁(genre),数据类型:字符串 数据集划分: - 划分名称:train(训练集),总字节数:474023597,样本数量:1402350 下载大小:129254034,数据集总大小:474023597 配置项: - 配置名称:default(默认配置),数据文件: - 数据集划分:train(训练集),文件路径:data/train-* 语言:乌德穆尔特语(udm) 任务类别:fill-mask(掩码填充) 样本规模类别:1M<n<10M(100万<样本数<1000万)

提供机构:
udmurtNLP
原始信息汇总

数据集概述

数据集特征

  • document_id: 数据类型为 int64
  • string_id: 数据类型为 int64
  • source: 数据类型为 string
  • title: 数据类型为 string
  • date: 数据类型为 string
  • url: 数据类型为 string
  • string: 数据类型为 string
  • file_name: 数据类型为 null
  • card_badge: 数据类型为 string
  • genre: 数据类型为 string

数据集分割

  • train:
    • 数据量: 474023597 字节
    • 示例数量: 1402350

数据集大小

  • 下载大小: 129254034 字节
  • 数据集大小: 474023597 字节

语言

  • udm

任务类别

  • fill-mask

大小类别

  • 1M<n<10M
二维码
社区交流群
二维码
科研交流群
商业服务