遇见数据集

yuiseki/onomatopoeia-ja-flat

收藏
Hugging Face2024-03-19 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: text dtype: string - name: text_lang dtype: string - name: onomatopoeia_ja dtype: string splits: - name: train num_bytes: 646336 num_examples: 10346 download_size: 229643 dataset_size: 646336 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "onomatopoeia-ja-flat" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- ## 数据集信息 ### 数据特征 - 字段名:text,数据类型:字符串(string),对应原始文本 - 字段名:text_lang,数据类型:字符串(string),对应文本语言 - 字段名:onomatopoeia_ja,数据类型:字符串(string),对应日语拟声词 ### 数据集划分 - 划分集名称:train(训练集),字节数:646336,样本数量:10346 数据集整体下载大小:229643,总存储大小:646336 ### 配置项 - 配置名称:default(默认配置) - 数据文件: - 对应划分集:train(训练集),文件路径:data/train-* --- # 「onomatopoeia-ja-flat」日语拟声词扁平数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
yuiseki
原始信息汇总

数据集概述

数据集名称

onomatopoeia-ja-flat

数据特征

  • text:文本,数据类型为字符串。
  • text_lang:文本语言,数据类型为字符串。
  • onomatopoeia_ja:日语拟声词,数据类型为字符串。

数据分割

  • train:训练集,包含10346个样本,总大小为646336字节。

数据集大小

  • 下载大小:229643字节
  • 数据集总大小:646336字节

配置

  • config_name:default
  • data_files
    • split:train
    • path:data/train-*
二维码
社区交流群
二维码
科研交流群
商业服务