遇见数据集

quynong/filtered

收藏
Hugging Face2026-03-18 更新2026-03-29 收录
官方服务:

资源简介:

--- license: apache-2.0 dataset_info: features: - name: source_text dtype: string - name: masked_text dtype: string - name: privacy_mask list: - name: end dtype: int64 - name: label dtype: string - name: label_index dtype: int64 - name: start dtype: int64 - name: value dtype: string - name: split dtype: string - name: uid dtype: int64 - name: language dtype: string - name: region dtype: string - name: script dtype: string - name: mbert_tokens list: string - name: mbert_token_classes list: string splits: - name: train num_bytes: 57576189 num_examples: 62572 download_size: 19215674 dataset_size: 57576189 configs: - config_name: default data_files: - split: train path: data/train-* ---

许可证:Apache-2.0 数据集详情: 样本特征字段: - 名称:源文本(source_text),数据类型:字符串 - 名称:掩码文本(masked_text),数据类型:字符串 - 名称:隐私掩码(privacy_mask),数据类型:列表,包含子字段: - 名称:结束位置(end),数据类型:64位整数 - 名称:标签(label),数据类型:字符串 - 名称:标签索引(label_index),数据类型:64位整数 - 名称:起始位置(start),数据类型:64位整数 - 名称:取值(value),数据类型:字符串 - 名称:数据集划分标识(split),数据类型:字符串 - 名称:唯一标识符(uid),数据类型:64位整数 - 名称:语言(language),数据类型:字符串 - 名称:区域(region),数据类型:字符串 - 名称:书写系统(script),数据类型:字符串 - 名称:多语言BERT标记(mbert_tokens),数据类型:字符串列表 - 名称:多语言BERT标记类别(mbert_token_classes),数据类型:字符串列表 数据集拆分配置: - 拆分名称:训练集(train),字节占用量:57576189,样本总量:62572 下载体积:19215674 数据集总占用字节数:57576189 配置项: - 配置名称:默认配置(default) 数据文件配置: - 对应拆分:训练集(train) 文件路径:data/train-*

提供机构:
quynong
二维码
社区交流群
二维码
科研交流群
商业服务