遇见数据集

aixk/vlite3.5-nano-korean-dataset

收藏
Hugging Face2026-05-17 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于自然语言处理任务的预训练或微调数据集,包含273,906个训练示例。特征包括input_ids(表示文本token ID的int32列表)、attention_mask(表示注意力掩码的int8列表)和labels(表示标签的int64列表),适用于文本分类、序列标注或生成等任务。数据集总大小约1.8GB,下载大小约2.2GB。

This dataset is a pre-training or fine-tuning dataset for natural language processing tasks, containing 273,906 training examples. Features include input_ids (a list of int32 representing token IDs for text), attention_mask (a list of int8 representing attention masks), and labels (a list of int64 representing labels), suitable for tasks such as text classification, sequence labeling, or generation. The total dataset size is approximately 1.8GB, with a download size of about 2.2GB.

提供机构:
aixk
二维码
社区交流群
二维码
科研交流群
商业服务