遇见数据集

chcaa/fiction-nonfiction-testset

收藏
Hugging Face2026-05-20 更新2026-04-05 收录
官方服务:

资源简介:

该数据集是一个文本数据集,包含1831个训练样本,每个样本具有多个特征:文章ID、文本内容、标签、连载ID、作者、序列化状态、子类别、嵌入向量、原始块数和日期。特征表明数据集可能用于文本分类或序列化任务,例如基于文章内容或连载信息的分析。数据以训练集形式提供,总大小约14.9MB,下载大小约13.8MB。

This dataset is a text dataset containing 1831 training examples, each with multiple features: article ID, text content, label, feuilleton ID, author, serialized status, subcategory, embedding vector, original chunk count, and date. The features suggest the dataset may be used for text classification or serialization tasks, such as analysis based on article content or feuilleton information. The data is provided as a training split, with a total size of approximately 14.9MB and a download size of approximately 13.8MB.

提供机构:
chcaa
二维码
社区交流群
二维码
科研交流群
商业服务