遇见数据集

trentmkelly/asianfanfics

收藏
Hugging Face2026-05-19 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Asianfanfics Archive,包含来自Asianfanfics平台的元数据和公开章节文本,以zstd压缩的Parquet文件格式打包。数据集分为两个配置:stories表(共1,727,491行)提供故事级元数据和文本获取状态,包括故事ID、URL、标题、作者、状态/评级、发布/更新元数据、参与计数器、标签/角色JSON、可用性状态和文本获取状态字段;chapters表(共4,114,576行)提供章节级元数据、获取状态和获取到的公开文本(当可用时),包括故事ID、章节索引、URL、标题、字数元数据、获取状态、获取错误和文本字段。总压缩大小约为4.2 GiB,存储的章节文本总计约14,918,091,815个字符。文本覆盖情况包括:获取到的公开文本(2,045,265行)、跳过门控内容(1,236,406行)、缺失正文(820,399行)、空正文(11,776行)和未找到(730行)。故事文本状态包括:获取到的故事(302,857个)、无公开文本(235,124个)和跳过门控内容(211,049个)。数据集支持多种语言(英语、中文、韩语、日语和多语言),专注于同人小说、网络小说和存档领域,并采用CC-BY-SA-4.0许可证。

许可证:CC-BY-SA-4.0 语言: - 英语 - 汉语 - 韩语 - 日语 - 多语言 展示名称:Asianfanfics 档案库 标签: - 同人小说 - 网络小说 - 档案库 - Parquet(Parquet)格式 规模类别: - 100万条 < 样本量 < 1000万条 配置项: - 配置名称:stories(故事集) 数据文件: - 拆分方式:训练集(train) 路径:stories/*.parquet - 配置名称:chapters(章节集) 数据文件: - 拆分方式:训练集(train) 路径:chapters/*.parquet # Asianfanfics 档案库 本数据集包含来自Asianfanfics的元数据与公开章节文本,封装为zstd压缩的Parquet格式文件。 仓库地址:`trentmkelly/asianfanfics` ## 内容说明 本数据集分为两个Hugging Face配置项: | 表名 | 条目数 | 文件数 | 描述 | |---|---:|---:|---| | `stories` | 1,727,491 | 4 | 故事级元数据与文本获取状态。 | | `chapters` | 4,114,576 | 42 | 章节级元数据、获取状态,以及已获取的公开章节文本(若可用)。 | 压缩后的Parquet文件总大小约为4.2 GiB。 ## 文本覆盖范围 章节获取状态统计: | 状态 | 条目数 | 含义 | |---|---:|---:|---| | `fetched` | 2,045,265 | 公开章节文本已存储于`chapters.text`字段中。 | | `skipped_gated` | 1,236,406 | 该章节/故事需登录、会员权限或订阅方可访问。 | | `missing_body` | 820,399 | 无可用的静态公开章节正文。 | | `empty_body` | 11,776 | 章节正文存在但内容为空。 | | `not_found` | 730 | 章节页面无法访问。 | 已存储的章节文本总字符数约为14,918,091,815个。 故事文本状态统计: | 状态 | 故事数 | |---|---:| | `fetched` | 302,857 | | `no_public_text` | 235,124 | | `skipped_gated` | 211,049 | 为保证索引完整性,`stories`表中包含了无法获取的故事ID,但未附带对应故事文本。 ## 字段说明 ### `stories`(故事集) 包含故事ID、URL、标题、作者、状态/评级、发布/更新元数据、互动统计数据、标签/角色JSON字段、可用性状态以及文本获取状态字段。 ### `chapters`(章节集) 包含故事ID、章节序号、URL、标题、字数元数据、获取状态、获取错误信息,以及已获取公开文本的章节的`text`字段。 ## 许可证 本数据集采用知识共享署名-相同方式共享4.0国际许可协议(CC-BY-SA-4.0)发布。

提供机构:
trentmkelly
二维码
社区交流群
二维码
科研交流群
商业服务