相关数据集
Toxicity Filter EN
◯Detects toxicity in English text with fast and stable results. Always returns HTTP 200 with JSON results.
RapidAPI2025-12-03 更新230
abdulmannan-01/rag_combined_dataset_orca_and_openscholar_messages_format
该数据集包含对话信息,每个示例包括内容(content)和角色(role)两个字段,并提供了数据来源(dataset_source)。数据集仅包含训练集部分,共有180,135条示例数据,数据集总大小为1,396,793,123字节,下载大小为663,503,269字节。
Hugging Face2025-01-09 更新120
DKYoon/s1k-1.1-filtered
该数据集包含对话信息,每个对话条目包括内容和角色信息,划分为训练集。共有894条对话数据,数据集大小约为23.5MB。
Hugging Face2025-02-14 更新50
JokeTailor_big_set_annotated
这是一个包含笑话文本和相关特征的数据集,特征包括笑话的文本内容、广泛话题、类型、语调、唯一标识符以及嵌入向量。数据集提供了一个训练集,共有11018条笑话数据。
Hugging Face2025-03-17 更新130
Croatian Twitter training corpus ReLDI-NormTagNER-hr 3.0
This corpus contains manually annotated Croatian tweets. It is meant as a gold-standard training and testing dataset for tokenisation, sentence segmentation, word normalisation, morphosyntactic taggin
SSH Open MarketPlace2023-10-13 更新60



