相关数据集
stanfordnlp/imdb
--- annotations_creators: - expert-generated language_creators: - expert-generated language: - en license: - other multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - origi
Hugging Face2024-01-04 更新3860
stanfordnlp/sentiment140
Sentiment140数据集包含带有表情符号的Twitter消息,这些表情符号被用作情感分类的噪声标签。数据集主要用于情感分类任务,包含1600000条训练数据和498条测试数据。数据字段包括文本、日期、用户、情感和查询。
Hugging Face2023-10-20 更新2060
stanfordnlp/SHP
Stanford Human Preferences Dataset (SHP) 是一个包含385K条Reddit用户对18个不同主题领域的问题/指令的集体偏好的数据集,用于训练RLHF奖励模型和NLG评估模型。每个示例是一个Reddit帖子,包含一个问题/指令和一对顶级评论,其中一个评论更受Reddit用户集体偏好。数据集通过时间戳信息推断偏好,确保偏好反映的是评论的‘帮助性’而非‘有害性’。数
Hugging Face2023-10-10 更新1670
stanfordnlp/craigslist_bargains
CraigslistBargains数据集包含买家和卖家在Craigslist上关于商品价格的谈判对话。该数据集的目标是开发一个能够通过此类对话与人类进行谈判的代理。数据集包含超过6K的谈判对话,涵盖了多个商品类别。数据集的结构包括代理信息、对话轮次、对话行为、商品信息和对话内容等字段。数据集分为训练集、验证集和测试集,分别包含5247、597和838个样本。数据集的创建过程包括从Craigsli
Hugging Face2024-01-18 更新2411
stanfordnlp/sst2
--- annotations_creators: - crowdsourced language_creators: - found language: - en license: - unknown multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - original task_cate
Hugging Face2024-01-04 更新1800



