遇见数据集

vwxyzjn/summarize_from_feedback_tldr_3_filtered_oai_preprocessing_1706381144

收藏
Hugging Face2024-01-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集直接取自OpenAI的Summarize from Feedback任务中的reddit TL;DR数据集。数据集包含多个特征列,如id、subreddit、title、post、summary等,并且通过预处理脚本添加了query、query_token、reference_response_token等列。数据集分为train、validation和test三个部分,分别包含不同数量的字节和示例。

该数据集直接取自OpenAI的Summarize from Feedback任务中的reddit TL;DR数据集。数据集包含多个特征列,如id、subreddit、title、post、summary等,并且通过预处理脚本添加了query、query_token、reference_response_token等列。数据集分为train、validation和test三个部分,分别包含不同数量的字节和示例。

提供机构:
vwxyzjn
原始信息汇总

数据集概述

数据集特征

  • id: 字符串类型,唯一标识符。
  • subreddit: 字符串类型,帖子来源的子版块。
  • title: 字符串类型,帖子标题。
  • post: 字符串类型,帖子正文。
  • summary: 字符串类型,帖子摘要。
  • query_token: 整数序列类型,query的标记化版本。
  • query: 字符串类型,长度受限的摘要查询。
  • reference_response: 字符串类型,帖子的参考回复。
  • reference_response_token: 整数序列类型,reference_response的标记化版本。
  • reference_response_token_len: 整数类型,reference_response_token的长度。
  • query_reference_response: 字符串类型,query.strip()reference_response的连接。
  • query_reference_response_token: 整数序列类型,query_reference_response的标记化版本,最多到max_sft_query_response_length个标记。
  • query_reference_response_token_len: 整数类型,query_reference_response_token的长度。

数据集划分

  • train: 训练集,包含2125689249字节,116722个样本。
  • validation: 验证集,包含117437271字节,6447个样本。
  • test: 测试集,包含119410966字节,6553个样本。

数据集大小

  • download_size: 562087836字节。
  • dataset_size: 2362537486字节。
二维码
社区交流群
二维码
科研交流群
商业服务