vwxyzjn/summarize_from_feedback_tldr_3_filtered_oai_preprocessing_1706381144
收藏数据链接:
官方服务:
资源简介:
该数据集直接取自OpenAI的Summarize from Feedback任务中的reddit TL;DR数据集。数据集包含多个特征列,如id、subreddit、title、post、summary等,并且通过预处理脚本添加了query、query_token、reference_response_token等列。数据集分为train、validation和test三个部分,分别包含不同数量的字节和示例。
该数据集直接取自OpenAI的Summarize from Feedback任务中的reddit TL;DR数据集。数据集包含多个特征列,如id、subreddit、title、post、summary等,并且通过预处理脚本添加了query、query_token、reference_response_token等列。数据集分为train、validation和test三个部分,分别包含不同数量的字节和示例。
提供机构:
vwxyzjn原始信息汇总
数据集概述
数据集特征
- id: 字符串类型,唯一标识符。
- subreddit: 字符串类型,帖子来源的子版块。
- title: 字符串类型,帖子标题。
- post: 字符串类型,帖子正文。
- summary: 字符串类型,帖子摘要。
- query_token: 整数序列类型,
query的标记化版本。 - query: 字符串类型,长度受限的摘要查询。
- reference_response: 字符串类型,帖子的参考回复。
- reference_response_token: 整数序列类型,
reference_response的标记化版本。 - reference_response_token_len: 整数类型,
reference_response_token的长度。 - query_reference_response: 字符串类型,
query.strip()和reference_response的连接。 - query_reference_response_token: 整数序列类型,
query_reference_response的标记化版本,最多到max_sft_query_response_length个标记。 - query_reference_response_token_len: 整数类型,
query_reference_response_token的长度。
数据集划分
- train: 训练集,包含2125689249字节,116722个样本。
- validation: 验证集,包含117437271字节,6447个样本。
- test: 测试集,包含119410966字节,6553个样本。
数据集大小
- download_size: 562087836字节。
- dataset_size: 2362537486字节。



