imminsik/summarize_from_feedback_tldr_3_filtered_oai_preprocessing_gpt2_1757515495
收藏数据链接:
官方服务:
资源简介:
该数据集是从OpenAI的Summarize from Feedback任务中直接获取的Reddit TL;DR数据集。它包含了帖子的ID、子版块、标题、正文、摘要和参考响应等字段。此外,还有预处理脚本添加的字段,如限制长度的查询、参考响应的标记化版本、查询和参考响应的拼接等。数据集分为训练集、验证集和测试集三个部分。
This dataset is the Reddit TL;DR dataset directly obtained from OpenAIs Summarize from Feedback task. It includes fields such as post ID, subreddit, title, body, summary, and reference response. In addition, there are fields added by the preprocessing script, such as length-limited query, tokenized reference response, concatenation of query and reference response, etc. The dataset is divided into three parts: training set, validation set, and test set.
提供机构:
imminsik


