Bestselling Books Dataset
收藏arXiv2025-09-30 收录
下载链接:
https://github.com/coastalcph/CopyrightLLMs
下载链接
链接失效反馈官方服务:
资源简介:
该数据集包含了1930年至2010年间被认为是畅销书的流行书籍集合。此外,数据集中还包括了一些被语言模型高度记忆的书籍列表,这引发了关于版权侵犯的担忧。该数据集的规模覆盖了畅销书列表,其任务是评估文本的逐字记忆情况。
提供机构:
Authors of the paper



