遇见数据集

生成式人工智能著作权侵权风险实验数据集

收藏
官方服务:

资源简介:

本数据集主要面向生成式人工智能著作权保护研究与AI治理需求建设,依托中国人民大学国家治理大数据与人工智能创新平台实验室,通过API接口对文心一言、通义千问、Kimi、DeepSeek四款主流大语言模型进行系统化提问并收集模型输出结果,采集时间为2024年5月至7月。实验设计三个任务类别进行多维度测试:任务1(著作权侵权测试)分别以普通提问和四种对抗攻击提问(DAN、开发者、AI Responder、Mango Tom)方式请求受版权保护的作品内容;任务2(公有领域测试)在未告知和告知作品已过保护期两种条件下请求已进入公有领域的作品;任务3(合理使用测试)以评论、批评、引用等合理使用场景请求诗歌内容。主要记载了四款主流大语言模型在不同提问策略下的著作权侵权风险表现、公有领域作品的输出特征、合理使用场景下的合规性表现等关键数据,共收录文本数据4160条。采用字符级TF-IDF算法量化模型输出与原始作品的相似度,建立"机器评分+人工标注"双重评价机制,人工标注采用6类编码方案,相似度评分采用0-10分量表。数据存储为31个Excel/CSV文件,数据量约18 MB。本数据集为生成式人工智能著作权立法、模型安全评估及合规治理提供了宝贵的实验依据。本数据集主要面向生成式人工智能著作权保护研究与AI治理需求建设,依托中国人民大学国家治理大数据与人工智能创新平台实验室,通过API接口对文心一言、通义千问、Kimi、DeepSeek四款主流大语言模型进行系统化提问并收集模型输出结果,采集时间为2024年5月至7月。实验设计三个任务类别进行多维度测试:任务1(著作权侵权测试)分别以普通提问和四种对抗攻击提问(DAN、开发者、AI Responder、Mango Tom)方式请求受版权保护的作品内容;任务2(公有领域测试)在未告知和告知作品已过保护期两种条件下请求已进入公有领域的作品;任务3(合理使用测试)以评论、批评、引用等合理使用场景请求诗歌内容。主要记载了四款主流大语言模型在不同提问策略下的著作权侵权风险表现、公有领域作品的输出特征、合理使用场景下的合规性表现等关键数据,共收录文本数据4160条。采用字符级TF-IDF算法量化模型输出与原始作品的相似度,建立"机器评分+人工标注"双重评价机制,人工标注采用6类编码方案,相似度评分采用0-10分量表。数据存储为31个Excel/CSV文件,数据量约18 MB。本数据集为生成式人工智能著作权立法、模型安全评估及合规治理提供了宝贵的实验依据。

提供机构:
中国人民大学
二维码
社区交流群
二维码
科研交流群
商业服务