遇见数据集

CoGenesis合成上下文感知数据集

收藏
官方服务:

资源简介:

该数据集来自一篇在ACL 2024会议发表的研究论文,其产生方法展现了前沿的数据合成策略。为了解决真实场景中隐私数据难以直接用于研究的困境,作者设计了一套数据构建流程,并利用GPT-4模型,创造性地合成了高质量的个性化写作指令数据集。该数据集的创建,其核心意义在于为解决大语言模型(LLMs)在个人设备上的隐私安全问题提供了宝贵的“试验场”(testbed)。它使研究者能够系统地研究模型在不同粒度的上下文信息下的表现,推动了“上下文感知指令跟随”与“隐私保护”的交叉研究。其主要内容聚焦于丰富的、个性化的上下文信息与写作指令对,旨在模拟真实用户在向AI助手寻求写作帮助时的各种场景。论文的实验结果表明,该合成数据集在评估模型性能方面发挥了关键作用,证明了小模型在经过其微调后,在隐私保护场景下展现了巨大潜力。

提供机构:
浙江大学
二维码
社区交流群
二维码
科研交流群
商业服务