CoGenesis合成上下文感知数据集
收藏国家基础学科公共科学数据中心2026-08-05 收录
官方服务:
资源简介:
该数据集来自一篇在ACL 2024会议发表的研究论文,其产生方法展现了前沿的数据合成策略。为了解决真实场景中隐私数据难以直接用于研究的困境,作者设计了一套数据构建流程,并利用GPT-4模型,创造性地合成了高质量的个性化写作指令数据集。该数据集的创建,其核心意义在于为解决大语言模型(LLMs)在个人设备上的隐私安全问题提供了宝贵的“试验场”(testbed)。它使研究者能够系统地研究模型在不同粒度的上下文信息下的表现,推动了“上下文感知指令跟随”与“隐私保护”的交叉研究。其主要内容聚焦于丰富的、个性化的上下文信息与写作指令对,旨在模拟真实用户在向AI助手寻求写作帮助时的各种场景。论文的实验结果表明,该合成数据集在评估模型性能方面发挥了关键作用,证明了小模型在经过其微调后,在隐私保护场景下展现了巨大潜力。
提供机构:
浙江大学


