遇见数据集

Awesome-Personalized-LLM

收藏
github2026-05-12 更新2026-06-04 收录
官方服务:

资源简介:

该数据集合集专注于收集和整理与个性化大型语言模型(LLMs)相关的数据集资源,涵盖角色扮演、个性化聊天、LLM个性评估(如MBTI和五因素模型)等领域。它旨在为研究人员和开发者提供一个集中的资源索引,包括数据集、论文、应用等,以促进个性化LLM社区的发展。

This dataset collection focuses on collecting and curating dataset resources related to personalized Large Language Models (LLMs), covering domains such as role-playing, personalized chatting, and LLM personality evaluation (e.g., MBTI and Five-Factor Model). It aims to provide researchers and developers with a centralized resource index encompassing datasets, academic papers, applications, and other relevant resources, so as to facilitate the development of the personalized LLMs community.

创建时间:
2023-10-16
原始信息汇总

数据集概述:Awesome-Personalized-LLM

本项目旨在记录与个性化大语言模型(Personalized LLMs)相关的资源,涵盖角色扮演(Role-Playing)、个性化对话(Personalized Chat)以及LLM人格特质评估(Personality Traits of LLM)等领域。

主要内容结构

一、论文资源(Awesome Papers)

1. 角色扮演(Role-Playing)

  • 收录16篇相关论文,时间跨度2022年至2024年。
  • 代表性作品包括:BeyondDialogue(Arxiv24)、RoleInteract(Arxiv24)、CharacterGLM(Arxiv23)、RoleLLM(arXiv23)等。
  • 多数论文提供代码或演示链接。

2. 个性化对话(Personalized Chat)

  • 收录10篇论文,时间跨度2022年至2024年。
  • 代表性作品:ControlLM(Arxiv24)、CharacterChat(arXiv23)、Multi-Party Chat(Arxiv23)等。
  • 部分论文提供代码资源。

3. LLM人格评估(Evaluation Personality of LLM)

  • MBTI评估:3篇论文,如《Does Role-Playing Chatbots Capture the Character Personalities?》(Arxiv23)。
  • 大五人格评估:3篇论文,包括《Evaluating and Inducing Personality in Pre-trained Language Models》(NeurIPS23)。
  • 其他评估:4篇论文,如《The Turing Quest: Can Transformers Make Good NPCs?》(ACL23-Workshop)。

4. 基准测试(Benchmark)

  • 收录3个基准数据集:CharacterEval(Arxiv24)、RoleEval(Arxiv23)、LaMP(Arxiv23)。
  • 均提供论文与代码链接。

5. 综述(Survey)

  • 3篇综述论文,均发表于2024年,涵盖角色扮演与个性化主题。

二、数据集资源(Awesome Datasets)

  • GPTeacher/Roleplay:Hugging Face数据集,角色扮演对话数据。
  • BelleGroup/Generated_Chat_0.4M:Hugging Face数据集,大规模生成对话。
  • CharacterChat:Google Drive链接,个性化社交支持对话数据。
  • Deep-Personalized-Character-Dataset-DPCD:GitHub仓库,从电视剧中提取深度个性化角色数据。
  • Harry Potter Dialogue:网站下载,哈利波特双语对话数据。
  • carecall-corpus (Korean):GitHub仓库,韩语老年关怀对话语料。
  • RoleBech:Hugging Face数据集,角色扮演基准数据。

三、相关仓库(Related Repositories)

  • Paper reading list in dialogue systems:GitHub仓库,对话系统论文阅读列表。
  • LLM and Society:GitHub仓库,LLM与社会相关资源汇总。
  • Persona Paper:GitHub仓库,角色论文相关资源。
搜集汇总
数据集介绍
Awesome-Personalized-LLM 数据集图片
构建方式
在大型语言模型(LLM)蓬勃发展的时代背景下,个性化对话与角色扮演成为人工智能领域备受瞩目的研究方向。Awesome-Personalized-LLM数据集并非单一数据集合,而是一个精心编纂的资源索引库,通过系统梳理该领域的前沿文献与开源数据集构建而成。其构建方式遵循严谨的学术检索与分类框架,从角色扮演、个性化聊天、LLM人格特质评估等维度,广泛收录了发表于各大顶会与预印本平台的研究工作。每一篇论文均附有标题、发表会议、时间及代码链接,数据集部分则汇集了如GPTeacher/Roleplay、CharacterChat等代表性资源,形成了一幅覆盖方法、评估与基准的完整知识图谱。
使用方法
使用该数据集时,研究者可依据自身需求,通过其清晰的分类导航进行精准检索。例如,若关注角色扮演能力,可直接查阅Role-Playing表格,获取相关论文及对应代码仓库;若需进行人格评估实验,则可转向Myers–Briggs Type Indicator或Big Five Factors Evaluation子章节,参考其中方法。对于数据集资源,Awesome Datasets部分提供了直接可用的对话数据链接,便于加载进行模型训练或微调。同时,Related Repositories进一步扩展了阅读范围,连接至对话系统、LLM与社会影响等更广泛的文献列表,形成一个可迭代的研究起点。
背景与挑战
背景概述
随着大型语言模型(LLMs)在自然语言处理领域的迅猛发展,如何赋予这些模型以个性化的交互能力,已成为学术界与工业界共同关注的前沿课题。Awesome-Personalized-LLM数据集由多位研究者于2023年至2024年间陆续贡献,旨在系统梳理和推动个性化LLM的研究,涵盖角色扮演、个性化对话以及LLM人格特质评估等核心方向。该数据集的创建源于对通用LLM在个性化表达上不足的深刻洞察,其核心研究问题在于:如何使LLM能够精准模拟特定角色、适配用户偏好,并具备稳定可测的人格特征。通过汇集如CharacterGLM、RoleLLM、ChatHaruhi等代表性工作,该数据集为相关领域提供了宝贵的资源索引,显著促进了角色扮演智能体与个性化对话系统的理论突破与应用落地,对推动LLM从通用工具向个性化伙伴的演进具有深远影响。
当前挑战
Awesome-Personalized-LLM数据集所面临的挑战多维且严峻。首先,在领域问题层面,个性化LLM需解决角色一致性与对话自然性的平衡难题,例如在角色扮演中,模型需长期维持特定角色的语言风格与知识边界,避免人格漂移;同时,个性化对话需在有限用户数据下实现高效适配,这对模型的可塑性提出了极高要求。其次,在构建过程中,数据集面临标注成本高昂与主观偏差显著的挑战,如MBTI、大五人格等评估工具在LLM上的泛化性存疑,导致人格标签的可靠性难以保证。此外,跨语言、跨文化场景下角色定义的多样性,以及动态交互中用户意图的模糊性,进一步加剧了数据收集与标准化的复杂性。这些挑战共同制约着个性化LLM从实验研究向真实应用的高效转化。
常用场景
经典使用场景
在大型语言模型(LLM)的个性化研究浪潮中,Awesome-Personalized-LLM数据集为角色扮演与个性化对话提供了核心资源。其经典使用场景聚焦于构建能够模拟特定人物性格、语言风格及行为模式的对话智能体。例如,基于该数据集,研究者可训练模型复现影视或文学角色(如哈利·波特),使其在交互中展现与原作一致的情感反应与知识边界。数据集包含的多样角色档案与多轮对话样本,支持从单角色到多角色交互的模拟,成为评估LLM角色一致性、人格稳定性与对话流畅性的标准测试床。这一场景不仅验证了模型对复杂人格的捕捉能力,也为虚拟偶像、游戏NPC等交互产品奠定了技术基础。
解决学术问题
该数据集系统性地回应了LLM领域长期存在的两大核心学术命题:如何量化评估模型的个性化能力,以及如何实现人格特征的可控注入。在评估层面,它整合了MBTI、大五人格等心理学量表,构建了从角色扮演一致性到人格特质多维度的评价体系,解决了传统指标无法衡量模型‘拟人化’水平的困境。在方法层面,数据集催生了基于动态LoRA的角色微调、无监督人格词汇构建等技术,突破了通用LLM在个性化表达上的瓶颈。其意义在于将人格心理学与自然语言处理深度交叉,为构建具有稳定、可解释个性的对话系统提供了理论框架与实证基准,推动AI从‘工具化’向‘人格化’演进。
实际应用
在实际产业应用中,该数据集驱动的技术已渗透至多个垂直领域。在数字娱乐方面,它被用于开发具备深度人格设定的虚拟偶像与互动叙事游戏,例如基于《哈利·波特》角色构建的沉浸式对话系统,显著提升了用户的情感黏性。在客户服务领域,企业借助数据集训练具有特定品牌人格的客服机器人,实现从标准化应答到个性化关怀的升级。教育科技领域则利用其模拟历史人物或文学角色进行互动教学,增强学习的趣味性与代入感。此外,数据集还支持心理健康场景中的社交技能训练,通过可控人格的对话代理为用户提供安全的社交模拟环境,展现了从娱乐到严肃应用的广泛适配性。
数据集最近研究
最新研究方向
在大型语言模型(LLM)领域,个性化与角色扮演已成为前沿热点,驱动着人机交互从通用对话向深度定制化演进。Awesome-Personalized-LLM数据集聚焦于这一趋势,整合了角色扮演、个性化聊天及LLM人格特质评估等核心方向。近期研究不仅关注如何通过动态LoRA、自对齐等技术实现多角色高效扮演,还深入探索了MBTI与大五人格等心理学框架在LLM评估中的应用,以量化模型的人格一致性。同时,CharacterEval、RoleEval等双语基准的涌现,为衡量角色扮演的忠实度与交互自然度提供了标准化标尺。这些工作紧密关联着虚拟社交、游戏NPC智能化及心理模拟等热点应用,其意义在于推动LLM从静态工具进化为具备动态人格的社交伙伴,为构建可信任、有温度的个性化AI系统奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务