遇见数据集

NousResearch/CharacterCodex

收藏
Hugging Face2024-06-17 更新2024-06-15 收录
官方服务:

资源简介:

Character Codex是一个综合数据集,包含多种媒体类型和流派中的流行角色信息。每个条目详细描述了角色、媒体来源和独特的情景,适用于合成数据生成、生成AI的RAG、写作、游戏开发等创意项目。

Character Codex是一个综合数据集,包含多种媒体类型和流派中的流行角色信息。每个条目详细描述了角色、媒体来源和独特的情景,适用于合成数据生成、生成AI的RAG、写作、游戏开发等创意项目。

提供机构:
NousResearch
原始信息汇总

数据集卡片 for Character Codex

数据集概述

Character Codex 是一个综合性的数据集,包含了来自各种媒体类型和流派的流行角色。每个条目都包括角色的详细信息、媒体来源以及一个独特的角色场景。这个数据集对于合成数据、生成式AI的RAG、作家、游戏开发者以及希望探索和利用丰富角色描述进行各种创意项目的粉丝非常有价值。

数据集结构

数据字段

  • media_type: 角色来源的媒体类型(例如,网络漫画、小说、电影、电视节目)。
  • genre: 媒体类型的特定流派(例如,奇幻网络漫画、武术小说)。
  • character_name: 角色的名字。
  • media_source: 角色来源的媒体标题。
  • description: 角色的详细描述,包括他们在故事中的角色和重要性。
  • scenario: 一个涉及角色的创意场景,可用于互动故事讲述或角色扮演目的。

示例数据

json [ { "media_type": "Webcomics", "genre": "Fantasy Webcomics", "character_name": "Alana", "media_source": "Saga", "description": "Alana 是网络漫画 "Saga" 的主要角色之一。她是一个意志坚强且极度保护自己家庭的母亲,在一个战乱的星系中与家人一起逃亡。故事融合了奇幻和科幻元素,创造了一个丰富而复杂的叙事。", "scenario": "你是星系中的一个旅行者需要帮助,Alana 提供援助并分享她家庭奋斗和胜利的故事。" }, { "media_type": "Novels", "genre": "Martial Arts Fiction", "character_name": "Yilin", "media_source": "The Smiling, Proud Wanderer", "description": "Yilin 是金庸小说 "The Smiling, Proud Wanderer" 中恒山派的年轻尼姑。以她的纯真和善良著称,她与主角令狐冲成为朋友。她的温柔本性经常使她与武术的暴力世界产生冲突。", "scenario": "你是恒山派的同门弟子,在一场特别残酷的冲突后寻求Yilin的安慰和建议。她的温柔举止和富有同情心的话语在一个严酷的世界中提供了慰藉。" } ]

使用案例

  • 种子数据: 用于生成合成数据或在生成式AI的互动体验中使用。
  • 创意写作: 使用详细的角色描述和场景来激发创意写作项目。
  • 教育: 研究各种流派和媒体类型的角色发展和叙事技巧。

数据集创建

数据收集

该数据集中的角色是从各种媒体中精心挑选的,确保了一个丰富多样的集合。描述和场景被精心设计,以提供每个角色的深入和引人入胜的背景。

注释

每个角色条目包括:

  • 媒体类型(例如小说、杂志、动漫)、流派(例如动作、历史)以及他们来自的特定媒体来源/标题(例如宝可梦)。
  • 突出角色角色、特质和重要性的详细描述。
  • 旨在刺激互动和沉浸式体验的场景。

引用

bibtex @dataset{character_codex_2024, title={Character Codex}, author={"Teknium"}, year={2024}, note={https://huggingface.co/datasets/NousResearch/CharacterCodex} }

搜集汇总
数据集介绍
NousResearch/CharacterCodex 数据集图片
构建方式
CharacterCodex数据集由NousResearch精心构建,旨在汇聚来自多元媒介与类型的经典角色。数据采集阶段,团队从Webcomics、Novels、Movies、TV Shows等广泛媒介中甄选角色,确保样本的丰富性与代表性。每个条目均包含media_type、genre、character_name、media_source、description及scenario六个字段,其中描述与场景经过精细注释,以揭示角色的核心特质与叙事潜力。这种结构化设计使得数据集既可用于生成合成数据,也能支撑检索增强生成(RAG)等高级AI应用,为创意项目提供坚实的数据基础。
特点
该数据集的核心特点在于其跨媒介的广度与场景的创造性。涵盖从奇幻漫画到武侠小说的多元类型,角色如Alana与Yilin的详细描述不仅勾勒出角色在故事中的定位与意义,还通过精心设计的scenario字段激发互动叙事与角色扮演的可能性。数据规模介于10K至100K之间,兼顾质量与数量,每个条目均以英文呈现,并采用Apache-2.0许可证开放使用,为作家、游戏开发者及AI研究者提供了一扇探索角色深度与叙事多样性的窗口。
使用方法
使用CharacterCodex数据集极为便捷。用户可通过HuggingFace的datasets库以一行代码加载:`dataset = load_dataset("NousResearch/CharacterCodex")`。该数据适用于多种场景:作为种子数据驱动生成式AI的合成内容创作,或为创意写作提供灵感源泉,亦可用于教育领域,研究角色发展与叙事技巧。开发者可直接利用description与scenario字段构建交互式体验,如角色扮演游戏或故事生成系统,充分发挥数据集在跨媒介角色建模中的实用价值。
背景与挑战
背景概述
在人工智能与创意产业深度融合的浪潮中,人物角色数据作为叙事智能、角色扮演系统及生成式AI的核心要素,其丰富性与结构化程度直接决定了模型的表现力。NousResearch团队于2024年推出的CharacterCodex数据集,由主要研究员Teknium主导构建,旨在填补跨媒介角色知识库的空白。该数据集系统收录了来自网络漫画、小说、影视、动漫等多元媒介的万余个经典角色,每个条目均包含媒介类型、流派、角色名称、来源作品、深度描述及情境设定。作为面向语言模型与创意应用的高质量资源,它有力推动了合成数据生成、检索增强生成及交互式叙事的发展,为角色驱动的AI应用提供了结构化基石。
当前挑战
CharacterCodex所面临的挑战首先源于跨媒介角色表征的复杂性。不同媒介(如文学与影视)对角色塑造的粒度与维度各异,如何统一描述范式以兼顾文学深度与影视直观性,是数据构建的核心难题。其次,在数据采集与标注过程中,需确保角色描述的原创性与版权合规性,避免对原作品的直接复制,同时维持情境设定的创意性与逻辑自洽。此外,角色数据的稀疏性与长尾分布(如小众作品角色)对模型的泛化能力构成考验,而情境场景的多样性则要求生成式AI具备更强的上下文理解与角色一致性保持能力,这为后续模型微调与评估带来了显著技术挑战。
常用场景
经典使用场景
CharacterCodex数据集汇聚了来自多种媒介类型与流派的经典角色,每一条目均囊括角色描述与情境设定。在自然语言处理与创意生成领域,该数据集常被用作种子数据,以驱动生成式AI模型产出具有叙事深度的交互内容。研究者可借助这些结构化角色档案,为语言模型注入丰富的角色认知与情境理解能力,从而提升生成故事的一致性与角色代入感。此外,该数据集还可作为检索增强生成(RAG)系统的知识库,为对话式AI提供精准的角色背景支撑,使其在角色扮演或互动叙事场景中展现出更为生动且连贯的表现。
实际应用
在实际应用中,CharacterCodex展现出显著的产业价值。游戏开发者可利用其中详尽的角色描述与情境设计,为开放世界游戏或角色扮演游戏生成非玩家角色(NPC)的对话脚本与行为逻辑,极大提升游戏世界的沉浸感。作家与编剧则能从中汲取灵感,将现成的角色档案作为创作起点,快速构建故事框架。此外,该数据集还服务于虚拟助手与教育娱乐产品,通过赋予AI系统丰富的角色知识,使其能够以特定角色身份与用户进行富有情感与故事性的互动,从而增强用户体验的粘性与趣味性。
衍生相关工作
围绕CharacterCodex,学术界与工业界已衍生出多项经典工作。例如,基于该数据集的角色一致性生成任务催生了面向长文本的角色记忆网络模型,有效缓解了生成故事中角色性格漂移的问题。另有研究者将其与检索增强生成框架结合,构建了动态角色知识库,使得对话系统能够在实时交互中调用角色背景信息。此外,该数据集还被用作微调大型语言模型的指令数据,训练出专精于角色扮演的对话代理,这些代理在个性表达与情境适应能力上显著优于通用模型。这些衍生工作不仅验证了数据集的多功能性,也为其在更广泛的人机协作创作场景中的落地奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务