MatrAIx
收藏资源简介:
MatrAIx数据集是一个用于人工智能训练和研究的综合性人物角色与合成数据集合,旨在提供多样化、结构化的人物角色数据,以支持个性化AI交互和模拟。数据集包含总计1,119,261个精心构建的人物角色,来源于两个主要渠道:PersonaHub Elite(提供561,051个经过筛选的角色)和NVIDIA Nemotron(提供558,210个角色,并进一步按美国、日本、新加坡和巴西四个主要市场进行细分)。所有数据均以高效的Parquet列式存储格式提供,便于大规模批处理和分析查询。每个数据样本(即一个“persona”)包含一系列结构化属性,例如唯一标识符(id)、姓名(name)、年龄(age)、性别(gender)、所在地区(region)、所属领域/行业(domain)、资历级别(seniority)以及教育背景(education)等。这些属性共同描绘了具有不同人口统计学特征、专业背景和地理分布的人物画像。该数据集适用于多种AI应用场景,包括但不限于:基于特定人物角色条件进行智能体(Agent)开发和个性化交互、模拟跨人口统计和地区的真实用户行为、生成以人物角色为条件的合成对话用于模型训练、评估模型在不同市场下遵循人物设定的一致性、进行人物多样性、人口覆盖和区域属性的研究,以及对具有地理多样性感知的语言模型进行微调。数据集整合后采用CC0 1.0通用(公共领域)许可。
数据集概览
MatrAIx 是一个综合性的人物角色与合成数据集合,专为AI训练与研究设计,整合了来自 PersonaHub 和 NVIDIA Nemotron 两个来源的1,119,261个角色(截至2026年6月23日)。数据集以 Parquet 格式存储,共包含 40 个文件。
数据结构与特征
数据集包含以下结构化字段:
- id:字符串
- name:字符串
- age:整数
- gender:字符串
- region:字符串
- domain:字符串
- seniority:字符串
- education:字符串
数据被组织为一个训练集(split: train),包含 561,059 个样本,总大小为 176,000,000 字节。
数据来源与分布
PersonaHub 精英数据集(561,051 个角色)
- 来源:PersonaHub
- 格式:Parquet
- 覆盖范围:多样的人口统计学属性(年龄、性别、教育、地区、领域、资历)
- 文件数量:12 个批次
- 状态:已完全上传
NVIDIA Nemotron 数据集(558,210 个角色)
| 市场区域 | 文件数量 | 角色数量 | 状态 |
|---|---|---|---|
| 美国 | 5 | 248,210 | ✅ |
| 日本 | 1 | 50,000 | ✅ |
| 新加坡 | 1 | 50,000 | ✅ |
| 巴西 | 21 | 210,000 | ✅ |
- 格式:Parquet
- 特征:结构化人口统计学数据(年龄、性别、职业、教育、专业领域、区域市场特定属性)
标签与许可
- 标签:
personas,demographics,synthetic-data,OASIS,personality - 许可协议:CC0 1.0(公共领域),整合部分的许可为CC0 1.0 Universal;原始数据集(PersonaHub、NVIDIA Nemotron)遵循其各自的许可协议。
数据组织与目录结构
MatrAIx/ ├── personahub/ (12个Parquet文件,共561,051个角色) └── nemotron/ ├── usa/ (5个Parquet文件,共248,210个角色) ├── japan/ (1个Parquet文件,共50,000个角色) ├── singapore/ (1个Parquet文件,共50,000个角色) └── brazil/ (21个Parquet文件,共210,000个角色)
主要应用场景
- 智能体开发:为个性化交互赋予不同的角色
- 用户模拟:模拟跨人口统计学和区域的真实用户行为
- 训练数据生成:生成基于角色条件的合成对话与交互
- 基准测试:评估模型在不同市场中的角色跟随与一致性
- 研究:研究角色多样性、人口统计学覆盖和区域属性
- 模型微调:训练具备地理多样性的角色感知语言模型
数据加载示例
使用Pandas加载: python import pandas as pd
加载PersonaHub角色
ph = pd.read_parquet(personahub/personahub_elite_batch_00001.parquet)
加载美国市场角色
nem_usa = pd.read_parquet(nemotron/usa/nemotron_usa_batch_00001.parquet)
使用Hugging Face Datasets加载: python from datasets import load_dataset dataset = load_dataset(MatrAIx/MatrAIx, name=personahub)
引用信息
bibtex @dataset{matrrix_personas_2026, title={MatrAIx Persona Dataset}, author={MatrAIx Team}, year={2026}, url={https://huggingface.co/datasets/MatrAIx/MatrAIx}, note={Includes personas from PersonaHub and NVIDIA Nemotron across multiple regions} }




