遇见数据集

stratasynth-personas-brazil

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

StrataSynth Personas Brazil 是一个包含 1,250 个合成人物画像的数据集,全部以巴西葡萄牙语书写。每个人物都包含详细的传记、说话风格、日常安排、爱好、技能、目标以及基于大五人格和成人依恋模型的人格测量。数据集共有 27 个字段,涵盖年龄、性别、地区、教育、职业、收入、家庭结构、居住状况等人口统计信息。该数据集基于巴西真实人口统计数据生成,确保年龄、地区、教育、职业、收入和家庭结构符合实际分布。v2 版本引入了真实职业(以当地语言命名)、与教育和年龄相匹配的收入分布以及符合官方统计的就业率。数据可广泛应用于测试面向巴西用户的聊天机器人和智能体、进行年龄/性别/区域的公平性检查、生成葡萄牙语合成数据(如模拟用户提问)、以及用于调查和产品的预测试。所有人物均为合成,不涉及真实个人,名字基于真实姓名频率。

StrataSynth Personas Brazil is a dataset containing 1,250 synthetic personas, all written in Brazilian Portuguese. Each persona includes detailed biography, speaking style, daily schedule, hobbies, skills, goals, and personality measurements based on the Big Five and Adult Attachment models. The dataset has a total of 27 fields covering demographic information such as age, gender, region, education, occupation, income, family structure, and housing status. It is generated based on real Brazilian demographic statistics, ensuring that age, region, education, occupation, income, and family structure follow actual distributions. Version v2 introduces real occupations (named in the local language), income distribution matched to education and age, and employment rates consistent with official statistics. The data can be widely used for testing chatbots and agents targeting Brazilian users, fairness checks by age/gender/region, generating Portuguese synthetic data (e.g., simulating user questions), and pre-testing surveys and products. All personas are synthetic and do not involve real individuals; names are based on real name frequencies.

创建时间:
2026-09-28
原始信息汇总

StrataSynth Personas Brazil 数据集概述

基本信息

  • 数据集名称:StrataSynth Personas Brazil
  • 数据集地址:https://huggingface.co/datasets/StrataSynth/stratasynth-personas-brazil
  • 许可证:CC BY 4.0
  • 语言:葡萄牙语(巴西)
  • 数据规模:1,250 条,规模类别为 1K<n<10K
  • 任务类别:文本生成
  • 数据文件:personas_br.jsonl(train 划分)
  • 数据标签:synthetic、synthetic-data、personas、synthetic-personas、persona、synthetic-users、user-simulation、agent-evaluation、brazil、stratasynth

数据集简介

该数据集包含 1,250 个来自巴西的合成人物,使用葡萄牙语(巴西)撰写。每个合成人物包含传记、说话方式、爱好、技能、目标以及测量的人格特征。

  • 1,250 个人物
  • 每人 27 个字段
  • 覆盖 5 个宏观区域

该数据集是 StrataSynth Personas 集合的一部分(八个国家、10,000 人)。完整集合地址:https://huggingface.co/datasets/StrataSynth/stratasynth-personas-8-countries。

v2 版本新增内容

  • 真实职业:工作内容遵循每个年龄段、性别、教育程度和收入人群在当地实际从事的工作,职业名称按当地说法命名(每个国家有数百种不同职业,例如巴西的 "operadora de caixa")。
  • 真实收入:income_level 遵循各国按教育程度和年龄划分的真实家庭收入分布(low = 后 30%,medium = 中间 40%,high = 前 30%),且职业与之保持一致。
  • 真实就业:就业与失业比例遵循各国按性别和年龄划分的官方比率。

数据集特点

  • 真实人口,而非刻板印象:年龄、地区、教育、职业、收入、居住安排和家庭结构遵循该国真实成年人口。子女年龄与父母年龄匹配,姓名遵循各代际的真实姓名频率。
  • 以葡萄牙语(巴西)原生撰写:传记、日常作息、说话风格、爱好、技能和目标均为母语撰写,而非翻译。
  • 可筛选的人格:为每个人物提供大五人格(0-1)和成人依恋。更外向的人拥有更多社交类爱好;更开放的人拥有更多文化和学习导向的爱好。
  • 可直接作为用户使用:传记加说话风格正是用户模拟器所需的:将其放入提示词中,即可得到一个来自巴西的顾客、患者或受访者。

人口特征

  • 年龄:18-85 岁,中位数 42 岁。
  • 就业:62% 就业,12% 退休,20% 居家,4% 失业,2% 在读。
  • 住房:50% 自有住房,45% 租房,5% 住在家庭住房。

主要用途

  • 在正式上线前,用真实的本地用户测试为巴西构建的聊天机器人和智能体。
  • 跨年龄、性别和地区进行公平性与偏见检查。
  • 为葡萄牙语(巴西)合成数据做种子:"写出这个人会问的问题"。
  • 作为合成受访者,预测试调查、产品和信息传达。

字段说明

字段 类型 描述
id string 国家代码 + 编号,例如 es-00001
name string 全名。按当地习俗,西班牙、墨西哥和巴西使用两个姓氏
country string ES、MX、US、GB、DE、FR、IT、BR
language string 所有文本字段的语言:es、en、de、fr、it、pt
age int 18 至 85
gender string male、female、non_binary
region string 国家内的区域(巴西:宏观区域)
city_size string rural、small、medium、large、metro
education string secondary、vocational、university、postgrad
occupation string null
last_occupation string null
income_level string low、medium、high,相对于该国
household_type string single、couple、family_young、family_teen、empty_nester
marital_status string single、partnered、married、divorced、widowed
children int 子女数量
children_ages list[int] 子女年龄
housing string owned、rented、family_home
employment_status string employed、unemployed、student、retired、homemaker、other
lives_with_parents bool null
daily_routine string 典型的一天,使用人物语言
persona string 传记,使用人物语言
speaking_style string 说话方式:语气、长度、词汇、习惯,使用人物语言
hobbies_and_interests list[string] 五项爱好和兴趣
skills list[string] 三至六项技能
goals list[string] 未来一到三个目标
consumer object shopping_style、price_sensitivity、brand_loyalty、sustainability_concern、tech_adoption
personality.big_five object O 开放性、C 尽责性、E 外向性、A 宜人性、N 神经质,0 至 1
personality.attachment object 成人依恋 anxiety 和 avoidance,0 至 1

加载方式

python from datasets import load_dataset people = load_dataset("StrataSynth/stratasynth-personas-brazil", split="train")

备注

  • 每个人物均为完全合成。他们不是真实人物或任何机构的记录,与真实人物的任何相似之处均为巧合。
  • 姓名取自真实姓名频率,因此合成人物可能与真实人物同名。
  • 使用时请注明来源 StrataSynth。
搜集汇总
数据集介绍
stratasynth-personas-brazil 数据集图片
构建方式
该数据集的构建依托于StrataSynth的Humans Engine,以巴西真实人口统计结构为锚点,系统生成1,250名虚拟个体。构建过程将年龄、性别、教育程度、收入与就业状态等变量纳入约束,使人口比例与巴西官方数据保持一致,例如就业率按性别与年龄分布对齐,家庭收入按教育水平分层为低、中、高三档。职业名称采用巴西本地用语,子女年龄与父母年龄相互匹配,姓名则依据各代际的真实姓名频率抽取。文本内容以葡萄牙语(巴西)母语化撰写,而非翻译生成,涵盖传记、日常作息、言谈风格、兴趣爱好、技能与目标等维度,并为每名个体测量大五人格与成人依恋倾向,最终形成结构化的合成人物档案。
特点
数据集的核心特征在于其人口学真实性与心理测量维度的可过滤性。1,250名虚拟人物覆盖巴西五大宏观区域,年龄跨度为18至85岁,中位数为42岁,就业状态包含在职、退休、居家、失业与求学等类型,住房与婚姻状况亦贴近实际分布。每名个体包含27个字段,人格以0至1连续值刻画大五人格与依恋焦虑、回避维度,且人格特质与兴趣选择之间存在语义关联,例如高外向者拥有更多社交类爱好,高开放性者偏向文化与学习类兴趣。所有文本字段均以巴西葡萄牙语原生撰写,言谈风格细化至语气、句长、词汇与口头禅,便于直接嵌入提示词中模拟本地用户。
使用方法
该数据集可通过Hugging Face datasets库以单行代码加载,调用load_dataset("StrataSynth/stratasynth-personas-brazil", split="train")即可获取训练集,数据以JSONL格式存储,每条记录对应一名合成人物。使用者可将persona与speaking_style字段拼接至提示词中,将合成人物转化为聊天机器人测试中的巴西本地用户、患者或调查受访者。该数据集适用于面向巴西市场的对话系统与智能体上线前的真实用户模拟测试,亦可用于跨年龄、性别与地区的公平性与偏见审查,或作为葡萄牙语合成数据的种子,生成特定人物可能提出的问题。此外,该数据集还可充当合成受访者,用于问卷、产品与营销信息的预测试。
背景与挑战
背景概述
在人工智能系统日益渗透至社会各领域的当下,如何构建能够真实反映特定地域人口统计学特征与行为模式的合成人物数据集,已成为人机交互、计算社会科学与算法公平性研究交汇处的关键命题。StrataSynth Personas Brazil由StrataSynth团队于2024年前后发布,系其跨八国、万人规模合成人物集合的巴西子集,包含1,250名以巴西葡萄牙语为母语的合成个体,每人涵盖27个字段。该数据集直面既有合成人物资源普遍存在的刻板化与人口统计失真问题,以真实人口分布为锚点,力图为面向巴西市场的对话系统、智能体评估与社会科学预调研提供高保真度的虚拟用户群体,对推动葡萄牙语语境下的合成数据研究具有奠基性意义。
当前挑战
该数据集所回应的核心领域难题,在于合成人物生成中长期存在的真实性与可用性张力:传统方法或依赖翻译移植,或流于表面的人口统计标签堆砌,导致合成个体缺乏地域文化肌理与行为一致性。构建过程中,研究团队须在年龄、性别、教育、收入与职业之间建立符合巴西官方统计的联合分布约束,同步实现姓名代际频率的本土化采样、大五人格与日常兴趣的逻辑耦合,以及口语风格的原生葡萄牙语书写。此外,如何在保持个体差异的同时避免对边缘群体的二次刻板化,如何在完全合成的前提下确保与真实人口统计的统计对齐,均为该数据集面临的关键挑战。
常用场景
经典使用场景
在合成用户模拟与智能体评测领域,该数据集最经典的使用场景在于为面向巴西市场的对话系统提供高保真度的本地化虚拟用户。研究者可将每一份人物档案与言说风格直接嵌入提示词,从而驱动大语言模型扮演具备真实社会人口属性、消费倾向与人格特质的巴西受访者、客户或患者。此类应用有效规避了真实用户招募的成本与时延,并在受控条件下实现了对交互对象特征的精细操控,尤其适用于跨文化对话系统的前期验证与压力测试。
实际应用
在产业实践中,该数据集可直接服务于面向巴西市场的产品预研与市场调研工作。企业可利用其构建合成受访者,在问卷预测试、产品概念筛选与营销信息传达等环节快速获取初步反馈,显著压缩调研周期与成本。对话式人工智能团队亦可将其用于聊天机器人与智能客服的上线前测试,通过模拟不同年龄、收入与地域背景的巴西用户,评估系统在多方言表达、非正式用语理解及情感适应等方面的表现。此外,葡萄牙语合成数据的生成与增强亦为其重要应用方向。
衍生相关工作
该数据集隶属于StrataSynth Personas系列,其八国合并版本进一步拓展了跨文化比较研究的可能性。围绕此类合成人格数据,学术界与工业界已衍生出多项经典工作方向,包括基于大语言模型的角色扮演智能体评估框架、面向低资源语言的合成语料生成方法、以及融合大五人格与依恋理论的用户行为模拟研究。该数据集所提供的人口统计一致性保障与原生语言撰写范式,亦为后续合成数据集的构建树立了可资借鉴的方法论标杆,推动了合成数据在社会科学计算研究中的规范化应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务