遇见数据集

stratasynth-personas-italy

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

StrataSynth Personas Italy 是一个包含 1,250 个合成意大利人物的数据集,所有文本以意大利语撰写。每个样本包含 27 个字段,涵盖个人基本属性(如年龄、性别、地区、教育水平、职业、收入等级)、家庭结构、日常活动、传记(persona)、说话风格、爱好与兴趣、技能、未来目标、人格特质(大五人格 0-1 评分和成人依恋类型)以及消费者画像(购物风格、价格敏感度、品牌忠诚度、可持续性关注、技术采纳)。数据集的 v2 版本引入了基于各国真实教育水平和年龄的家庭收入分布(低/中/高),以及按性别和年龄调整的就业状态,以更真实地反映意大利成年人口。人物年龄范围为 18-85 岁,中位数 51 岁,覆盖 19 个地区。该数据集旨在为意大利本地化的聊天机器人、智能体提供真实的模拟用户,用于测试、偏见检查、公平性评估,以及生成意大利语合成数据(如“写出这个人会问的问题”)和预测试调查、产品与信息。所有人物均为完全合成,不指向任何真实个体,名称基于真实频率。数据集采用 CC BY 4.0 许可。

StrataSynth Personas Italy is a dataset containing 1,250 synthetic Italian personas, all text written in Italian. Each sample includes 27 fields covering basic personal attributes (such as age, gender, region, education level, occupation, income level), family structure, daily activities, biography (persona), speaking style, hobbies and interests, skills, future goals, personality traits (Big Five personality 0-1 scores and adult attachment styles), and consumer profiles (shopping style, price sensitivity, brand loyalty, sustainability concerns, technology adoption). The v2 version introduces household income distribution (low/medium/high) based on real education levels and ages by country, as well as employment status adjusted by gender and age, to more accurately reflect the Italian adult population. The personas range in age from 18 to 85 years old, with a median of 51, covering 19 regions. The dataset is designed to provide realistic simulated users for Italian-localized chatbots and agents, for testing, bias checking, fairness evaluation, generating Italian synthetic data (such as write the questions this person would ask), and pre-testing surveys, products, and information. All personas are entirely synthetic and do not refer to any real individuals; names are based on real frequencies. The dataset is licensed under CC BY 4.0.

创建时间:
2026-09-28
原始信息汇总

StrataSynth Personas Italy 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/StrataSynth/stratasynth-personas-italy
  • 许可证:CC BY 4.0
  • 语言:意大利语(it)
  • 数据规模:1,250 个合成人物,每人 27 个字段,覆盖意大利 19 个大区
  • 数据文件:personas_it.jsonl(train 划分)
  • 任务类别:文本生成
  • 规模类别:1K<n<10K

数据集简介

该数据集包含 1,250 个来自意大利的合成人物,使用意大利语撰写。每个人物均包含传记、说话方式、爱好、技能、目标以及可量化的人格特征。

本数据集是 StrataSynth Personas 系列的一部分(该系列包含八个国家、共 10,000 人)。完整集合地址:https://huggingface.co/datasets/StrataSynth/stratasynth-personas-8-countries

v2 版本更新

  • 真实收入:income_level 遵循各国按教育程度和年龄划分的家庭收入真实分布(low = 后 30%,medium = 中间 40%,high = 前 30%),职业与之保持一致。
  • 真实就业:就业与失业人口比例遵循各国按性别和年龄划分的官方比率。

数据集特点

  • 真实人口而非刻板印象:年龄、地区、教育、收入、居住安排和家庭结构遵循该国真实成年人口分布。子女年龄与父母年龄匹配,姓名遵循各代际的真实姓名频率。
  • 使用意大利语撰写:传记、日常作息、说话风格、爱好、技能和目标均为本地原生撰写,而非翻译。
  • 可筛选的人格特征:每个人均包含大五人格(0-1)和成人依恋。更外向的人拥有更多社交类爱好;更开放的人拥有更多文化和学习导向的爱好。
  • 可直接用作模拟用户:传记加上说话方式即可满足用户模拟器需求,将其放入提示词即可获得来自意大利的客户、患者或受访者。

人口统计特征

  • 年龄:18-85 岁,中位数 51 岁。
  • 就业状况:54% 在职,20% 退休,10% 居家,5% 失业,8% 求学。
  • 住房:51% 拥有自有住房,32% 租房,16% 住在家庭住房。
  • 与父母同住:16% 的成年人。

使用场景

  • 在正式上线前,使用真实的本地用户测试为意大利构建的聊天机器人和智能体。
  • 跨年龄、性别和地区进行公平性与偏见检查。
  • 为意大利语合成数据提供种子:"写出这个人会问的问题"。
  • 作为合成受访者,用于预测试调查、产品和信息传达。

字段说明

字段 类型 说明
id string 国家代码 + 编号,例如 es-00001
name string 全名。西班牙、墨西哥和巴西按当地习俗使用双姓
country string ES、MX、US、GB、DE、FR、IT、BR
language string 所有文本字段的语言:es、en、de、fr、it、pt
age int 18 至 85
gender string male、female、non_binary
region string 国内大区(巴西为宏观区域)
city_size string rural、small、medium、large、metro
education string secondary、vocational、university、postgrad
occupation string null
last_occupation string null
income_level string low、medium、high,相对于所在国家
household_type string single、couple、family_young、family_teen、empty_nester
marital_status string single、partnered、married、divorced、widowed
children int 子女数量
children_ages list[int] 子女的年龄
housing string owned、rented、family_home
employment_status string employed、unemployed、student、retired、homemaker、other
lives_with_parents bool null
daily_routine string 典型的一天,使用该人物的语言
persona string 传记,使用该人物的语言
speaking_style string 人物的说话方式:语气、长度、词汇、习惯,使用该人物的语言
hobbies_and_interests list[string] 五项爱好与兴趣
skills list[string] 三到六项技能
goals list[string] 未来一到三个目标
consumer object shopping_style、price_sensitivity、brand_loyalty、sustainability_concern、tech_adoption
personality.big_five object O 开放性、C 尽责性、E 外向性、A 宜人性、N 神经质,0 至 1
personality.attachment object 成人依恋 anxiety(焦虑)和 avoidance(回避),0 至 1

加载方式

python from datasets import load_dataset people = load_dataset("StrataSynth/stratasynth-personas-italy", split="train")

示例数据

json { "id": "it-00003", "name": "Roberto Calculli", "country": "IT", "language": "it", "age": 51, "gender": "male", "region": "Calabria", "city_size": "rural", "education": "secondary", "occupation": "impiegato amministrativo", "last_occupation": null, "income_level": "high", "household_type": "family_teen", "marital_status": "married", "children": 2, "children_ages": [16, 19], "housing": "owned", "employment_status": "employed", "lives_with_parents": false }

备注

  • 每个人物均为完全合成。他们不是真实人物或任何机构的记录,与真实人物的任何相似之处均属巧合。
  • 姓名取自真实姓名频率,因此合成人物可能与真实人物同名。

许可

CC BY 4.0。使用时请注明 StrataSynth。

搜集汇总
数据集介绍
stratasynth-personas-italy 数据集图片
构建方式
在合成数据驱动用户模拟与智能体评估的研究脉络中,该数据集以意大利真实成年人口统计结构为锚点,系统化生成1,250位合成人物,覆盖19个大区。构建过程将年龄、性别、地区、教育程度、收入水平、居住安排与家庭结构等变量,严格对齐国家官方分布,并确保子女年龄与父母年龄、姓名频率与代际特征之间的内在一致性。收入层级依据教育程度与年龄的家庭收入实际分布划定为低、中、高三档,就业状态亦遵循分性别与年龄的官方比率,职业设定与收入水平保持逻辑自洽。全部文本字段以意大利语原生撰写,涵盖传记、日常作息、言谈风格、兴趣爱好、技能与目标,并辅以经过测量的大五人格与成人依恋维度,由此形成统计可信且个体可辨识的合成人口。
特点
该数据集的核心特质在于其统计真实性与个体丰富性的兼顾。每位合成人物拥有27个字段,既包含年龄、地区、教育、职业、收入、家庭形态等结构化属性,也包含传记、日常作息与言谈风格等非结构化文本,全部以意大利语原生创作,而非机器翻译。人格维度以0至1连续值刻画大五特质与成人依恋的焦虑、回避倾向,且人格特征与兴趣爱好呈现语义关联,例如外向性较高者拥有更多社交型爱好,开放性较高者偏向文化与学习导向的兴趣。这种结构化属性、自然语言叙述与心理测量维度相互交织的设计,使合成人物既可作为统计样本接受分层检验,也可作为具备稳定语言习惯与行为倾向的个体参与交互。
使用方法
在应用层面,该数据集通过Hugging Face datasets库以单行代码加载,训练集包含全部人物记录,可直接用于文本生成任务。研究者可将某一人物的传记与言谈风格嵌入提示词,将其转化为意大利本地的用户模拟器,用以测试面向意大利市场的聊天机器人与智能体、开展跨年龄性别与地区的公平性与偏见审查、播种意大利语合成数据,或充当合成受访者以预测试问卷、产品与传播信息。由于每个人物均附带消费风格、价格敏感度、品牌忠诚度、可持续关注度与技术采纳倾向等消费心理字段,该数据集亦适用于市场细分与消费者行为模拟研究。使用时需遵循CC BY 4.0许可协议,并注明StrataSynth来源。
背景与挑战
背景概述
在人工智能系统日益深入社会生活的当下,构建能够真实反映特定国家人口特征与行为模式的合成人物数据集,已成为人机交互评测与公平性研究的关键基础设施。StrataSynth Personas Italy由StrataSynth团队于2024年前后发布,系其八国万人合成人物集合的意大利分卷,涵盖1250名18至85岁意大利成年人,每人包含27个字段,覆盖19个大区。该数据集以意大利官方人口统计为锚点,校准年龄、性别、就业、收入、居住安排与家庭结构,并原生以意大利语撰写传记、日常惯例、言谈风格、爱好、技能与人生目标,同时标注大五人格与成人依恋维度。其核心研究问题在于如何以可筛选、可复现的方式生成兼具人口代表性、心理可塑性与文化在地性的合成用户,从而为面向意大利市场的对话系统、智能体与调研工具提供接近真实分布的测试对象。该数据集对合成数据生成、用户模拟与算法公平性评估具有显著影响力,为人本人工智能研究提供了方法论示范。
当前挑战
该数据集所应对的领域问题,在于如何突破合成人物常有的刻板化、扁平化与人口失真困境,使虚拟个体在统计分布与心理特质两个层面均能可信地代表意大利成年人口,进而支撑对话系统与智能体在真实社会语境下的稳健评测。在构建过程中,所面临的挑战尤为复杂:其一,意大利区域差异显著,南北经济、方言与文化习俗分野明显,如何在有限样本中保持19个大区的均衡覆盖与地方真实性,构成抽样与文本生成的双重难题;其二,收入、就业与家庭结构须与官方统计及教育、年龄维度交叉一致,任何偏差都会削弱数据集作为评测基准的公信力;其三,传记、日常惯例与言谈风格均需以意大利语原生撰写,而非翻译,这对语言多样性、地域口音与代际用语的呈现提出极高要求;其四,人格特质的内部一致性与外部可筛选性亦需兼顾,使开放性、外向性等维度与爱好、技能及消费行为形成合乎心理逻辑的关联,避免生成结果沦为随机拼接。上述挑战共同界定了该数据集在真实性、代表性与可用性之间的精细平衡。
常用场景
经典使用场景
在合成用户模拟与代理评估领域,该数据集最经典的使用场景是将单条人格记录直接注入对话提示,使语言模型化身为一名具有真实年龄、地域、教育背景与收入水平的意大利用户。研究者借此构建可控的虚拟受访者,用以评估客服机器人、政务助手或推荐系统在意大利本土语境下的交互表现,亦可通过筛选大五人格与依恋维度,定向生成不同性格倾向的对话对象,从而在受控条件下观察模型对多样化用户特征的响应差异。
衍生相关工作
作为StrataSynth Personas集合的组成部分,该数据集与覆盖八个国家、总计一万人的跨国版本形成衍生关系,后者常被用于跨文化比较与多语言用户模拟研究。围绕这一人格体系,后续工作多聚焦于将合成人格接入代理评估流水线、构建自动化访谈框架,以及探索人格特质与消费行为、技术采纳倾向之间的关联,进而推动合成数据在社会科学实验与人工智能对齐研究中的规范化使用。
数据集最近研究
最新研究方向
在人工智能伦理与用户模拟研究日益交织的背景下,StrataSynth Personas Italy数据集推动了基于真实人口分布的合成人物构建前沿。该数据集以意大利国家统计局的人口统计特征为基准,生成1250个涵盖19个大区、具备多维度人格特质的合成个体,为对话系统与智能体的公平性评估提供了本土化测试床。当前研究热点集中于利用此类合成用户进行跨文化偏见检测、大语言模型的社会人口学对齐,以及基于大五人格和依恋理论的交互行为预测。其意义在于弥合了合成数据与现实人口代表性之间的鸿沟,为构建符合欧盟人工智能法案透明度要求的可审计模拟环境奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务