遇见数据集

Nemotron-Personas-El-Salvador

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

Nemotron-Personas-El-Salvador是一个开源的合成生成人物数据集,采用CC BY 4.0许可证。该数据集基于萨尔瓦多真实的人口统计、地理和人格特征分布构建,旨在准确反映该国人口的多样性和丰富性。数据集包含148,000条记录,总计100万个人物,涵盖300M token(其中161M为人物描述token)。数据结构包含25个字段:7个人物描述字段(通用人物、专业人物、体育人物、艺术人物、旅行人物、烹饪人物、家庭人物)和18个上下文字段(包括文化背景、技能专长、兴趣爱好、职业目标、性别、年龄、语言、婚姻状况、家庭类型、教育水平、职业、地理位置等)。所有人口统计属性均基于2024年萨尔瓦多人口和住房普查的官方统计数据,确保数据真实性和代表性。数据集完全覆盖萨尔瓦多全部14个部门和44个市镇,包含144,000个独特姓名和119种职业类型。该数据集专为支持主权AI开发而设计,通过提供基于真实分布的高质量合成数据,帮助提高数据多样性、减轻模型偏见、防止模型崩溃,特别适用于训练西班牙语萨尔瓦多方言的大型语言模型。数据集仅包含18岁及以上的成年人,所有数据均为人工生成,任何与真实人物的相似性纯属巧合。

Nemotron-Personas-El-Salvador is an open-source synthetic generated persona dataset under the CC BY 4.0 license. It is constructed based on real demographic, geographic, and personality trait distributions of El Salvador, aiming to accurately reflect the diversity and richness of the countrys population. The dataset contains 148,000 records, totaling 1 million personas, covering 300M tokens (with 161M being persona description tokens). The data structure includes 25 fields: 7 persona description fields (general persona, professional persona, sports persona, artistic persona, travel persona, culinary persona, family persona) and 18 contextual fields (including cultural background, skills and expertise, hobbies and interests, career goals, gender, age, language, marital status, family type, education level, occupation, geographical location, etc.). All demographic attributes are based on official statistical data from the 2024 El Salvador Population and Housing Census, ensuring data authenticity and representativeness. The dataset fully covers all 14 departments and 44 municipalities of El Salvador, including 144,000 unique names and 119 occupation types. It is specifically designed to support sovereign AI development by providing high-quality synthetic data based on real distributions, helping to improve data diversity, mitigate model bias, prevent model collapse, and is particularly suitable for training large language models in the Spanish Salvadoran dialect. The dataset only includes adults aged 18 and above, all data is artificially generated, and any resemblance to real persons is purely coincidental.

提供机构:
NVIDIA
创建时间:
2026-06-03
原始信息汇总

数据集概述:Nemotron-Personas-El-Salvador

基本信息

  • 数据集名称: Nemotron-Personas-El-Salvador
  • 许可证: CC BY 4.0(Creative Commons Attribution 4.0 International License)
  • 语言: 西班牙语(萨尔瓦多西班牙语)
  • 任务类别: 文本生成
  • 数据集规模: 100K < n < 1M(训练集含 148,000 条记录)
  • 数据集大小: 约 1.19 GB(下载大小约 568 MB)
  • 发布日期: 2026年3月6日(通过 Hugging Face 发布)
  • 版本: 1.0
  • 开发者: WideLabs 与 NVIDIA Corporation

核心特点

  • 数据性质: 完全由合成生成的个人档案,基于萨尔瓦多真实的人口、地理和人格特征分布,旨在捕捉萨尔瓦多人口的多样性与丰富性。
  • 数据锚定: 基于 2024 年萨尔瓦多第七次人口与第六次住房普查(7º Censo de Población y 6º Censo de Vivienda 2024)的自报人口统计数据,以及来自国家自然人登记处(RNPN)的萨尔瓦多名字频率分布。
  • 独特性: 该数据集是首个与萨尔瓦多官方统计数据(如姓名、性别、年龄、婚姻状况、教育、职业和位置等)对齐的萨尔瓦多数据集,是 NVIDIA Nemotron Personas 系列的一员。

数据集内容与结构

  • 记录与人物: 包含 148,000 条记录,每条记录含 7 个人物档案,总计约 100 万个人物档案。
  • Token 数量: 约 3 亿 token,其中人物 token 约 1.61 亿。
  • 字段数量: 共 25 个字段,包括 7 个人物字段和 18 个上下文属性字段。
    • 人物字段: professional_persona, sports_persona, arts_persona, travel_persona, culinary_persona, family_persona, persona(通用人物档案)。
    • 上下文字段: 包括 uuid, cultural_background, skills_and_expertise, skills_and_expertise_list, hobbies_and_interests, hobbies_and_interests_list, career_goals_and_ambitions, sex, age, languages_spoken, marital_status, household_type, education_level, occupation, area, municipality, department, country。
  • 地理覆盖: 完整覆盖萨尔瓦多所有 14 个省(departamentos)和 44 个市(municipios)(基于 2024 年行政重组)。
  • 名字: 包含约 14.4 万个独特名字,生成依据约 5,377 个独特名字和约 2,036 个独特姓氏。
  • 职业结构: 基于普查数据,包含 119 种不同职业类型,分布于 8 个就业类别。
  • 人物类型多样性: 包含一般、专业、运动、艺术、旅行、烹饪、家庭等多种类型。

数据来源与种子数据

  • 人口与住房普查数据: 源自 Banco Central de Reserva de El Salvador (BCR) / Oficina Nacional de Estadística y Censos (ONEC) 的 VII Censo de Población y VI Censo de Vivienda 2024(约 6,029,976 人)。该普查为该国首个 100% 数字化普查,提供性别、年龄、省、市、教育、婚姻状况、职业等锚定数据。
  • 名字频率分布: 来自 Registro Nacional de las Personas Naturales (RNPN) 的公开数据门户 "Así Somos",基于 DUI 民事登记,用于生成约 5,377 个独特名字和约 2,036 个独特姓氏。

数据生成方法

  • 工具: 使用 NVIDIA NeMo Data Designer(企业级复合 AI 系统)生成。
  • 技术: 利用专有概率图模型(Probabilistic Graphical Model, PGM)与 openai/gpt-oss-120b 模型(Apache 2.0 许可),以及 Data Designer 内置的验证器和评估器。

用途与目标

  • 主要用途: 支持主权 AI(Sovereign AI)开发,特别是针对萨尔瓦多的 LLM 训练。用于提升合成生成数据的多样性,缓解数据或模型偏差,并防止模型崩溃(model collapse)。
  • 目标用户: 开发主权 AI 的开发者、训练 LLM 的研究人员,以及希望改善合成数据多样性的用户。
  • 数据范围: 仅涵盖成年人(18 岁及以上)。

排除内容

  • 该数据集专注于人物档案,排除了 NeMo Data Designer 中可用的其他字段(如名字/姓氏、人格特质等)。
  • 同时排除了企业客户通常关注的人物类型(如金融、医疗健康方向)。
  • 所有数据均为完全人工生成,任何与真实人物的相似性纯属巧合。
搜集汇总
数据集介绍
Nemotron-Personas-El-Salvador 数据集图片
构建方式
Nemotron-Personas-El-Salvador 是一个基于萨尔瓦多真实人口、地理和人格特质分布而构建的合成人物数据集。该数据集由 NVIDIA 与 WideLabs 合作开发,利用 NeMo Data Designer 这一企业级复合 AI 系统进行合成数据生成,通过专有的概率图模型(PGM)与开源语言模型 openai/gpt-oss-120b 相结合,并辅以不断扩展的验证器和评估器,从而确保生成的人物数据既多样又贴近现实。数据集的种子数据来源于萨尔瓦多 2024 年第七次人口与第六次住房普查的匿名微观数据,以及国家自然人登记处的姓名频率分布,最终形成了覆盖 14 个省份和 44 个城市的 148,000 条记录,每条记录包含 7 种不同类型的人物描述。
特点
该数据集的核心特点在于其高度代表性和多样性。它严格锚定于官方普查统计数据,在性别、年龄、教育水平、婚姻状况、职业和地理位置等多个维度上真实反映了萨尔瓦多的人口结构,从而有效缓解了合成数据中的偏差和模型坍塌风险。数据集包含 25 个字段,涵盖 7 种人物描述(通用、专业、体育、艺术、旅行、烹饪、家庭)和 18 个上下文属性,提供了 144,000 个独特姓名和 119 种职业类型。借助丰富的上下文属性,研究人员能够精确地定向和条件化生成特定人物,这是传统人物数据集难以实现的能力。
使用方法
该数据集主要面向开发主权人工智能系统的萨尔瓦多模型构建者,以及希望提升合成数据多样性、缓解数据偏差并防止模型坍塌的研究人员和开发者。用户可以将 148,000 条人物记录作为种子数据,用于生成多轮聊天对话等高保真训练样本。由于人物属性覆盖了真实的姓名、年龄、职业、文化背景和教育程度,这些数据能够为生成的文本注入独特的萨尔瓦多地方视角。数据集以 CC BY 4.0 协议开源,支持商业和非商业用途,用户可直接从 Hugging Face 下载训练拆分,并自由用于训练各类模型,以推动西班牙语尤其是萨尔瓦多西班牙语的语言模型发展。
背景与挑战
背景概述
Nemotron-Personas-El-Salvador数据集由NVIDIA与WideLabs于2026年联合创建,是首个锚定萨尔瓦多真实人口统计与地理分布的合成人物数据集。该数据集依托2024年第七次人口与第六次住房普查的官方数据,以及国家自然人登记处的姓名频率分布,旨在弥补现有训练数据中拉丁美洲区域代表性的缺失。数据集包含约148,000条记录,覆盖14个省、44个市,提供七类人物画像及18个上下文属性字段,共拥有144,000个独特姓名与119种职业类型。作为主权人工智能(Sovereign AI)基础设施建设的关键资源,该数据集推动了萨尔瓦多西班牙语模型的本地化发展,有效提升了合成数据的文化相关性与人口多样性。
当前挑战
该数据集面临的核心挑战在于平衡合成数据的真实性、多样性与统计保真度。一方面,需解决合成数据领域普遍存在的模型崩溃与系统性偏差问题,通过精确映射真实人口分布来防止训练退化;另一方面,构建过程中受限于普查数据的时间滞后性、字段粒度不足以及属性间独立性假设(如假定职业与教育程度在给定地区、年龄和性别下相互独立),导致部分社会复杂性被简化。此外,从14个省、44个市的行政单元中提取分层代表性样本,并整合多源异质数据(如公民登记与普查),在技术协调与统计一致性层面构成显著障碍。
常用场景
经典使用场景
Nemotron-Personas-El-Salvador数据集的核心经典用途在于为萨尔瓦多西班牙语的大语言模型(LLM)提供高度真实且多样化的合成人物画像(Personas)。该数据集基于2024年人口与住房普查的官方统计数据,涵盖了性别、年龄、婚姻状况、教育水平、职业、地域分布等25个维度,生成了约14.8万条记录、逾百万条人物画像。研究者可将其作为多轮对话生成、指令微调或偏好对齐任务中的上下文锚点,使模型输出更具地域文化特色与人口统计学合理性。这种通过真实分布锚定合成数据的方法,尤其适用于构建主权AI系统时填补本地化数据空白。
解决学术问题
该数据集有效解决了低资源语言地区LLM训练中面临的数据稀缺性与代表性偏差两大核心学术问题。传统合成人物数据集往往基于单一语言或通用分布,难以捕捉萨尔瓦多特有的14个省域、城镇/乡村结构、自由同居婚姻形态及劳动力市场特征。Nemotron-Personas-El-Salvador通过概率图模型(PGM)将官方普查数据与姓名登记系统的频率分布相结合,生成在多个统计轴向上与真实人口高度一致的人物样本,显著提升了训练数据的多样性与保真度。此举既缓解了模型因不均衡训练数据导致的偏见放大问题,也通过提供结构化上下文属性为可控文本生成研究奠定了坚实基础。
衍生相关工作
围绕Nemotron-Personas-El-Salvador已衍生出一系列值得关注的研究方向与工具链实践。该数据集是NVIDIA Nemotron Personas集合的首个萨尔瓦多成员,其构建流水线借助NeMo Data Designer中的概率图模型与GPT模型生成模块,形成了可复现的合成数据生产框架。后续工作可探索将该方法迁移至其他低资源语言地区,如整合方言变体或少数民族语言(如纳瓦特语)的统计分布。研究者亦可基于其丰富的上下文属性字段,发展条件式人物生成与跨领域人物融合技术,或将其作为微调数据的一部分,推动多语言、多文化背景下LLM的公平性与鲁棒性评估基准建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务