遇见数据集

Nemotron-Personas-Belgium

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Nemotron-Personas-Belgium是一个开源的合成生成人物角色数据集,采用CC BY 4.0许可协议。该数据集旨在反映比利时人口的多样性和丰富性,其生成过程严格基于比利时真实的人口统计学、地理学和语言学分布。数据集是Nemotron-Personas系列的一部分,也是Nemotron-Personas-USA的变体,是首个此类开放的比利时数据集。核心特征是多语言性:每个人物角色都完整地提供了荷兰语、法语、德语和英语四个版本的描述,并对应四个独立的数据分片(nl_BE, fr_BE, de_BE, en_BE),每个分片包含30万条样本,总计约120万条样本,数据规模在100万到1000万条之间。每条数据记录包含22个特征字段,涵盖唯一标识符、多个特定领域的角色描述(如专业、体育、艺术、旅行、烹饪)、综合角色描述、文化背景、技能与专长、兴趣与爱好、职业目标与抱负,以及详细的人口统计学和地理信息(包括性别、年龄、婚姻状况、家庭类型、教育水平、职业、行业、所在市镇、地区和国籍)。数据集由Pleias、NVIDIA和KU Leuven合作开发,使用企业级复合AI系统NeMo Data Designer生成,结合了专有的概率图模型和Apache-2.0许可的google/gemma-4-31B-it模型。其设计目标是支持比利时和欧洲的模型开发者构建“主权AI”系统,通过融入地区特定的人口统计和文化背景,提高合成生成数据的多样性,减轻数据与模型偏见,并防止“模型崩溃”。数据集特别强调在年龄、地理、语言、教育和职业等多个维度上代表底层的人口分布。注意:数据集聚焦于角色描述,不包含姓名、收入、人格特质等中间建模字段,所有数据均为人工合成生成,适用于商业用途,如主权AI、大语言模型训练等场景。

Nemotron-Personas-Belgium is an open-source synthetic persona dataset released under the CC BY 4.0 license. It aims to reflect the diversity and richness of the Belgian population, with its generation process strictly based on real demographic, geographic, and linguistic distributions in Belgium. The dataset is part of the Nemotron-Personas series and a variant of Nemotron-Personas-USA, representing the first open dataset of its kind for Belgium. Its core feature is multilingualism: each persona is fully described in four languages—Dutch, French, German, and English—corresponding to four independent data shards (nl_BE, fr_BE, de_BE, en_BE), each containing 300,000 samples, totaling approximately 1.2 million samples, with a data scale between 1 million and 10 million. Each data record includes 22 feature fields, covering a wide range of information dimensions: unique identifier (uuid), multiple domain-specific persona descriptions (professional, sports, arts, travel, culinary), comprehensive persona description, cultural background, skills and expertise (in text and list formats), interests and hobbies (in text and list formats), career goals and aspirations, and detailed demographic and geographic information, including gender, age, marital status, household type, education level, occupation, industry, municipality, region, and nationality (Belgian). The dataset was collaboratively developed by Pleias, NVIDIA, and KU Leuven, using the enterprise-grade composite AI system NeMo Data Designer, which combines proprietary probabilistic graphical models with the Apache-2.0 licensed `google/gemma-4-31B-it` model. Its design goal is to support Belgian and European model developers in building sovereign AI systems by incorporating region-specific demographic and cultural contexts, enhancing the diversity of synthetic data, mitigating data and model biases, and preventing model collapse from training on unfiltered outputs from other models. The dataset emphasizes representing the underlying population distribution across multiple dimensions such as age, geography, language, education, and occupation more effectively than other persona datasets. Note: The dataset focuses on persona descriptions and thus excludes intermediate modeling fields like names, income, and personality traits, as well as personas typically associated with enterprise clients (e.g., finance, healthcare). All data is synthetically generated, and any resemblance to real persons is coincidental. The dataset is ready for commercial use, suitable for scenarios involving sovereign AI, large language model training, and development aimed at improving synthetic data diversity, mitigating bias, and preventing model collapse.

提供机构:
NVIDIA
创建时间:
2026-06-17
原始信息汇总

数据集概述

Nemotron-Personas-Belgium 是一个由 NVIDIA 联合 Pleias 和 KU Leuven 开发的开源、多语言合成人物(persona)数据集。它旨在反映比利时真实的人口、地理和语言分布,为构建区域特定的主权人工智能系统提供高质量数据。

核心特性

  • 内容:包含约 120 万条(1M < n < 10M)合成生成的人物画像。
  • 语言:数据集具有多语言特性,每个人物画像都提供了荷兰语(nl)、法语(fr)、德语(de)和英语(en)四个完整翻译版本。
  • 生成基础:数据基于比利时 2021 年人口普查的真实分布,涵盖了三个大区、四个语言区域以及全部 581 个市镇。
  • 生成工具:采用 NVIDIA 的 NeMo Data Designer 企业级复合 AI 系统,结合专有的概率图模型(PGM)与 Apache-2.0 许可的 google/gemma-4-31B-it 模型生成。
  • 许可证:采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可协议,可用于商业用途。

数据拆分

数据按语言拆分为四个独立的部分,每个部分包含 300,000 个样本:

  • nl_BE (荷兰语 - 比利时):样本数: 300,000
  • fr_BE (法语 - 比利时):样本数: 300,000
  • de_BE (德语 - 比利时):样本数: 300,000
  • en_BE (英语 - 比利时):样本数: 300,000

特征字段

每条记录包含丰富的属性来描述人物画像,共计 22 个特征:

  • 标识与年龄uuid (字符串), age (整数)
  • 性别与婚姻sex (字符串), marital_status (字符串)
  • 地理信息municipality (字符串), region (字符串), country (字符串)
  • 教育职业education_level (字符串), occupation (字符串), industry (字符串)
  • 家庭与背景household_type (字符串), cultural_background (字符串)
  • 详细画像professional_persona (字符串), sports_persona (字符串), arts_persona (字符串), travel_persona (字符串), culinary_persona (字符串), persona (字符串)
  • 技能与兴趣skills_and_expertise (字符串), skills_and_expertise_list (字符串), hobbies_and_interests (字符串), hobbies_and_interests_list (字符串)
  • 职业目标career_goals_and_ambitions (字符串)

应用场景

该数据集旨在帮助开发者:

  • 开发符合地区特定人口统计和文化背景的主权 AI 系统。
  • 训练大型语言模型(LLM)。
  • 提高合成生成数据的多样性,减轻数据和模型的偏见,并预防模型崩溃(model collapse)。

数据排除项

数据集明确不包含以下内容:

  • 个人姓名、收入、性格特征。
  • NeMo Data Designer 中可用的其他中间建模字段(如姓名文化渊源标签、姓名语言概率等)。
  • 通常与企业客户相关的画像领域(如金融、医疗健康)。
搜集汇总
数据集介绍
Nemotron-Personas-Belgium 数据集图片
构建方式
Nemotron-Personas-Belgium 数据集由 NVIDIA 联合 Pleias 与 KU Leuven,利用 NeMo Data Designer 复合 AI 系统构建而成。该系统融合了专有的概率图模型(PGM)与开源模型 google/gemma-4-31B-it,并辅以 Data Designer 中内置的持续扩展的验证器与评估器。数据生成过程严格锚定于比利时 2021 年人口普查的真实分布,涵盖性别、年龄、语言区、婚姻状况、家庭构成、教育水平、职业及地理信息等多元维度,确保每个合成角色均能精准映射现实世界的复杂人口结构。
特点
该数据集的核心特色在于其多语言性与高代表性。每一条人物角色(persona)均提供荷兰语、法语、德语及英语四种语言的完整翻译版本,覆盖比利时的四大语言区域。数据规模达 120 万条样本,囊括了比利时全部三个大区及 581 个市镇,并沿着年龄、地理、语言、教育和职业等多重轴线实现了精细的均匀分布。这种设计不仅显著提升了合成数据的多样性,还能有效缓解模型偏差与模型坍缩问题,为构建区域定制化的主权 AI 系统提供了坚实的数据基础。
使用方法
该数据集可直接用于文本生成任务,特别适合训练和微调大型语言模型(LLM)以增强其区域文化敏感性与多语言能力。用户可通过 Hugging Face Datasets 库按拆分(如 nl_BE, fr_BE, de_BE, en_BE)加载数据,每一条记录包含职业角色、运动角色、艺术角色、旅行角色、烹饪角色等结构化字段。开发者可基于这些丰富的角色属性生成高质量的多轮对话数据,或利用其人口统计特征进行数据增强、偏差分析与模型评估。数据集采用 CC BY 4.0 许可,适用于商业用途。
背景与挑战
背景概述
Nemotron-Personas-Belgium是由NVIDIA、Pleias与KU Leuven于2026年联合发布的开放数据集(CC BY 4.0),专注于为比利时多语言人口生成高质量合成人物画像。该数据集基于2021年人口普查的性别、年龄、语言区域、地理分布等真实统计数据进行构建,覆盖比利时三个大区、四个语言区及581个市镇,每个画像均以荷兰语、法语、德语和英语完整呈现。作为NVIDIA Nemotron-Personas系列的首个欧洲变体,它旨在支持主權AI(Sovereign AI)系统开发,使语言模型能够嵌入区域特定的文化语境与人口特征,从而缓解合成数据中的偏差并防止模型坍塌。该数据集由企业级复合AI系统NeMo Data Designer生产,借助概率图模型与Google Gemma-4-31B-it模型,提供超过120万条多样化画像,为多语言自然语言生成任务树立了新标杆。
当前挑战
该数据集所应对的领域核心挑战在于:合成人物画像数据集常因脱离真实人口分布而引入系统性偏差,导致语言模型在多语言、多文化场景下生成内容缺乏代表性,甚至加剧模型退化。构建过程中,研究者须克服多语言同步翻译的语义一致性难题,确保荷兰语、法语、德语及英语版本在文化背景、职业和兴趣描述上的准确对等。此外,基于2021年人口普查统计数据的概率图模型设计需精细平衡581个市镇间的年龄、教育层次、行业分布等多维特征,避免对少数群体的欠采样。为保证商业可用性,数据集还排除了姓名、收入等敏感字段,并要求在合成过程中严格通过内置验证器与评估器过滤形态异常或逻辑矛盾的画像,这对复合AI系统的流水线可靠性提出了严苛要求。
常用场景
经典使用场景
Nemotron-Personas-Belgium 数据集为多语言、多文化背景下的文本生成任务提供了高质量的合成用户画像数据。在自然语言处理领域,研究者可以借助该数据集模拟比利时四种官方语言(荷兰语、法语、德语和英语)环境下的对话生成、角色扮演或情境推理。每个画像都融合了真实的年龄、性别、职业、教育水平及居住地等人口统计信息,使得生成的文本更加贴近现实。经典的使用方式包括:基于画像构建多轮对话系统、训练面向特定地域文化的语言模型、以及在跨语言迁移学习中评估模型对文化细微差异的理解能力。
衍生相关工作
作为 Nemotron-Personas 系列的核心成员,该数据集衍生了一系列相关研究工作。其生成流程依托 NeMo Data Designer 这一企业级复合 AI 系统,并引入了概率图模型与大规模语言模型相结合的方法论,为后续合成数据领域的研究树立了标杆。与 Pleias 和 KU Leuven 的合作推动了多语言 persona 数据集的标准化构建流程,催生了关于如何将真实人口统计分布嵌入合成数据生成管线的学术探讨。同时,其姊妹数据集 Nemotron-Personas-USA 为跨地域数据生成方法的对比研究提供了对照基准。
数据集最近研究
最新研究方向
该数据集聚焦于通过复合AI系统生成多语言、多维度合成角色,以反映比利时真实人口分布,为构建主权AI系统提供数据基础。其前沿研究在于利用概率图模型与开源大语言模型结合,通过精细角色属性(如职业、文化背景、技能)提升合成数据的多样性与代表性,从而缓解模型偏见与崩溃风险。该数据集支持荷兰语、法语、德语和英语的多语言角色生成,尤其适用于训练区域特定LLM,推动欧洲多语言AI生态发展。其方法学创新在于将现实统计分布嵌入合成流程,为可控数据生成树立新范式,对实现文化敏感、数据主权合规的AI系统具有重大意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务