遇见数据集

Nemotron-Personas-Vietnam

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

Nemotron-Personas-Vietnam 是一个开源的大规模越南语合成人物角色数据集,遵循 CC BY 4.0 许可。该数据集基于越南真实世界的人口统计、地理和人格特质分布生成,旨在全面反映越南人口的多样性和特征。它是首个此类大规模越南语数据集,旨在支持越南开发人员构建融入重要地区特定人口统计和文化背景的“主权AI”系统。通过扩展用于主权AI模型开发的合成数据多样性,该数据集有助于减轻数据和模型偏见,并改善越南语模型响应的多样性。数据集包含 100,000 条记录,每条记录包含 6 个不同类型的人物角色描述,总计 600,000 个人物角色。数据规模约为 118M 个 token,其中 52M 为人物角色相关 token。数据集由 21 个字段构成,包括:1 个全局唯一标识符 (uuid);6 个具体领域的人物角色描述字段(职业、体育、艺术、旅行、烹饪人物角色以及一个简洁的通用人物角色);以及 14 个人物角色属性与背景字段,涵盖性别、年龄(18-90岁)、婚姻状况、教育水平、职业类别(20种)、居住区域(城乡)、所属省份/直辖市(覆盖河内、胡志明市、海防、岘港、芹苴、同奈这6个地区)和国家等。所有叙述性文本字段均为标准越南语。数据生成基于越南统计总局(GSO)的官方统计数据(2024年人口和住房普查、家庭生活水平调查)以及 FPT 相关机构的本地专业知识,并利用 NVIDIA 的 NeMo Data Designer 复合AI系统及其专有概率图模型和 SaoLa4-Small 语言模型完成。数据集仅包含成年角色,所有数据均为人工合成,任何与真实人物的相似性均属巧合。该数据集适用于需要多样化、接地气的越南语人物角色数据的任务,如对话系统开发、内容生成、偏见缓解研究以及旨在提高文化相关性的AI模型训练。

Nemotron-Personas-Vietnam is an open-source large-scale Vietnamese synthetic persona dataset licensed under the CC BY 4.0 license. This dataset is generated based on the real-world demographic, geographic, and personality trait distributions of Vietnam, with the goal of comprehensively reflecting the diversity and characteristics of the Vietnamese population. As the first large-scale Vietnamese dataset of its kind, it aims to support Vietnamese developers in constructing "sovereign AI" systems that incorporate critical region-specific demographic and cultural backgrounds. By expanding the diversity of synthetic data for sovereign AI model development, this dataset helps mitigate data and model biases, and enhances the diversity of responses from Vietnamese language models. The dataset comprises 100,000 records, each containing 6 distinct types of persona descriptions, totaling 600,000 personas. The overall data scale is approximately 118M tokens, of which 52M are persona-related tokens. The dataset consists of 21 fields: 1 globally unique identifier (UUID); 6 domain-specific persona description fields (occupational, sports, art, travel, cooking personas, and a concise general persona); and 14 persona attribute and background fields covering gender, age (18–90 years), marital status, education level, occupational categories (20 types), residential area (urban/rural), affiliated province/municipality (covering six regions: Hanoi, Ho Chi Minh City, Haiphong, Da Nang, Can Tho, Dong Nai), and country. All narrative text fields are in standard Vietnamese. The dataset was generated using official statistical data from the General Statistics Office of Vietnam (GSO) (2024 Population and Housing Census, Household Living Standards Survey) and local professional expertise from relevant FPT institutions, leveraging NVIDIA's NeMo Data Designer composite AI system, its proprietary probabilistic graphical models, and the SaoLa4-Small language model. The dataset only includes adult personas, and all data is synthetic; any similarity to real individuals is purely coincidental. This dataset is applicable to tasks requiring diverse, culturally grounded Vietnamese persona data, such as dialogue system development, content generation, bias mitigation research, and AI model training aimed at improving cultural relevance.

提供机构:
NVIDIA
创建时间:
2026-06-05
原始信息汇总

Nemotron-Personas-Vietnam 是一个基于越南真实人口分布合成的开源人物画像数据集,旨在支持越南主权人工智能(Sovereign AI)的开发。

基本信息

  • 发布方:NVIDIA Corporation 与 FPT Smart Cloud、FPT 集团量子 AI 与网络安全研究所合作开发。
  • 许可协议:CC BY 4.0(可免费用于商业和非商业用途)。
  • 发布日期:2026年6月4日。
  • 语言:越南语。

数据规模与构成

  • 记录数:100,000 条。
  • 人物画像数:600,000 个(每条记录包含 6 个画像)。
  • 令牌数:总计 1.18 亿令牌,其中人物画像令牌 5200 万。
  • 字段数:21 个字段,包括 6 个人物画像字段和 15 个上下文(属性与人口统计)字段。具体字段如下:
字段 类型 描述
uuid string 全局唯一标识符
professional_persona string 职业画像(描述主要工作领域、关键专业技能、特质与行为)
sports_persona string 体育画像(描述运动兴趣、运动队偏好、健身方式)
arts_persona string 艺术画像(描述创意表达参与度及艺术对身份认同的影响)
travel_persona string 旅行画像(描述旅行兴趣与风格)
culinary_persona string 烹饪画像(描述饮食偏好、烹饪技能水平、就餐体验偏好)
persona string 简洁通用画像(捕捉个人视角与生活方式)
cultural_background string 文化背景描述
skills_and_expertise string 专业技能与个人技能(叙事格式)
skills_and_expertise_list string 技能与专长列表(字符串化列表)
hobbies_and_interests string 个人兴趣与休闲活动(叙事格式)
hobbies_and_interests_list string 爱好与个人兴趣列表(字符串化列表)
career_goals_and_ambitions string 职业抱负与长期职业目标
sex string 性别(Nam/Nữ)
age integer 年龄(18–90 岁)
marital_status string 婚姻状况(Độc thân/Đã kết hôn/Góa/Ly thân)
education_level string 最高教育程度(7 类:从无教育到研究生)
occupation string 职业类别(20 种,如 Buôn bán / kinh doanh、Kỹ thuật viên / kỹ sư 等)
zone string 居住区域(Đô Thị/Nông Thôn)
region string 省份/直辖市(覆盖 6 个:河内、胡志明市、海防市、岘港市、芹苴市、同奈省)
country string 国家(恒定值:"Việt Nam")
  • 唯一姓名组合:约 13,000 种(基于越南真实命名数据,姓氏分布如 Nguyễn 约 40%,Trần 约 11% 等)。
  • 职业结构:基于人口普查数据,共 20 个职业类别。
  • 人物画像类型:包括职业、体育、艺术、旅行、烹饪、通用简洁六类。
  • 数据切分:仅包含 train 切分。

数据来源

  • 官方统计:越南统计局(GSO)2024 年人口与住房普查数据、2024 年越南家庭生活水平调查(VHLSS)。
  • 行政区划依据:根据 2025 年生效的越南行政合并方案确定边界。
  • 本地专长:FPT Smart Cloud 与 FPT 量子 AI 及网络安全研究所提供本地人口与文化专家支持。

生成方法

使用 NeMo Data Designer(NVIDIA 企业级复合 AI 系统)生成,结合:

  • 专有概率图模型(PGM)。
  • Apache-2.0 许可的 SaoLa4-Small 模型。
  • 内置验证与评估方法。

限制与假设

  • 数据集由随机合成生成,任何与真实人物的相似纯属巧合。
  • 由于公共数据可获取性限制,部分变量之间使用了独立性假设(如职业分配中性别、教育水平、年龄被假设为独立影响结果)。
  • 仅包含 18 岁及以上的成年人物画像。
  • 使用标准越南语生成,排除企业特定场景(如金融、医疗)及姓名、个性特征等字段。

预期用途

  • 拓展越南主权 AI 模型开发的合成数据多样性。
  • 减少训练数据中的数据稀缺和潜在偏见(特别是现有画像数据集中的偏见)。
  • 改善模型在越南语回复中的多样性。
  • 免费提供,鼓励开发者、研究人员和数据专业人员使用。
搜集汇总
数据集介绍
Nemotron-Personas-Vietnam 数据集图片
构建方式
Nemotron-Personas-Vietnam 是首个大规模越南语人物画像数据集,其构建基于越南官方统计机构(GSO)的2024年人口与住房普查及家庭生活水平调查数据,并整合了FPT Smart Cloud与FPT集团量子AI与网络安全研究所的区域人口学专长。数据集采用NVIDIA的NeMo Data Designer复合AI系统,利用专有概率图模型(PGM)与Apache-2.0许可的SaoLa4-Small模型,通过合成数据生成技术,精准映射越南6个直辖市在性别、年龄、教育、职业等维度上的真实人口分布特征。
特点
该数据集包含10万条记录,每条记录涵盖6种人物画像类型(职业、体育、艺术、旅行、烹饪及综合概括),共计60万画像,并附有文化背景、技能专长、兴趣爱好等15个上下文属性字段。其核心特点在于高度忠实于越南人口统计现实,覆盖13,000种独特姓名组合与20个职业类别,特别关注老年群体与城乡差异,有效降低了现有画像数据集中的模型偏见。
使用方法
数据集以标准越南语撰写,仅包含成人(18岁以上)画像,采用CC BY 4.0许可免费供商业与非商业使用。研究者可直接加载训练集数据,利用21个结构化字段(如uuid、occupation、region)进行微调或评估。扩展版本可通过NeMo Data Designer平台直接调用,适用于主权AI开发中的数据多样性增强、偏差缓解及多轮对话生成任务。
背景与挑战
背景概述
Nemotron-Personas-Vietnam是由NVIDIA与FPT Smart Cloud及FPT集团量子AI与网络安全研究所于2026年联合创建的首个大规模越南语合成人物数据集。该数据集基于越南统计总局2024年人口住房普查和家庭生活水平调查等官方统计数据,融合概率图模型与大语言模型,生成涵盖性别、年龄、教育、职业、地域等多维度的60万条人物画像。其核心研究问题在于构建反映真实人口分布与文化语境的合成数据资源,以支持越南本土主权人工智能(Sovereign AI)系统的发展,弥补现有数据集在低资源语言和区域文化表征上的显著不足,对推动多语言AI公平性与多样性具有里程碑意义。
当前挑战
该数据集所解决的领域核心挑战在于:主流AI模型训练数据严重偏向英语及西方文化语境,导致对越南等低资源语言的覆盖不足,且现有合成人物数据集常忽略高龄群体、特定职业与地域文化多样性,引发模型偏差与响应同质化问题。在构建过程中,开发者面临多重技术挑战:需在公共数据有限条件下,通过假设变量间独立性来简化概率图模型;需整合分散的官方统计与行政区划数据,确保地理与人口分布的准确性;还需平衡人物描述的真实性与生成效率,在100万条记录中实现60万人物在6个省市、20类职业上的精细化分布,并剔除企业专属场景以避免隐私风险。
常用场景
经典使用场景
Nemotron-Personas-Vietnam 数据集的核心应用在于为越南语大语言模型提供高保真度、多样化的合成人物画像数据。通过嵌入基于越南官方人口普查和家庭生活标准调查构建的概率图模型,该数据集能够生成反映真实人口分布的年龄、性别、职业、教育水平及地理区域等多维属性。研究人员可借助这些人物画像进行指令微调、上下文学习或角色扮演任务的训练,从而显著增强模型对越南社会文化语境的感知能力。其设计的六类人物画像——涵盖职业、体育、艺术、旅行、烹饪及综合摘要——为模型对话系统提供了丰富的角色视角,确保生成内容在风格与信息量上贴合越南本土实际。
实际应用
在实际产业环境中,该数据集为越南本土企业部署定制化人工智能助手提供了关键支撑。例如,电商平台可基于职业与爱好画像构建个性化商品推荐引擎;旅游服务商利用旅行与美食画像生成贴合当地习惯的行程建议;金融机构则借助教育水平与职业分布特征设计适老化或普惠型金融产品。此外,新闻媒体与内容创作平台可调用文体数据集中的多样化角色视角,自动生成具有区域文化认同感的新闻报道或互动叙事。其开放的商业许可(CC BY 4.0)降低了中小企业与初创公司应用尖端合成数据技术的门槛,加速了人工智能解决方案在东南亚市场的落地。
衍生相关工作
Nemotron-Personas-Vietnam 的发布催生了若干具有影响力的后续研究。NVIDIA 团队将其集成至 NeMo Data Designer 企业级数据合成流水线,衍生出面向金融与医疗领域的垂直人物画像扩展版本。FPT 集团利用该数据集训练了 SaoLa4-Small 模型的越南语对话变体,验证了合成人物画像对提升多轮对话连贯性的增益效果。学界方面,河内国家大学基于此数据集设计了文化感知偏见检测基准,揭示了传统模型在越南农村与城市居民画像生成中的系统性差异。这些工作共同勾勒出从数据构件到模型优化再到评估体系的技术演进路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务