遇见数据集

hk-synthetic-personas

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

本数据集包含用于竞选调查模拟和语言模型消息预测试的香港居民合成人设。数据主要基于香港2021年人口普查分区概况的汇总分布表生成。数据集核心包含两个部分:一个包含1000个合成人设的广泛池,以及一个从该池中精选的、注重多样性的100人面板。每个人设包含丰富的信息:人口统计字段(如年龄、性别、地区、教育、职业、收入、语言、移民背景等)、模拟准备字段(如媒体习惯、价值观、信任度、可能反对意见、可能接触渠道等)以及可直接用于提示生成的叙事字段(短/长人设卡片)。数据生成流程包括解析官方普查数据、根据加权分布生成人口统计骨架、对竞选相关的小群体进行受控过采样、通过聚类推断12个人口统计细分群体、生成人设卡片、进行自动化验证(如检查重复、覆盖度、多样性)以及最终选择100人面板。该数据集旨在用于探索竞选反应、反对意见、消息风险、渠道差异、语言可及性问题和细分群体层面的反应差异,但明确禁止用于声称真实香港民意、估计投票份额、预测调查结果或替代真实受访者研究。数据集经过验证,确保主要推断群体在精选面板中得到覆盖,且内部具有多样性。使用前建议将合成输出与小型真实香港调查进行对比校准。

This dataset contains synthetic personas of Hong Kong residents for campaign survey simulation and language model message pre-testing. The data is primarily generated based on aggregated distribution tables from the 2021 Hong Kong Population Census by district profiles. The core of the dataset consists of two parts: a broad pool of 1000 synthetic personas and a curated, diversity-focused panel of 100 personas selected from this pool. Each persona includes rich information: demographic fields (such as age, gender, region, education, occupation, income, language, immigration background, etc.), simulation preparation fields (such as media habits, values, trust levels, potential objections, possible contact channels, etc.), and narrative fields (short/long persona cards) that can be directly used for prompt generation. The data generation process involves parsing official census data, generating demographic skeletons based on weighted distributions, controlled oversampling of small groups relevant to campaigns, inferring 12 demographic segments through clustering, generating persona cards, conducting automated validation (e.g., checking for duplicates, coverage, diversity), and finally selecting the 100-person panel. The dataset is intended for exploring campaign responses, objections, message risks, channel differences, language accessibility issues, and response variations at the segment level, but it explicitly prohibits use for claiming real Hong Kong public opinion, estimating vote shares, predicting survey outcomes, or replacing real respondent research. The dataset has been validated to ensure that key inferred groups are covered in the curated panel and that there is internal diversity. It is recommended to compare and calibrate synthetic outputs with small-scale real Hong Kong surveys before use.

创建时间:
2026-06-25
搜集汇总
数据集介绍
hk-synthetic-personas 数据集图片
构建方式
本数据集基于香港2021年人口普查区域概况数据构建,通过解析官方区域概况表格,依据普查加权分布生成了1000个初始人口统计骨架,并针对非华语、老年单人户、低收入公屋居民等竞选相关的小众群体进行了受控过采样。随后,利用聚类方法从骨架特征中推断出12个细粒度人口统计群体,并逐一生成长短两种人格卡片。整个流程经过严格验证,包括字段完整性检查、重复卡片识别、姓名/地址模式过滤以及群体覆盖度评估,最终从中选取了100个多样性最大化的个体构成精炼小组。
使用方法
数据集主要用于语言模型驱动的竞选调查模拟与消息预测试。用户可直接加载JSONL或CSV格式的人格卡片,配合提供的提示词模板,通过Python脚本运行干燥测试,模拟不同人格对竞选信息、政策提案或问卷问题的反应。推荐在依赖合成结果做决策前,先与由年龄、区域、住房、语言等分层的小规模真实香港调查结果进行对比校准,以识别潜在的抵触点与信息风险,而非将合成响应百分比视为真实民意估计。
背景与挑战
背景概述
香港作为中西文化交汇的国际化都市,其社会舆论环境呈现出高度的复杂性与动态性,尤其在竞选活动与公共政策沟通中,精准理解多元群体诉求成为关键挑战。2026年,研究者Sergey Volkov及其团队基于香港2021年人口普查地区概况数据,构建了名为“香港合成画像”的数据集,旨在为竞选调查模拟与信息预测试提供可复现的合成受访者画像库。该数据集通过抽取人口普查中的区域、年龄、性别、教育、职业、收入、住房及语言等边际分布,生成1000个具有人口统计学骨架的合成画像,并从中精选100个多样性最大化的子集用于精细化模拟。其核心贡献在于将官方普查的聚合统计转化为可交互的个体级模拟样本,为计算社会科学领域的舆论推演与信息效果评估提供了标准化的试验平台,对理解香港地区的社会分层与沟通策略设计具有重要方法论价值。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,香港社会舆论研究长期受制于真实民调成本高、样本获取困难以及隐私保护限制,难以对细分群体的政策反应进行大规模、低风险的模拟测试;该数据集以合成数据替代真实受访者,虽规避了隐私与伦理风险,但代价是数据缺乏统计有效性,无法直接等同于真实民意或预测选举结果。在构建过程中,数据集面临的核心挑战包括:人口普查数据仅为聚合边际表格而非个体级微观数据,跨变量组合完全依赖近似合成,可能导致某些人口组态的扭曲;为增强竞选相关风险测试的覆盖度,生成器对非华语居民、老年独居户等少数群体进行了定向过采样,虽提升了极端情景的检出能力,却偏离了原始分布;此外,画像中态度与竞选反应风格均为推断性赋予,并非实测结果,可能引入系统偏差,需依赖与小型真实调查的对比校准才能获得可靠的决策参考。
常用场景
经典使用场景
在政治传播与竞选策略研究领域,hk-synthetic-personas数据集为模拟选情调查与信息预测试提供了创新工具。其经典使用场景在于利用1,000个合成人物画像,结合语言模型(LLM)进行竞选信息(如广告、口号)的受众反应预演。研究者可依据预设调研提示模板,输入特定竞选议题或文案,批量模拟不同人口统计属性(如年龄、收入、语言背景)的香港居民对信息的接纳程度、潜在异议及情感倾向。这一过程无需招募真实受访者,即可快速、低成本地探索信息传播中可能出现的风险点与群体差异,为实际竞选策略的优化提供参考依据。
解决学术问题
该数据集直击社会科学研究中传统调查方法的高成本、长周期与隐私限制等痛点。其核心学术价值在于,基于2021年香港人口普查官方汇总数据,通过确定性生成算法与可控过采样技术,重建了具有人口统计代表性的合成人物群体。这有效解决了在敏感政治议题下难以获取真实受访者数据的难题,为研究香港社会多元群体的政治态度、信息偏好及行为动机提供了可重复、可验证的仿真平台。其意义在于推动计算社会科学发展,使得在隐私合规框架内,研究者得以探悉语言障碍、收入分化、代际差异等结构性因素如何塑造公众对政治信息的解读与反馈,深化了对微观个体与宏观政治传播互动的理解。
实际应用
在现实应用中,该数据集为香港及类似多元文化城市的竞选活动、公共政策宣导及危机公关提供了决策支持工具。例如,竞选团队可利用这组合成人物,预先测试不同语种(粤语、英语、普通话)宣传材料对特定区域或职业群体的触达效果与接受度。非政府组织或政府机构亦可借此评估有关住房、移民或社会福利政策的公众沟通策略,识别可能引发强烈反对或误解的言辞,从而调整信息设计。此外,市场调研公司将能模拟消费者对品牌政治立场声明的反应,在避免争议的同时优化品牌传播策略。这种低风险、高迭代的预测试方法,节约了实地调研资源,提升了信息传播的精准性与适应性。
数据集最近研究
最新研究方向
该数据集聚焦于利用香港2021年人口普查的官方边际表格数据,通过确定性生成算法与分层过采样技术,构建了1000个合成香港居民画像,并从中筛选出100个多样性最大化样本,旨在为语言模型驱动的竞选调查模拟与消息预测试提供可靠基础。当前前沿研究方向主要集中于如何基于合成数据集优化大语言模型在投票意向预测、情绪倾向分析及细分人群反馈机制中的模拟精度与鲁棒性,同时探索结合真实小样本校准来校正合成数据中隐含的统计偏差,以避免对香港公众意见的误导性推断。这一研究方向直接关联到2025年后香港区域选举与社会福利政策讨论中对舆情敏感性模型需求的增长,特别是在多语言、多代际以及跨收入阶层的复杂社会结构中,通过合成画像实现低成本、无隐私泄露风险的竞选策略验证与技术评估。该数据集的发布填补了香港在合成调研数据领域的空白,为推动负责任地使用合成数据参与社会治理与民主传播研究提供了方法论示范与实践警示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务