NikitaSirotkin/country-gender-totals-v1
收藏资源简介:
--- annotations_creators: [] language: - en - it - nl language_creators: [] license: [] multilinguality: - multilingual pretty_name: 'country_gender_totals' size_categories: - n<1K source_datasets: - 'extended|https://www.kaggle.com/datasets/lucalullo/global-employment-unemployment-rates-1991-2025' tags: - adaption - preference-training - geography task_categories: [] task_ids: [] ---  This dataset is a remastered version of this [dataset](https://www.kaggle.com/datasets/lucalullo/global-employment-unemployment-rates-1991-2025) prepared using [Adaption's](https://frontend-pharos-app-dev.vercel.app/app/auth) Adaptive Data platform. # country_gender_totals A dataset mapping countries to demographic categories, where each entry specifies whether the data is for 'Total', 'Male', or 'Female' populations. The dataset includes a mix of global countries with no duplicate entries. Format consists of country names as prompts and gender or total population labels as completions. ### Dataset size There are 86 data points in this dataset. This is a preference training dataset. ### Quality of Remastered Dataset The final quality is A, with a relative quality improvement of 820.0%. ### Domain - Geography (100%) ### Language - English (72%) - Italian (10%) - Dutch (6%) ### Tone - Informative (96%) - Descriptive (4%)
--- 注释创建者:无 语言:[英语、意大利语、荷兰语] 语言创建者:无 许可证:无 多语言属性:多语言 展示名称:`country_gender_totals` 样本规模类别:样本数少于1000(n<1K) 源数据集:扩展自 `https://www.kaggle.com/datasets/lucalullo/global-employment-unemployment-rates-1991-2025` 标签:[数据适配(adaption)、偏好训练(preference-training)、地理学(geography)] 任务类别:无 任务子类别:无 ---  本数据集为[源数据集](https://www.kaggle.com/datasets/lucalullo/global-employment-unemployment-rates-1991-2025)的重制优化版,依托[Adaption](https://frontend-pharos-app-dev.vercel.app/app/auth)的**自适应数据平台(Adaptive Data platform)**制作完成。 # country_gender_totals 本数据集构建国家与人口统计类别的映射关系,每条数据均明确标注其统计维度为「总人口(Total)」、「男性人口(Male)」或「女性人口(Female)」。数据集涵盖全球多国数据,无重复条目。数据格式遵循大语言模型输入输出范式:以国家名称作为提示词(prompt),以对应人口性别或总人口标签作为补全结果(completion)。 ### 数据集规模 本数据集共包含86条有效数据,属于偏好训练(preference-training)数据集。 ### 重制版数据集质量 最终质量评级为A级,相对质量提升幅度达820.0%。 ### 应用领域 - 地理学(Geography):覆盖占比100% ### 语言分布 - 英语:72% - 意大利语:10% - 荷兰语:6% ### 文本基调 - 信息性:96% - 描述性:4%



