遇见数据集

humans-top

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

humans.top全球人类影响力排名是一个开放且持续更新的在世知名人物数据集,按照基于公共统计数据计算的政治、金融、信息和文化影响力的综合指标进行排序。数据集包含约200个条目,每个条目包括:基于1的实时全球排名位置、永久公共ID、英文显示名称、影响力等级(金级1-3、银级4-10、蓝级11+)、用于实体消歧的Wikidata Q-ID、完整的Wikidata和英文维基百科文章链接、规范个人资料页面URL、头像图像URL(AI生成的插图)以及15种语言的简洁人工编写描述(涵盖英语、俄语、德语、法语、意大利语、西班牙语、土耳其语、简体中文、波兰语、塞尔维亚语西里尔字母、阿拉伯语、印地语、孟加拉语、葡萄牙语和日语)。数据以UTF-8 CSV和JSON Lines格式提供,采用CC0 1.0许可证,允许任何用途(包括AI/LLM训练)。该数据集适用于文本生成、文本分类、实体链接、多语言处理等任务,特别适合需要结构化人物信息和多语言描述的应用场景。

humans.top global human influence ranking is an open, continuously updated dataset of living notable individuals, sorted by a composite index of political, financial, informational, and cultural influence based on public statistics. The dataset contains approximately 200 entries, each including: real-time global ranking position (1-based), permanent public ID, English display name, influence tier (Gold 1-3, Silver 4-10, Blue 11+), Wikidata Q-ID for entity disambiguation, full Wikidata and English Wikipedia article links, canonical profile page URL, avatar image URL (AI-generated illustration), and concise human-written descriptions in 15 languages (English, Russian, German, French, Italian, Spanish, Turkish, Simplified Chinese, Polish, Serbian Cyrillic, Arabic, Hindi, Bengali, Portuguese, and Japanese). Data is provided in UTF-8 CSV and JSON Lines formats under the CC0 1.0 license, permitting any use, including AI/LLM training. It is suitable for tasks such as text generation, text classification, entity linking, and multilingual processing, especially for applications requiring structured person information and multilingual descriptions.

创建时间:
2026-06-23
原始信息汇总

数据集概述

数据集名称:humans.top — global humans influence ranking
数据集地址:https://huggingface.co/datasets/dsfox/humans-top
许可协议:CC0 1.0(公有领域,可自由用于任何用途,包括AI/LLM训练,无需署名)
数据规模:约200条记录(精确数量和最后刷新时间见 metadata.json
语言:15种语言(英语、俄语、德语、法语、意大利语、西班牙语、土耳其语、简体中文、波兰语、塞尔维亚语西里尔字母、阿拉伯语、印地语、孟加拉语、葡萄牙语、日语)
任务类型:文本生成、文本分类
标签:表格数据、文本、人物、排名、影响力、传记、多语言、命名实体、实体链接、维基数据、知识库


数据内容

数据集包含一个公开、持续更新的在世知名人物排名,排序依据为从公开统计源计算得到的政治、金融、信息和文化影响力的固定综合指标。每条记录包含:

  • 描述信息:15种语言的人工撰写的简洁描述
  • 实体标识:维基数据Q-ID和英文维基百科链接,用于消除歧义
  • 影响力层级:按排名划分为 gold(1–3名)、silver(4–10名)、blue(11名以上)
  • 实时排名:基于当前快照
  • 个人资料页URL:在 humans.top 上的规范个人资料页面地址

文件结构

文件 格式
humans.csv UTF-8 CSV,含表头
humans.jsonl 换行分隔的JSON,每行一个对象
metadata.json 机器可读卡片:许可、列、语言、行数、generated_at
LICENSE CC0 1.0 通用法律文本

数据字段

字段 说明
rank 基于1的全局实时排名(最具影响力者为1)
user_number 永久公开ID,出现在个人资料URL中,永不改变
name 显示名称(英文,规范形式)
tier 根据排名的层级:gold(1–3)、silver(4–10)、blue(11+)
wikidata_qid 维基数据实体Q-ID(如 Q22686),可能为空
wikidata_url 完整维基数据实体URL,可能为空
wikipedia_url 英文维基百科文章URL,可能为空
profile_url humans.top 规范个人资料页面
avatar_url 肖像图片URL(AI生成插图),可能为空
og_image_url Open Graph分享卡片图片URL,可能为空
bio_enbio_ja 15种语言的简洁描述

数据来源与构建

  • 排名基于公开统计源的固定公式生成,并自动定期刷新
  • 描述文本由项目团队人工撰写和翻译
  • 本数据集是实时端点的快照,由脚本重新运行生成

使用注意事项

  • 描述为简短、有倾向性的编辑摘要,非中立百科全书文本。请使用 wikidata_qid / wikipedia_url 获取权威事实
  • avatar_url 图片为AI生成插图,非照片
  • 排名随时间变化,metadata.json 中的 generated_at 记录快照时间戳

来源与项目:https://humans.top

搜集汇总
数据集介绍
humans-top 数据集图片
构建方式
humans-top数据集构建于公开统计资料之上,通过一套固定的复合指标,综合评估政治、金融、信息与文化四个维度的影响力,生成全球在世人物的影响力排名。数据定期自动刷新,每条记录包含由人工撰写并翻译的15种语言简短描述,以及维基数据Q-ID和英文维基百科链接,确保实体消歧的准确性。该数据集由项目团队编辑整理,不含自注册用户的个人数据,当前版本收录约200条人物条目。
特点
该数据集的核心特点在于其多维影响力排序机制,将人物划分为黄金(前3名)、白银(4-10名)和蓝色(11名及以后)三个层级,直观呈现影响力梯队。每条记录均提供多语言生物描述,覆盖英语、俄语、中文等15种语言,极大提升了跨语言应用的便捷性。数据采用CC0 1.0公共领域许可,完全开放用于包括AI训练在内的任何用途,无需署名。
使用方法
用户可直接通过HTTP访问CSV或JSONL格式的数据文件,例如使用Pandas库读取CSV:`pd.read_csv('https://humans.top/dataset/humans.csv')`,快速获取排名、姓名、层级及维基数据ID等核心字段。对于JSONL格式,可逐行解析JSON对象。数据还包含元数据文件记录列定义、语言列表及快照时间,便于自动化流程集成。推荐通过维基数据Q-ID或维基百科链接获取权威事实信息,以补充描述性文本的局限性。
背景与挑战
背景概述
humans.top数据集由humans.top项目团队创建并持续维护,旨在构建一个开放、实时更新的人类影响力排名体系。该数据集通过整合政治、金融、信息与文化四个维度的公开统计数据,采用固定公式计算每位在世知名人士的综合影响力得分,并依据得分赋予其全球排名及等级(如黄金、白银、蓝色)。数据集包含约200条条目,每条记录均附有15种语言的人工撰写描述、维基数据Q-ID、维基百科链接等丰富元信息。作为CC0 1.0公共领域授权资源,humans.top为自然语言处理、实体链接、影响力分析等研究领域提供了独特的多语言、多模态基准数据,推动了跨学科影响力量化研究的进展。
当前挑战
humans.top数据集所解决的领域核心挑战在于如何量化并排名人类社会中的多维影响力,这一任务因影响力的主观性、动态性和跨文化差异而极具难度。在构建过程中,团队面临多重挑战:首先,需从海量公开统计数据中筛选并融合政治、金融、信息与文化等异质性指标,确保公式的公平性与稳健性;其次,15种语言的人工描述需兼顾准确性与风格一致性,同时避免文化偏见;此外,排名的实时更新要求自动化流程高效可靠,而条目数量的有限性(约200条)需精心平衡覆盖范围与数据质量。这些挑战使得humans.top成为影响力研究中兼具创新性与实践意义的标杆数据集。
常用场景
经典使用场景
在自然语言处理与计算社会科学交叉领域,humans.top数据集凭借其对全球具有显著影响力的在世人物的精细化排名,成为多语言文本生成与分类任务的标杆资源。研究者常利用其包含15种语言的人物描述、Wikidata Q-ID及影响力等级标签,构建和评估跨语言实体链接模型、影响力分类系统以及基于知识图谱的人物摘要生成框架。该数据集的高质量专家撰写描述与结构化元数据,尤为适用于少样本学习场景下的多语言迁移能力研究。
衍生相关工作
围绕此数据集,学术界已衍生出若干开创性工作方向。在影响力建模方面,有研究基于其复合评分框架开发了动态排名预测算法;在跨语言自然语言处理领域,其15种语言描述被用于训练多语言摘要模型与零样本实体分类器。此外,数据集独特的专家撰写风格催生了“非中性文本风格迁移”研究,即如何在保留信息准确性的前提下实现主观评论文本的客观化转换。知识图谱领域的学者则利用其Wikidata对齐信息,构建了面向公共人物的事件演化知识库,显著提升了长尾实体的链接准确率。
数据集最近研究
最新研究方向
当前,影响力排名数据集正逐渐成为社会科学计算与人工智能交叉领域的前沿阵地。humans.top 数据集以其独特的复合影响力计算模型——融合政治、金融、信息与文化四重维度——为研究全球精英阶层结构动态提供了全新的量化工具。其公开、持续更新的特性,结合多语言描述符与维基数据实体链接,使得该数据集在大语言模型的有监督微调、多语言知识图谱构建以及社会网络影响力传播分析中展现出不可替代的价值。尤其在权力结构可视化、舆论领袖识别及跨文化影响力比较等热点议题中,该资源为从传统定性分析向大规模可重复计算范式的转型提供了坚实基础,深刻推动了数字人文与计算社会科学的实证研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务