遇见数据集

kalam-speech-corpus

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

Dr. A.P.J. Abdul Kalam 终身演讲与讲座语料库是一个全面、机器可读的数据集,收录了Dr. A.P.J. Abdul Kalam 在其职业生涯中作为火箭科学家、印度第11任总统(2002-2007)以及全球政治家(2007-2015)期间发表的演讲、致辞、毕业典礼讲话和科学讲座。该数据集包含912个独特的演讲事件,追踪了1028个原始来源记录,总词数达1,822,794个,覆盖时间跨度为1963年至2015年。数据以Parquet和JSONL格式提供,主要文件包括speeches.parquet(规范演讲事件)、sources.parquet(原始来源记录)和duplicates.parquet(候选重复映射)。每个演讲事件包含speech_id、title、date、year、location、venue、period、event_type、speaker、tldr、transcript、transcript_status、transcript_confidence、source_url等字段,适用于文本分类、摘要生成和问答等自然语言处理任务。数据集采用CC-BY-4.0许可证,仅包含英语内容。

The Dr. A.P.J. Abdul Kalam Life-long Speeches and Lectures Corpus is a comprehensive, machine-readable dataset containing speeches, addresses, convocation talks, and scientific lectures delivered by Dr. A.P.J. Abdul Kalam throughout his career as a rocket scientist, the 11th President of India (2002-2007), and a global statesman (2007-2015). It includes 912 unique speech events, tracing 1,028 original source records, with a total of 1,822,794 words, covering the period from 1963 to 2015. Data is available in Parquet and JSONL formats, with main files including speeches.parquet, sources.parquet, and duplicates.parquet. Each speech event contains fields such as speech_id, title, date, year, location, venue, period, event_type, speaker, tldr, transcript, transcript_status, transcript_confidence, source_url, etc., suitable for text classification, summarization, and question answering tasks. The dataset is licensed under CC-BY-4.0 and contains only English content.

创建时间:
2026-08-16
原始信息汇总

Dr. A.P.J. Abdul Kalam Lifetime Speech Corpus 数据集详情

数据集概述

这是一个关于印度前总统阿卜杜尔·卡拉姆博士(Dr. A.P.J. Abdul Kalam)毕生演讲与讲座的综合性机器可读语料库,涵盖其作为火箭科学家、印度第11任总统(2002-2007年)以及全球政治人物(2007-2015年)时期的各种演讲、致辞、毕业典礼讲话和科学讲座。

核心统计

  • 规范演讲事件总数: 912个
  • 原始来源记录总数: 1,028条
  • 总词数: 1,822,794词
  • 覆盖时间范围: 1963年至2015年
  • 核验总统核心演讲: 1,024条站点记录(785个唯一规范演讲)

数据配置与格式

数据集包含四个配置,均以Parquet格式提供训练集数据:

配置名称 文件路径 内容说明
default data/speeches.parquet 规范演讲事件(主数据)
speeches data/speeches.parquet 规范演讲事件
sources data/sources.parquet 原始来源记录(溯源层)
duplicates data/duplicates.parquet 候选重复记录映射

同时提供对应的JSONL格式文件(speeches.jsonlsources.jsonlduplicates.jsonl)。

数据字段结构

speeches.parquet 中每条记录代表一个规范演讲事件,主要字段包括:

字段名 类型 说明
speech_id string 唯一规范演讲标识(如 KALAM-2007-0006
canonical_event_id string 关联重复/多来源记录的规范事件ID
title string 标准化的演讲标题
date string 日期字符串(DD.MM.YYYY 或 DD-MM-YYYY)
year int 演讲年份
location string 提取的演讲地点(如 New Delhi、Hyderabad、Strasbourg)
venue string 场地/主办机构
period string 时期(pre-presidencypresidencypost-presidency
event_type string 类别(presidential_addressconvocationdistinguished_lecture
speaker string 演讲者(固定为 Dr. A.P.J. Abdul Kalam)
tldr string 提取式关键摘要(3-4句话,保留原始措辞)
transcript string 完整的清理后演讲稿(Markdown格式)
transcript_status string 状态(official_transcriptinstitutional_transcriptvideo_only
transcript_confidence string 置信度(highmediumlow
source_url string 官方来源URL
source_type string 来源类型(official_presidentialinstitutional_archivevideo_recording
source_domain string 来源网站域名
rights_status string 权利评估(public_domain_goveducational_fair_usecopyright_restricted
sha256 string 演讲文本的SHA-256哈希值

质量控制方法

  1. 无静默改写: 严格保留原始演讲稿措辞、标题、列表和引用。
  2. 双层溯源: 保留原始来源记录(sources.jsonl)并关联到规范事件(speeches.jsonl)。
  3. 自动化质量检查: 检查缺失标题、空演讲稿、网站样板内容和编码损坏等问题。

使用方式

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset

加载规范演讲(默认配置)

ds = load_dataset("sanjeevafk/kalam-speech-corpus") print(ds["train"][0])

加载原始来源记录(溯源层)

sources_ds = load_dataset("sanjeevafk/kalam-speech-corpus", "sources") print(sources_ds["train"][0])

数据集标注信息

  • 标注创建者: 机器生成
  • 语言: 英语(单语)
  • 语言来源: 已发现/收集
  • 许可证: CC-BY-4.0
  • 数据集规模: 少于10,000条
  • 来源数据集: 原始数据
  • 任务类别: 文本分类、摘要生成、问答
  • 标签: 演讲、印度、阿卜杜尔·卡拉姆、历史、治理、科学与技术
搜集汇总
数据集介绍
kalam-speech-corpus 数据集图片
构建方式
本数据集系统性地汇聚了印度前总统阿卜杜勒·卡拉姆博士自1963年至2015年间发表的912场重要演讲与学术讲座,覆盖其科学家、总统及全球政治家的多重职业生涯。构建过程中,项目团队首先从总统府官方档案、学术机构资源库及公开视频记录等多源渠道,采集了1028条原始记录,形成完整的溯源层。继而,通过基于文本相似度与元数据匹配的自动化去重算法,将重复或关联的原始记录归类至同一规范事件,并辅以人工质控,确保每一条目均保留原始措辞,未经任何改写。最终,采用Parquet与JSONL双格式存储,分别输出演讲主表、来源记录表及重复映射表,结构严谨,便于数据追溯与质量审计。
使用方法
用户可通过Hugging Face的datasets库便捷加载本数据,默认配置将直接返回规范演讲条目,亦可指定sources或duplicates配置获取溯源记录或重复映射。数据字段设计面向文本分类、摘要生成及问答等多项自然语言处理任务,尤其适合训练基于印度政治与科技语境的专用模型。利用transcript、tldr及event_type字段,研究者可构建演讲主题自动分类器,或基于时间序列分析其思想演变。此外,数据附带的覆盖年度统计与质量控制报告,为研究者在选择特定时期子集或评估语料偏差时提供了量化依据。对历史学、政治学及计算语言学交叉领域而言,本数据集实为不可多得的实证材料。
背景与挑战
背景概述
该数据集名为kalam-speech-corpus,由Kalam Speech Archival Project于2026年创建,系统收录了印度前总统、著名科学家阿卜杜勒·卡拉姆博士自1963年至2015年间发表的912场演讲、讲座与致辞,涵盖其作为火箭科学家、总统及全球政治家的职业生涯,总计逾182万词。数据集以Parquet和JSONL格式组织,包含规范化演讲条目、原始来源记录及重复项映射,并附带详细元数据,如演讲类型、地点、时期和权利状态。其构建旨在为历史学、政治学及自然语言处理领域提供全面的文本资源,以支持对印度科技政策、公共话语和领导力修辞的量化研究,同时为演讲摘要、主题分类和问答系统提供高质量的训练语料。
当前挑战
在领域层面,该数据集旨在应对印度历史演讲资料分散、非结构化且难以获取的挑战,填补了公众人物长篇语料库的空白,为研究卡拉姆的思想演变及印度近现代科技治国理政提供了系统化数据基础。构建过程中面临多重困难:原始材料跨越数十年,来源混杂,包括总统档案、机构记录及视频转录,需人工核对与去重以保障准确性;版权状态各异,部分内容受版权保护,需审慎评估公共领域与合理使用边界;此外,文本清洗需保持原汁原味,避免改写,同时需自动化检测并修正缺失标题、空转录和编码错误,确保数据质量与可复现性。
常用场景
经典使用场景
在自然语言处理与计算社会科学领域,该语料库作为针对单一政治与科学人物全生命周期公开演说的系统性文本集合,其经典应用场景聚焦于政治话语分析、历史叙事挖掘及领导力语言特征研究。研究者可基于其细粒度的元数据(如时期划分、事件类型、地点)进行跨时段主题演化追踪,并结合文本分类与摘要生成技术,构建关于印度国家发展观、科技政策及教育理念的量化知识图谱。
解决学术问题
此数据集精准回应了南亚区域研究领域长期存在的‘重要人物公开论述缺乏结构化、机器可读遗产’这一学术痛点。通过整合1963至2015年间跨越火箭科学家、总统及全球政治家身份的912场演讲,并额外提供原始溯源层与重复项映射,它为验证自动摘要算法的忠实性、训练基于真实历史语境问答模型及检测跨时期话语一致性提供了基准,从而助力弥合历史档案与计算分析间的鸿沟。
实际应用
在实际应用层面,该语料库为‘Kalam式’领导力与科学传播提供数字化教材,可赋能教育科技平台开发个性化历史人物问答助手。其对演讲文本的规范化清洗及权利状态标注,亦支撑智库与政策研究机构构建思想库检索系统,便于快速提取特定议题(如航天、青年发展)的主张脉络。此外,作为公开可复用的高质量英文单语资源,它服务于新闻业的事实核查与文献学界的引证追溯。
数据集最近研究
最新研究方向
该数据集聚焦于印度前总统阿卜杜尔·卡拉姆毕生演讲与学术讲座的数字化归档,其研究前沿涉及政治人物公共话语的历时性分析、科技政策与领导力叙事的文本挖掘,以及多源异构语音数据的去重与溯源方法。通过整合官方、机构及影像资料,该数据集为计算社会语言学、历史信息学及公共演讲的自动化摘要与问答系统提供了稀缺的高质量语料,尤其对南亚治理话语演变和科学传播史的研究具有重要推动意义。其严格的原始文本保真与双层溯源设计,为跨时段、跨语境的演讲风格量化及知识图谱构建奠定了可靠数据基础,亦为数字人文领域树立了兼顾版权伦理与学术开放的新型语料库范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务