kalam-speech-corpus
收藏资源简介:
Dr. A.P.J. Abdul Kalam 终身演讲与讲座语料库是一个全面、机器可读的数据集,收录了Dr. A.P.J. Abdul Kalam 在其职业生涯中作为火箭科学家、印度第11任总统(2002-2007)以及全球政治家(2007-2015)期间发表的演讲、致辞、毕业典礼讲话和科学讲座。该数据集包含912个独特的演讲事件,追踪了1028个原始来源记录,总词数达1,822,794个,覆盖时间跨度为1963年至2015年。数据以Parquet和JSONL格式提供,主要文件包括speeches.parquet(规范演讲事件)、sources.parquet(原始来源记录)和duplicates.parquet(候选重复映射)。每个演讲事件包含speech_id、title、date、year、location、venue、period、event_type、speaker、tldr、transcript、transcript_status、transcript_confidence、source_url等字段,适用于文本分类、摘要生成和问答等自然语言处理任务。数据集采用CC-BY-4.0许可证,仅包含英语内容。
The Dr. A.P.J. Abdul Kalam Life-long Speeches and Lectures Corpus is a comprehensive, machine-readable dataset containing speeches, addresses, convocation talks, and scientific lectures delivered by Dr. A.P.J. Abdul Kalam throughout his career as a rocket scientist, the 11th President of India (2002-2007), and a global statesman (2007-2015). It includes 912 unique speech events, tracing 1,028 original source records, with a total of 1,822,794 words, covering the period from 1963 to 2015. Data is available in Parquet and JSONL formats, with main files including speeches.parquet, sources.parquet, and duplicates.parquet. Each speech event contains fields such as speech_id, title, date, year, location, venue, period, event_type, speaker, tldr, transcript, transcript_status, transcript_confidence, source_url, etc., suitable for text classification, summarization, and question answering tasks. The dataset is licensed under CC-BY-4.0 and contains only English content.
Dr. A.P.J. Abdul Kalam Lifetime Speech Corpus 数据集详情
数据集概述
这是一个关于印度前总统阿卜杜尔·卡拉姆博士(Dr. A.P.J. Abdul Kalam)毕生演讲与讲座的综合性机器可读语料库,涵盖其作为火箭科学家、印度第11任总统(2002-2007年)以及全球政治人物(2007-2015年)时期的各种演讲、致辞、毕业典礼讲话和科学讲座。
核心统计
- 规范演讲事件总数: 912个
- 原始来源记录总数: 1,028条
- 总词数: 1,822,794词
- 覆盖时间范围: 1963年至2015年
- 核验总统核心演讲: 1,024条站点记录(785个唯一规范演讲)
数据配置与格式
数据集包含四个配置,均以Parquet格式提供训练集数据:
| 配置名称 | 文件路径 | 内容说明 |
|---|---|---|
default |
data/speeches.parquet |
规范演讲事件(主数据) |
speeches |
data/speeches.parquet |
规范演讲事件 |
sources |
data/sources.parquet |
原始来源记录(溯源层) |
duplicates |
data/duplicates.parquet |
候选重复记录映射 |
同时提供对应的JSONL格式文件(speeches.jsonl、sources.jsonl、duplicates.jsonl)。
数据字段结构
speeches.parquet 中每条记录代表一个规范演讲事件,主要字段包括:
| 字段名 | 类型 | 说明 |
|---|---|---|
speech_id |
string | 唯一规范演讲标识(如 KALAM-2007-0006) |
canonical_event_id |
string | 关联重复/多来源记录的规范事件ID |
title |
string | 标准化的演讲标题 |
date |
string | 日期字符串(DD.MM.YYYY 或 DD-MM-YYYY) |
year |
int | 演讲年份 |
location |
string | 提取的演讲地点(如 New Delhi、Hyderabad、Strasbourg) |
venue |
string | 场地/主办机构 |
period |
string | 时期(pre-presidency、presidency、post-presidency) |
event_type |
string | 类别(presidential_address、convocation、distinguished_lecture) |
speaker |
string | 演讲者(固定为 Dr. A.P.J. Abdul Kalam) |
tldr |
string | 提取式关键摘要(3-4句话,保留原始措辞) |
transcript |
string | 完整的清理后演讲稿(Markdown格式) |
transcript_status |
string | 状态(official_transcript、institutional_transcript、video_only) |
transcript_confidence |
string | 置信度(high、medium、low) |
source_url |
string | 官方来源URL |
source_type |
string | 来源类型(official_presidential、institutional_archive、video_recording) |
source_domain |
string | 来源网站域名 |
rights_status |
string | 权利评估(public_domain_gov、educational_fair_use、copyright_restricted) |
sha256 |
string | 演讲文本的SHA-256哈希值 |
质量控制方法
- 无静默改写: 严格保留原始演讲稿措辞、标题、列表和引用。
- 双层溯源: 保留原始来源记录(
sources.jsonl)并关联到规范事件(speeches.jsonl)。 - 自动化质量检查: 检查缺失标题、空演讲稿、网站样板内容和编码损坏等问题。
使用方式
可通过 Hugging Face datasets 库加载:
python from datasets import load_dataset
加载规范演讲(默认配置)
ds = load_dataset("sanjeevafk/kalam-speech-corpus") print(ds["train"][0])
加载原始来源记录(溯源层)
sources_ds = load_dataset("sanjeevafk/kalam-speech-corpus", "sources") print(sources_ds["train"][0])
数据集标注信息
- 标注创建者: 机器生成
- 语言: 英语(单语)
- 语言来源: 已发现/收集
- 许可证: CC-BY-4.0
- 数据集规模: 少于10,000条
- 来源数据集: 原始数据
- 任务类别: 文本分类、摘要生成、问答
- 标签: 演讲、印度、阿卜杜尔·卡拉姆、历史、治理、科学与技术




