遇见数据集

regicid/press_metadata

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多源法国新闻文章数据集,包含来自多个法国知名新闻媒体(如《费加罗报》、《世界报》、《巴黎人报》、《解放报》、《回声报》、《十字架报》、《Mediapart》和《法兰西西部报》)的文章数据。数据集涵盖文章标题、描述、作者、发布日期、修改日期、URL、关键词、章节标签等特征,部分子数据集还包括图片链接、付费标识和相关文章链接。该数据集适用于自然语言处理任务,如文本分类、信息提取和新闻分析。

数据集信息: - 配置名称:《十字架报(La Croix)》 特征字段: - 字段名:任务标识符(job_id),数据类型:大字符串类型 - 字段名:链接(url),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 - 字段名:关键词(keywords),数据类型:大字符串类型 - 字段名:免费标识(free),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:图片(image),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:标签(tags),数据类型:大字符串类型 - 字段名:相关阅读(read_also),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:555225692,样本数量:689521 下载大小:241280164 数据集总字节大小:555225692 - 配置名称:《费加罗报(Le Figaro)》 特征字段: - 字段名:任务标识符(job_id),数据类型:大字符串类型 - 字段名:链接(url),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 - 字段名:关键词(keywords),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:1480898366,样本数量:2230467 下载大小:555951605 数据集总字节大小:1480898366 - 配置名称:《世界报(Le Monde)》 特征字段: - 字段名:链接(url),数据类型:大字符串类型 - 字段名:年份(year),数据类型:大字符串类型 - 字段名:月份(month),数据类型:大字符串类型 - 字段名:日期(day),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:542523982,样本数量:3234693 下载大小:170952556 数据集总字节大小:542523982 - 配置名称:《巴黎人报(Le Parisien)》 特征字段: - 字段名:任务标识符(job_id),数据类型:大字符串类型 - 字段名:链接(url),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:关键词(keywords),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:封面(cover),数据类型:大字符串类型 - 字段名:免费标识(free),数据类型:大字符串类型 - 字段名:相关链接(related_links),数据类型:大字符串类型 - 字段名:相关阅读(read_also),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:2340085036,样本数量:1982834 下载大小:781946711 数据集总字节大小:2340085036 - 配置名称:《回声报(Les Echos)》 特征字段: - 字段名:任务标识符(job_id),数据类型:大字符串类型 - 字段名:链接(url),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:599194712,样本数量:1105181 下载大小:288474364 数据集总字节大小:599194712 - 配置名称:《解放报(Libération)》 特征字段: - 字段名:链接(url),数据类型:大字符串类型 - 字段名:日期(date),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:仅日期标识(date_only),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:139641452,样本数量:718258 下载大小:41745774 数据集总字节大小:139641452 - 配置名称:《媒体派(Mediapart)》 特征字段: - 字段名:任务标识符(job_id),数据类型:大字符串类型 - 字段名:链接(url),数据类型:大字符串类型 - 字段名:内容类型(type),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:图片(image),数据类型:大字符串类型 - 字段名:焦点专题(focus),数据类型:大字符串类型 - 字段名:焦点专题链接(focus_url),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 - 字段名:内容格式(format),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:32667701,样本数量:37841 下载大小:13332772 数据集总字节大小:32667701 - 配置名称:《西法兰西报(Ouest-France)》 特征字段: - 字段名:链接(url),数据类型:大字符串类型 - 字段名:内容类型(type),数据类型:大字符串类型 - 字段名:栏目(section),数据类型:大字符串类型 - 字段名:标题(headline),数据类型:大字符串类型 - 字段名:发布日期(date_published),数据类型:大字符串类型 - 字段名:修改日期(date_modified),数据类型:大字符串类型 - 字段名:作者(authors),数据类型:大字符串类型 - 字段名:图片(image),数据类型:大字符串类型 - 字段名:焦点专题(focus),数据类型:大字符串类型 - 字段名:焦点专题链接(focus_url),数据类型:大字符串类型 - 字段名:描述文本(description),数据类型:大字符串类型 - 字段名:内容格式(format),数据类型:大字符串类型 - 字段名:付费标识(payant),数据类型:大字符串类型 分割集: - 分割集名称:训练集(train),字节占用:461110600,样本数量:1175794 下载大小:168265049 数据集总字节大小:461110600 配置列表: - 配置名称:《十字架报(La Croix)》,数据文件: - 分割集:训练集(train),路径:lacroix/train-* - 配置名称:《费加罗报(Le Figaro)》,数据文件: - 分割集:训练集(train),路径:lefigaro/train-* - 配置名称:《世界报(Le Monde)》,数据文件: - 分割集:训练集(train),路径:lemonde/train-* - 配置名称:《巴黎人报(Le Parisien)》,数据文件: - 分割集:训练集(train),路径:leparisien/train-* - 配置名称:《回声报(Les Echos)》,数据文件: - 分割集:训练集(train),路径:lesechos/train-* - 配置名称:《解放报(Libération)》,数据文件: - 分割集:训练集(train),路径:liberation/train-* - 配置名称:《媒体派(Mediapart)》,数据文件: - 分割集:训练集(train),路径:mediapart/train-* - 配置名称:《西法兰西报(Ouest-France)》,数据文件: - 分割集:训练集(train),路径:ouestfrance/train-*

提供机构:
regicid
搜集汇总
数据集介绍
regicid/press_metadata 数据集图片
构建方式
press_metadata数据集汇聚了来自法国八家主流新闻媒体(La Croix、Le Figaro、Le Monde、Le Parisien、Les Echos、Libération、Mediapart、Ouest-France)的元数据信息。该数据集通过系统化采集各媒体公开的文章元数据构建而成,涵盖了自不同媒体起讫时间跨越多年的文章信息。每个子数据集均以独立的配置名称(config_name)进行组织,并统一以训练集(train)形式呈现,数据文件采用分片存储方式(如train-*),便于高效加载与处理。各子集的特征字段虽因媒体而异,但均围绕文章核心元数据设计,包括文章链接、标题、发布日期、作者、栏目划分等基础要素。
特点
该数据集最显著的特点在于其多源异构性与跨媒体一致性。一方面,它囊括了法国主要新闻机构,覆盖了从左翼到右翼、从综合性日报到专业财经媒体的广泛意识形态与报道领域,为分析法国媒体生态提供了全景式视角。另一方面,不同媒体子集的特征字段存在差异,例如部分媒体记录了文章关键词、标签、相关链接、付费状态等扩展信息,而另一些则侧重于基础元数据。尤为独特的是,多数子集包含作者性别字段(author_gender),为新闻界性别研究提供了宝贵数据。此外,数据集的规模庞大,总样本数超过千万条,时间跨度长,适合进行历时性媒体内容分析。
使用方法
使用press_metadata数据集时,需依据研究目标选择对应的媒体子集(config_name),通过HuggingFace的datasets库按需加载。由于各子集特征字段不完全一致,研究人员应先深入了解每个子集的具体字段定义,设计统一的数据处理流程。对于需要跨媒体比较的研究,可抽取共有字段(如url、headline、date_published、authors等)进行合并分析。推荐将数据解析为结构化表格格式,利用Python的pandas等库进行清洗与探索,并结合自然语言处理技术对标题、摘要等文本型字段进行深层次语义分析。该数据集也可作为构建新闻推荐系统、媒体偏见检测模型或新闻趋势预测任务的基础语料库。
背景与挑战
背景概述
新闻语料库作为自然语言处理研究的基石,其结构化元数据对于内容分析、作者特征识别及新闻传播研究具有不可替代的价值。该数据集创建于近年来,汇集了来自法国八家主流媒体(La Croix、Le Figaro、Le Monde、Le Parisien、Les Echos、Libération、Mediapart、Ouest-France)的新闻元数据,总计超过千万条记录,由多个研究机构协作构建。其核心研究问题在于探索多源异构新闻数据的标准化表示与跨媒体分析,涵盖标题、关键词、作者性别、发布时间等信息维度,为新闻学研究与计算语言学提供了丰富的素材,有效推动了新闻语料库在多语言、多模态背景下的应用发展。
当前挑战
数据集面临的首要挑战在于解决新闻文本分析中的作者性别偏见与媒体倾向性建模问题,通过记录作者性别字段,为研究新闻生态中的性别表征提供了数据基础,但原始数据可能存在标注不一致或缺失,影响后续分析的准确性。构建过程中,从八家媒体爬取并解析结构各异的元数据,处理编码差异、字段缺失(如部分媒体缺少关键词或图片)以及海量数据的高效存储与格式统一,构成了技术层面的严峻考验,加之法语特有的语言结构与词汇复杂性,进一步增加了文本预处理的难度。
常用场景
经典使用场景
在新闻传媒与计算社会科学交汇的研究前沿,press_metadata数据集凭借其跨平台、多源异构的特性,成为分析法国主流媒体话语体系的基石资源。该数据集汇聚了来自La Croix、Le Figaro、Le Monde等八家权威新闻机构的元数据,涵盖标题、作者、发布时间、栏目分类及关键词等核心字段。其最为经典的应用场景体现在新闻内容的结构化挖掘与传播规律研究之中,研究者能够基于海量新闻元数据,系统性地剖析媒体议程设置、报道偏向性以及新闻事件的时间演化轨迹,从而揭示不同媒体在相同议题下的叙事差异与共性模式。
衍生相关工作
围绕press_metadata,学术界已衍生出一系列具有标志性的探索性工作。部分研究利用数据集中丰富的作者性别字段,深入剖析了法国新闻从业者的性别构成对报道风格与议题选择的影响,开创了计算新闻学中性别分析的新范式。另一些工作则聚焦于多源新闻元数据融合后的时效性建模,提出了基于时间序列的新闻生命周期预测框架,显著提升了突发新闻检测系统的灵敏性。值得关注的是,该数据集还支撑了多个关于法国媒体关键词共现网络的图谱构建项目,这些图谱为理解法国公众舆论的议题关联结构提供了全新的可视化工具与分析视角。
数据集最近研究
最新研究方向
该数据集汇聚了法国多家主流报刊(如《费加罗报》《世界报》《巴黎人报》等)的元数据,涵盖标题、作者、关键词、发布时间及作者性别等结构化信息,为计算传播学与新闻内容分析提供了高价值语料。当前前沿方向聚焦于利用这些海量元数据训练大语言模型,以捕捉新闻议题的时序演变与媒体立场差异;同时,作者性别字段的引入推动了新闻生产中的性别表征研究,成为探讨媒体领域社会公平与报道偏见的关键支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务