遇见数据集

esg-commitment-verifiability

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集是一个原始文本语料库,包含从美国证券交易委员会(SEC)Form 10-K年度报告中提取的Item 1A“风险因素”章节。这些文本是上市公司对其业务可能面临的风险(如监管、诉讼、气候暴露、运营等)所做的前瞻性披露。数据集专门针对美国环保署(EPA)监管严格的行业(如公用事业、石油和天然气、化学品和材料)中的美国上市公司构建,最初用于一项关于企业漂绿(greenwashing)的最终项目研究。数据涵盖138家公司在2015至2024财年间的1,088个文档(每个文档对应一个公司-年份组合),文档总单词数约为1,050万,平均每个文档约9,635个单词。数据以Parquet格式提供,仅包含一个“train”分割,因为这是一个文档语料库而非训练/测试基准。每个数据行代表一个提取的Item 1A章节,包含两个字段:“file_name”(源文件名,格式为“TICKER_YEAR.txt”)和“text”(完整的原始风险因素文本,未经空格标准化、句子分割或标注)。面板数据不平衡,62家公司出现在窗口期的每一年。在提取过程中,最长的章节被截断为30,000个单词。数据来源于SEC EDGAR的公开Form 10-K文件,使用“edgartools”工具定位文件并解析其Item 1A部分,文本保持原始状态。该数据集适用于文本生成、特征提取、金融文本分析、风险披露研究、企业社会责任(CSR)与环境、社会和治理(ESG)分析等自然语言处理任务。

This dataset is a raw text corpus composed of the Item 1A "Risk Factors" sections extracted from U.S. Securities and Exchange Commission (SEC) Form 10-K annual reports. These texts are forward-looking disclosures submitted by publicly traded U.S. companies, outlining potential risks their business operations may face, including regulatory challenges, litigation, climate-related exposure, operational hurdles, and more. The dataset is specifically curated for U.S. publicly listed firms in industries with stringent U.S. Environmental Protection Agency (EPA) oversight, such as utilities, oil and gas, chemicals, and materials sectors. It was originally developed for a capstone research project focused on corporate greenwashing. The dataset covers 1,088 documents (each corresponding to a unique company-fiscal year pair) from 138 companies over the 2015 to 2024 fiscal year period. The total word count of the corpus reaches approximately 10.5 million, with an average of roughly 9,635 words per document. The data is distributed in Parquet format and only contains a single "train" split, as this is a document corpus rather than a standardized train/test benchmark dataset. Each row in the dataset represents a single extracted Item 1A section, and includes two fields: "file_name" (the source file name, formatted as "TICKER_YEAR.txt") and "text" (the full, unprocessed raw text of the risk factors section, with no whitespace normalization, sentence segmentation, or manual annotation applied). The panel dataset exhibits class imbalance, with 62 companies appearing in every year of the sampled observation window. During the extraction workflow, the longest Item 1A sections were truncated to a maximum length of 30,000 words. All source data is retrieved from public Form 10-K filings hosted on the SEC EDGAR database, with the "edgartools" utility utilized to locate target filings and parse their Item 1A sections, while the extracted text is preserved in its original unmodified state. This dataset is applicable to a range of natural language processing tasks, including text generation, feature extraction, financial text analysis, risk disclosure research, corporate social responsibility (CSR) research, and environmental, social, and governance (ESG) analysis.

创建时间:
2026-05-20
原始信息汇总

数据集概述

数据集名称: SEC Item 1A Risk Factors: Raw Text Corpus

数据集地址: https://huggingface.co/datasets/MichaelDG/esg-commitment-verifiability

1. 数据集简介

该数据集包含美国上市公司在SEC Form 10-K年度报告中的“Item 1A”(风险因素)章节的原始文本。每个条目对应一家公司在某一财年的风险披露内容。该数据集仅包含原始披露文本,未附加任何标签或评分。

2. 关键统计信息

指标 数值
文档总数(公司-年份) 1,088
公司数量 138
财政年度范围 2015-2024
总词数 10,482,592
平均每文档词数 9,635
总字符数 71,329,285
语言 英语(en
数据格式 Parquet,单一 train 分割

3. 数据覆盖与分布

  • 行业覆盖:数据集中的公司均为美国上市公司,且属于美国环境保护署(EPA)严格监管的高污染强度行业,例如公用事业、石油天然气、化工和材料行业。
  • 年度覆盖:文档数量从2015年的76份增长至2024年的134份。

按财年文档数量分布:

财年 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024
文档数 76 76 83 91 119 124 127 128 130 134

公司出镜年数分布:

公司出现的年数 公司数量
10年(每年都出现) 62
7至9年 27
4至6年 42
1至3年 7

4. 文档长度统计

指标 词数 字符数
最短文档 539 4,118
中位数文档 8,611 58,167
平均文档 9,635 65,560
最长文档 30,000 217,121

(注:最长的文档在提取时被截断在30,000词以内,共有22篇文档达到此上限。)

5. 数据结构

数据集中每一行对应一个提取的Item 1A章节,以源文件名作为键。默认配置包含两个字段的Parquet格式数据:

字段 类型 描述
file_name 字符串 源文件,格式为 TICKER_YEAR.txt,例如 AEE_2019.txt
text 字符串 完整的Item 1A风险因素原始文本。

数据集中只有一个 train 分割,因为这是一个文档语料库而非训练/测试基准。

6. 数据来源与处理

  • 来源:数据源自SEC EDGAR数据库中美国上市公司的Form 10-K(年度报告)的Item 1A风险因素章节。
  • 处理流程:使用 edgartools 从SEC EDGAR拉取10-K文件并提取其Item 1A章节。文本保持原始状态,未进行空格归一化、句子分割或标签化处理。文件名保持 TICKER_YEAR.txt 的命名惯例。

7. 许可与引用

搜集汇总
数据集介绍
esg-commitment-verifiability 数据集图片
构建方式
该数据集聚焦于美国证券交易委员会(SEC)Form 10-K年度报告中第1A项“风险因素”章节的原始文本,系统性地从SEC EDGAR公共数据库中提取,覆盖2015至2024财年间138家美国上市公司的1,088份文档。这些公司主要分布于美国环境保护署(EPA)严格监管的高污染行业,如公用事业、石油天然气及化工材料领域。数据集构建过程中,借助edgartools工具精准定位并解析每份10-K文件的Item 1A部分,对提取的文本不做任何标准化或标注处理,仅以公司-年份为维度,每份文档以TICKER_YEAR.txt格式命名,并存储为单一的Parquet文件格式。该设计旨在保留风险披露的原始面貌,为后续自然语言处理研究提供未经修饰的语料基础。
特点
数据集具备鲜明的结构性特征:其一,语料规模庞大且富含领域针对性,总计包含约1,048万词,平均每份文档约9,635词,最长篇段经截断后不超过30,000词;其二,时间跨度长达十年,覆盖企业数量从2015年的76家稳步增长至2024年的134家,呈非平衡面板结构,其中62家公司在全部年份中持续出现;其三,文本内容仅包含前瞻性风险披露,不附带任何标签或评分,恪守“原始文本语料库”的定位。此外,数据以Parquet列式存储格式提供,仅设单一train拆分,便于高效加载和分布式处理,尤其适合金融文本分析及企业绿色洗白(greenwashing)研究的学术探索。
使用方法
用户可通过Hugging Face的datasets库直接加载数据,使用load_dataset函数指定数据集名称“MichaelDG/esg-commitment-verifiability”并选择train拆分即可获取完整语料。加载后,每条记录包含两个字段:file_name(如AEE_2019.txt)标识源文件,text字段存储对应年份的原始风险因素全文。数据集默认仅有一个训练集拆分,未划分测试或验证集,体现了其作为文档语料库而非基准测评数据集的设计初衷。研究人员可在此基础上进行文本分类、主题建模、风险因子抽取或气候披露分析等下游任务。值得注意的是,原始文本未经过停用词过滤、句子分割或词干化等预处理,用户需根据研究目标自主完成清洗与特征工程。
背景与挑战
背景概述
在金融文本分析领域,企业披露的风险因素文本蕴含着关于企业未来经营脆弱性的重要信息,尤其对于环境、社会和治理(ESG)相关议题的研究具有独特价值。该数据集由巴塞罗那经济学院的Cameron Armour、Marco Canal、Michael Duarte Gonçalves和Mircea-Adrian Guinea于2026年6月创建,聚焦于美国环境保护署(EPA)严格监管的高污染行业上市公司,系统收集了2015至2024年间138家企业共1088份SEC 10-K年报中的第1A项风险因素原始文本。该数据集的核心研究问题在于为识别企业“漂绿”行为提供未经标注的原始语料基础,其影响力体现于为计算语言学与公司金融交叉领域的研究者提供了一个高度聚焦、时间跨度完整的纵向文本资源,使ESG相关披露的演化轨迹与语义分析成为可能。
当前挑战
该数据集所应对的领域核心挑战在于企业ESG承诺可验证性的评估困境:企业可能在风险因素中声称面临环境风险,却缺乏后续行动的证据,因此需要从自由文本中自动识别真实承诺与“漂绿”之间的语义差异。在构建过程中,研究团队面临多重技术难题:首先,从SEC EDGAR系统中精准定位并解析特定年份的Item 1A章节存在文档格式不一致的障碍;其次,处理文本截断问题——最长的文档被限制在3万词,仍有22份文档触及该边界;此外,样本的不平衡性(62家企业覆盖全部10年,而7家仅出现1至3年)增加了纵向分析的复杂性;最后,文本保持原始状态(未进行空白标准化或句子切分),为后续的自然语言处理预处理留下了挑战。
常用场景
经典使用场景
在金融与自然语言处理交叉领域中,该数据集作为企业风险披露文本的原始语料库,最经典的应用场景是用于训练和评估面向SEC 10-K文件Item 1A章节的文本生成与特征提取模型。研究者可以借此分析企业如何表述其面临的监管、诉讼、气候及运营风险,尤其是利用长文本特性捕捉风险因素的时序变化与行业差异。数据集涵盖2015至2024年间138家高环境监管强度企业的1,088份披露文本,每篇平均近万字,为构建量化风险感知指标或生成式风险评估系统提供了坚实的文本基础。
实际应用
在实际应用中,该数据集可支撑金融监管科技与ESG投资领域的多项关键任务。资产管理公司可基于风险因素文本训练分类模型,自动识别企业披露中的实质性气候变化风险,优化投资组合的气候压力测试。审计机构与监管者利用该语料开发检测工具,对比企业风险声明与后续行动的一致性,辅助揭露潜在的绿色洗白行为。此外,企业自身也能通过历史披露文本的比对分析,完善内部风险管控报告。
衍生相关工作
该数据集继承并推动了Campbell等(2014)关于强制风险披露信息含量的研究,以及Loughran与McDonald(2011)在10-K文本分析领域中开创的词典方法。在此之上,衍生出若干经典工作:利用该语料微调大型语言模型以生成企业风险因子摘要,或与环保罚款、碳排放数据联动构建风险暴露预测模型。亦有多项研究以此为基础,开发跨时期的风险主题演化图谱,追踪监管政策变动如何重塑企业的话语体系,成为连接财务报表文本分析与可持续金融实证研究的重要桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务