遇见数据集

msi-corpus

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

Main Street Independent Corpus 是一个开源文本数据集,包含了来自 Main Street Independent 网站的完整档案,共计 15,875 篇新闻文章和 2,220 篇观点专栏。所有内容均为 AI 生成,并以 CC0 1.0 Universal 许可发布,即属于公有领域,允许自由使用且无需署名。数据集以 JSONL 格式提供,包含 news(新闻)和 opinion(观点)两个独立的数据分割。每个数据样本均包含丰富的元数据和全文内容,具体字段包括:slug(短链接标识)、url(原文链接)、headline(标题)、publish_date(发布日期)、section(所属板块)、primary_entities(主要实体)、primary_themes(主要主题)、topic_tags(话题标签)、license(许可证)和 text(正文)。对于 opinion 分割的专栏文章,还额外包含 pen_name(笔名)字段。该数据集适用于多种自然语言处理任务,如文本生成、文本分类和文本摘要。数据集规模在 1万到10万条样本之间,每日更新。此外,还提供了包含更丰富索引(如原子声明和来源)的批量 Markdown 和 JSONL 文件,以及支持自然语言搜索的端点。

Main Street Independent Corpus is an open-source text dataset containing the complete archive from the Main Street Independent website, with a total of 15,875 news articles and 2,220 opinion columns. All content is AI-generated and released under the CC0 1.0 Universal license, meaning it is in the public domain and can be freely used without attribution. The dataset is provided in JSONL format, with two separate splits: news and opinion. Each data sample includes rich metadata and full text content, with fields such as: slug (short link identifier), url (original article link), headline (title), publish_date (publication date), section (section category), primary_entities (primary entities), primary_themes (primary themes), topic_tags (topic tags), license (license), and text (body text). For the opinion split, an additional pen_name (pen name) field is included. The dataset is suitable for various natural language processing tasks, such as text generation, text classification, and text summarization. The dataset size ranges from 10,000 to 100,000 samples and is updated daily. Additionally, bulk Markdown and JSONL files with richer indexing (such as atomic claims and sources) are provided, along with endpoints that support natural language search.

创建时间:
2026-07-06
原始信息汇总

数据集名称

Main Street Independent Corpus

简介

该数据集是 Main Street Independent 网站的完整存档,包含 15,875 篇新闻文章2,220 篇观点专栏,每篇均包含全文和元数据。所有内容均由 AI 生成,并以 CC0 1.0 Universal 协议发布至公共领域,每日更新。

语言

  • 英语(en)

许可协议

  • CC0 1.0 Universal(公共领域,无需署名即可自由使用)

数据集大小

  • 10K < n < 100K(样本数量)

任务类别

  • 文本生成(text-generation)
  • 文本分类(text-classification)
  • 摘要(summarization)

标签

  • 新闻(news)
  • 新闻业(journalism)
  • AI生成(ai-generated)
  • CC0

配置与数据分割

  • 配置名称:default
  • 数据文件
    • split: newsarticles.jsonl
    • split: opinioncolumns.jsonl

字段说明

每条记录包含以下字段:

  • slug:文章标识符
  • url:文章链接
  • headline:标题
  • publish_date:发布日期
  • section:所属板块
  • primary_entities:主要实体
  • primary_themes:主要主题
  • topic_tags:话题标签
  • license:许可信息
  • text:正文内容
  • pen_name(仅观点专栏):笔名

加载示例

python from datasets import load_dataset ds = load_dataset("golfplan18/msi-corpus") print(ds["news"][0]["headline"], ds["news"][0]["text"][:200])

其他资源

  • Bulk Markdown + 更丰富的 JSONL 索引(包含原子声明、来源):https://github.com/Golfplan18/msi-corpus
  • 自然语言搜索 + MCP 端点:https://mainstreetindependent.com/data
搜集汇总
数据集介绍
msi-corpus 数据集图片
构建方式
Main Street Independent Corpus(msi-corpus)是一个以社区新闻与观点评论为核心的数据集,其全部内容均来源于在线新闻平台《Main Street Independent》,经过系统化采集与整理,形成了包含15,875篇新闻报道与2,220篇专栏评论的完整档案。数据集中每个条目均保留全文文本及丰富的元数据,包括标题、发布日期的字段、主题标签、主要实体与核心主题,以及评论专栏特有的笔名信息。所有内容均遵循CC0 1.0通用公共领域贡献许可协议,意味着用户可在无需注明出处的条件下自由使用。数据集每日刷新,确保内容持续更新与时效性。
特点
该数据集的核心特色在于其双模态结构,明确划分为“新闻”与“观点”两个独立子集,便于研究者针对不同文本类型开展分类、摘要或生成任务。数据条目中包含的primary_entities、primary_themes与topic_tags字段为细粒度语义分析提供了坚实基础,特别适用于新闻文本的实体识别与主题建模。此外,数据集中的文本均由AI生成,这一属性使其在机器生成文本检测、人机写作对比等前沿研究中具有独特的应用价值。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,调用load_dataset('golfplan18/msi-corpus')即可获取包含news与opinion两个切分的数据对象,支持通过索引快速访问单条记录的headline与text字段。除直接加载外,项目在GitHub上提供了Markdown格式的批量导出文件以及更富结构的JSONL索引,支持原子声明与来源追溯。此外,官方网站还提供自然语言搜索接口与MCP端点,方便研究者进行交互式探索与集成。
背景与挑战
背景概述
Main Street Independent Corpus(MSI-Corpus)是由独立新闻机构Main Street Independent于近期创建并公开的数据集,旨在推动AI生成新闻与评论的开放研究。该数据集收录了15,875篇新闻文章和2,220篇观点专栏,涵盖完整文本与元数据,并遵循CC0协议完全贡献至公共领域。其核心研究问题聚焦于如何利用大规模、高质量的AI生成文本资源,支撑文本生成、分类与摘要等自然语言处理任务的探索。作为首个每日更新的AI生成新闻语料库,MSI-Corpus为计算新闻学、媒体可信度分析及生成式模型评估提供了关键基准,尤其在区分人类与机器撰写内容的研究中具有开创性影响力。
当前挑战
MSI-Corpus所解决的领域核心挑战在于:当前缺乏一个公开、大规模且标注精细的AI生成新闻数据集,以支撑机器写作检测、风格迁移及可信度评估等研究的可重复性。传统语料库多依赖人工创作或合成数据,难以反映真实新闻的领域特异性与时效性。在构建过程中,团队面临两大难题:一是需确保每日数据刷新机制的稳定性,兼顾新文章抓取与旧版本归档的完整性;二是需在元数据层面(如实体、主题标签)保持跨时空的一致性,避免因新闻事件演变导致的标注漂移。此外,CC0协议虽降低了使用门槛,却也引发了关于AI生成内容版权归属与伦理边界的广泛讨论。
常用场景
经典使用场景
在新闻分析与自然语言处理领域,msi-corpus数据集凭借其丰富的新闻文章与评论专栏文本资源,成为文本生成、文本分类与摘要任务中的经典训练与评估语料。研究者常利用该数据集的全文本与元数据(如标题、主题标签、实体信息等)训练语言模型,以捕捉新闻叙事的语言风格与结构特征,或构建分类器区分新闻与评论体裁,以及开发面向新闻文本的自动摘要系统。
解决学术问题
该数据集有效解决了新闻领域研究中高质量、开放许可的标注语料稀缺问题。其CC0公共领域授权消除了版权壁垒,使研究者能够自由开展AI生成新闻的检测、新闻写作风格迁移、跨体裁文本分析等前沿课题。通过提供每日更新的实时新闻流,msi-corpus还支持动态语言演化、事件追踪与假新闻传播的实证研究,为计算新闻学的理论构建与方法论创新奠定了数据基础。
衍生相关工作
基于该数据集的衍生工作已涵盖多个方向:研究者利用全量文本与实体标签开发了主张抽取与事实验证系统,提升了新闻可信度自动评估能力。社区贡献的JSONL索引文件(包含原子主张与来源)催生了新闻事实分解与溯源的研究工具。同时,每日刷新的数据特性支持了新闻写作风格演变的长时序分析,以及不同媒体平台间叙事差异的对比研究,推动了计算社会科学中的新闻话语分析范式发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务