遇见数据集

marxism-dataset

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Marxism Dataset 是一个中文文本检索数据集,包含马克思主义经典著作、文集、传记与相关研究资料的数字馆藏。数据集涵盖55个书目(含单行本和丛书)和122个条目(Item),数据以JSONL.GZ格式存储。数据集提供两个配置:default配置包含搜索文档(search-documents.jsonl.gz),可用于全文检索;rmrb配置包含《人民日报》数字数据集(articles/*.jsonl.gz),当前发布1946年6月预览。数据集结构包括首页目录(面向读者)、books/catalog.json(面向程序提供稳定ID和下载路径)、以及每个条目的完整结构化.gz文件,支持重建搜索索引。该数据集适用于文本检索、信息检索、文档分析等任务。

The Marxism Dataset is a Chinese text retrieval dataset containing a digital collection of Marxist classic works, anthologies, biographies, and related research materials. The dataset covers 55 bibliographic items (including monographs and series) and 122 items, stored in JSONL.GZ format. The dataset provides two configurations: the default configuration includes search documents (search-documents.jsonl.gz) for full-text retrieval; the rmrb configuration includes the Peoples Daily digital dataset (articles/*.jsonl.gz), currently releasing a preview from June 1946. The dataset structure includes a homepage directory (for readers), books/catalog.json (providing stable IDs and download paths for programs), and complete structured .gz files for each item, supporting the reconstruction of search indexes. This dataset is suitable for tasks such as text retrieval, information retrieval, and document analysis.

创建时间:
2026-08-09
原始信息汇总

Marxism Dataset 数据集概述

基本信息

  • 数据集名称:Marxism Dataset
  • 数据集语言:中文(zh)
  • 任务类型:文本检索(text-retrieval)

数据集内容

该数据集是马克思主义经典著作、文集、传记与相关研究资料的中文数字馆藏,包含以下两个主要部分:

1. 基础书目数据(default 配置)

  • 包含 55 个书目 Dataset、122 个 Item
  • 数据文件:books/data/search-documents.jsonl.gz
  • 辅助文件:books/catalog.json 面向程序和 Agent,提供稳定 ID 与可下载路径
  • 每个 Item 的 .json.gz 为完整结构化数据,可用于重建搜索索引

2. 人民日报数据(rmrb 配置)

  • 按人民数据目录整理的《人民日报》数字数据集
  • 当前发布 1946 年 6 月预览数据
  • 数据文件:newspapers/rmrb/data/articles/*.jsonl.gz(年度文章表)
  • 辅助数据:newspapers/rmrb/items/(完整报纸 Item)、newspapers/rmrb/assets/(按 SHA-256 命名的整期 PDF 与文章图片)

馆藏目录(部分代表性书目)

马克思主义经典著作

  • 《1844年经济学哲学手稿》《共产党宣言:纪念版》《资本论(纪念版)》(3卷)《剩余价值理论(《资本论》第四卷)》《反杜林论》《哥达纲领批判》《哲学的贫困》《家庭、私有制和国家的起源》《工资、价格和利润》《帝国主义是资本主义的最高阶段》《德意志意识形态(节选本)》《政治经济学批判》《法兰西内战》《社会主义从空想到科学的发展》《神圣家族》《自然辩证法》《英国工人阶级状况》《路易·波拿巴的雾月十八日》《雇佣劳动与资本》《路德维希·费尔巴哈和德国古典哲学的终结》

马克思主义专题著作

  • 《什么是唯物论,什么是唯心论》《唯物主义和经验批判主义》《论个人在历史上的作用问题》《论国家》《论马克思恩格斯及马克思主义》《马克思主义的三个来源和三个组成部分》《苏联社会主义经济问题》《联共(布)党史简明教程》《辩证唯物主义历史唯物主义》《西方哲学简史》《大众哲学》《哲学与生活》

毛泽东相关著作

  • 《毛泽东选集》(4卷)《毛泽东文集》(8卷)《毛泽东传》(6卷)《毛泽东年谱:1893~1949(修订本)》《毛泽东年谱:1949~1976》《毛泽东自传(典藏版)》《毛泽东自述》《毛泽东诗词全编鉴赏》《毛泽东诗词欣赏(大字本)》《实践论》《毛主席对马克思主义哲学的主要贡献》

马克思恩格斯全集/文集/选集

  • 《马克思恩格斯全集》(20卷)《马克思恩格斯文集》(10卷)《马克思恩格斯选集》(4卷)

其他相关著作

  • 《怎么办?》《社会民主党在民主革命中的两种策略》《红星照耀中国》《漫长的革命》《鲁迅全集》(20卷)

使用说明

  • 首页目录面向读者,可按书名进入并查看卷册和完整目录
  • books/data/search-documents.jsonl.gznewspapers/rmrb/data/articles/*.jsonl.gz 可通过 Hugging Face Dataset Viewer 浏览并用于检索
搜集汇总
数据集介绍
marxism-dataset 数据集图片
构建方式
该数据集以马克思主义经典著作、文集、传记及相关研究资料为核心,构建了一套结构化的中文数字馆藏。数据集包含55个书目数据集和122个条目,每个条目以JSON格式存储完整结构化数据,便于重建搜索索引。馆藏目录提供稳定的ID与可下载路径,支持按书名浏览卷册和目录。此外,数据集还整合了《人民日报》数字资源,按年度组织文章表,当前提供1946年6月的预览。整体构建方式兼顾了学术研究与数据可访问性,为用户提供了多层次、多格式的数据访问途径。
使用方法
使用该数据集时,读者可先通过首页目录或`books/catalog.json`文件获取稳定的书目ID及下载路径,据此选择所需文献。借助Hugging Face Dataset Viewer,用户能够直接浏览`search-documents.jsonl.gz`文件进行文本检索。对于深入分析,可解压每个条目的JSON文件,重建完整的搜索索引或进行定制化处理。《人民日报》部分,用户可按年份访问文章表,实现批量分析。数据集适配于多种应用场景,包括文本挖掘、信息检索及历史研究,且支持编程接口,便于自动化流程的集成。
背景与挑战
背景概述
马克思主义经典著作及其相关研究资料的中文数字馆藏建设,是人文社会科学信息化与知识组织领域的重要课题。该数据集名为“marxism-dataset”,由数据整理团队于近年创建,旨在系统整合马克思主义经典文献(如《资本论》《共产党宣言》等)及《人民日报》等历史报刊资源,形成结构化、可检索的文本语料库。其核心研究问题在于构建一个支持文本检索、文献计量与知识挖掘的高质量中文数据集,以满足学术研究与数字人文应用的需求。该数据集通过稳定的目录体系与结构化数据格式,为研究者提供了便捷的访问途径,对马克思主义理论传播及数字化研究具有显著的推动作用。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域问题层面,马克思主义文献检索任务需处理多卷册著作、历史报刊等异构文本的语义关联,而现有数据集的规模与结构化程度尚不足以支撑高效的深度检索与知识图谱构建。在构建过程中,文献版本校勘、OCR识别误差修正、元数据统一及跨资源整合(如书籍与报纸)均存在技术瓶颈,同时确保数据完整性与版权合规亦为关键难题。此外,数据的动态更新与长期维护也构成持续性挑战,要求团队不断优化数据质量与可扩展性。
常用场景
经典使用场景
该数据集汇集了马克思主义经典著作、文集、传记及相关研究资料的中文数字馆藏,涵盖55个书目、122个条目。其最经典的使用场景在于为文本检索、信息抽取与知识图谱构建提供高质量的语料基础。研究者可借助其结构化的目录与全文数据,开展马克思主义文献的语义搜索、主题建模及文本分类等自然语言处理任务。同时,该数据集也为构建领域专用的问答系统与智能推荐系统提供了珍贵的训练数据,尤其在中文政治哲学文本的深度解析与比较研究方面具有独特价值。
解决学术问题
该数据集有力解决了马克思主义研究中长期存在的数字化文本资源分散、缺乏统一检索与深度分析工具的问题。通过提供稳定的ID、完整的结构化数据以及标准化的目录体系,它极大便利了学者对经典文献的系统性整理、比较与考证。对于计算社会科学与数字人文领域,该数据集支持大规模文本分析,促进了从文献考证到思想传播路径追踪等学术议题的量化研究,推动了马克思主义理论研究的科学化与现代化进程。
实际应用
在实际应用中,该数据集可服务于多类需求。图书馆与学术机构可将其作为数字化馆藏建设的蓝本,实现经典著作的在线浏览与检索。教育领域,该数据集可用于构建马克思主义理论课程的教学辅助平台,支持智能答疑与学习路径推荐。对于新闻媒体与智库,其包含的《人民日报》数字化文章数据,为舆情分析、政策解读与历史文本挖掘提供了宝贵素材。此外,出版机构可利用该数据集进行版本对比、引用溯源与内容再生产,提升出版效率与学术规范。
数据集最近研究
最新研究方向
该数据集聚焦于马克思主义经典文献的中文数字化与智能化检索,前沿研究方向涵盖利用自然语言处理与知识图谱技术构建马克思主义理论的知识服务体系。其收录的《马克思恩格斯全集》、《资本论》、《毛泽东选集》等权威文本,结合《人民日报》历史文献,为文本挖掘、语义理解与主题演化分析提供了丰富的语料基础。当前研究热点包括基于大语言模型的经典著作问答系统、思想脉络的可视化呈现以及跨文献的关联分析,旨在推动马克思主义理论研究的数字化转型,提升理论传播的精准性与时效性,对于促进人文计算与社会科学研究的交叉融合具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务