MonumentalSystems/text-corpus-v1
收藏资源简介:
MonumentalSystems文本语料库是一个经过丰富过滤的多领域文本语料库,适用于语言模型训练。它结合了古典文学、合成哲学对话、科学解释和同行评审的科学论文,所有内容都经过去重和质量过滤处理。语料库包含古典文学、通用知识和科学论文等多个领域,提供了丰富的元数据字段,如文本内容、领域、内容类型、主题、阅读水平、复杂性等。此外,还提供了使用`datasets`库进行过滤的示例,以及应用的质量过滤措施,如MinHash近去重、DataTrove Gopher和FineWeb质量过滤器等。
A richly filtered, multi-domain text corpus for language model training. Combines classical literature, synthetic philosophical dialogues, science explainers, and peer-reviewed science papers — all processed through deduplication and quality filtering. The corpus includes domains such as classics literature, general knowledge, and science papers, and provides extensive metadata fields for filtering, including text content, domain, content type, subject, reading level, complexity, etc. It also includes examples of filtering using the `datasets` library and details the quality filtering measures applied, such as MinHash near-deduplication, DataTrove Gopher and FineWeb quality filters, etc.




