遇见数据集

jonfd/ICC

收藏
Hugging Face2022-10-22 更新2024-03-04 收录
官方服务:

资源简介:

冰岛爬取语料库(ICC)包含了从冰岛的各种网站(如新闻网站、政府网站和论坛)爬取的约930M个词元。爬取的文本以原始形式呈现,未经过注释、分词和去重处理。该数据集主要用于训练语言模型,并且可以与其他语料库(如冰岛Gigaword语料库和mC4语料库的冰岛语部分)结合使用。数据集的语言为冰岛语,且为单语数据集。数据集的创建者是Jón Friðrik Daðason,由冰岛教育、科学和文化部资助。数据集采用CC BY 4.0许可证。

The Icelandic Crawled Corpus (ICC) contains approximately 930 million tokens crawled from various Icelandic websites including news sites, government websites, and forums. The crawled texts are presented in their original form without annotation, word segmentation, or deduplication processing. This dataset is primarily intended for training language models, and can be used in combination with other corpora such as the Icelandic Gigaword Corpus and the Icelandic portion of the mC4 corpus. The dataset is in Icelandic and is a monolingual dataset. It was created by Jón Friðrik Daðason and funded by the Ministry of Education, Science and Culture of Iceland. The dataset is licensed under CC BY 4.0.

提供机构:
jonfd
原始信息汇总

数据集卡片 for ICC

数据集描述

数据集摘要

冰岛爬虫语料库(ICC)包含约9.3亿个词元,这些词元是从一系列冰岛网站(包括新闻网站、政府网站和论坛)上抓取的。抓取的文本以其原始形式呈现,未经注释、未分词且未去重。

支持的任务和排行榜

ICC主要用于训练语言模型。它可以与其他语料库结合使用,例如冰岛语Gigaword语料库mC4语料库的冰岛部分。

语言

该语料库包含从各种在线来源抓取的冰岛语文本。

数据集结构

数据实例

[更多信息需要]

数据字段

每个抓取的项目包含两个字段:

  • url: 抓取文本的源URL。
  • text: 抓取的文本。

数据分割

N/A

数据集创建

策划理由

[更多信息需要]

源数据

初始数据收集和规范化

[更多信息需要]

源语言生产者是谁?

[更多信息需要]

注释

注释过程

N/A

注释者是谁?

N/A

个人和敏感信息

尽管该语料库完全由从公开可用网站收集的文本组成,但它可能包含一些个人或敏感信息的示例。

使用数据的注意事项

数据集的社会影响

[更多信息需要]

偏见的讨论

[更多信息需要]

其他已知限制

[更多信息需要]

附加信息

数据集策展人

该语料库由Jón Friðrik Daðason创建,在Reykjavik UniversityLanguage and Voice Lab工作期间完成。

该项目由冰岛2019-2023年语言技术计划资助。该计划由Almannarómur管理和协调,由冰岛教育、科学和文化部资助。

许可信息

本作品根据知识共享署名4.0国际许可协议授权。本作品中的任何文本、HTML页面链接、信息、元数据或其他材料可能受您与这些内容所有者之间的单独条款和条件的约束。

如果您是版权所有者或其代理人,并且认为本作品中的任何内容侵犯了您的版权,您可以通过以下信息提交通知:

  • 您的全名和合理充分的信息,以便我们联系您,如邮寄地址、电话号码和电子邮件地址。
  • 您声称已被侵犯的版权作品的识别信息。
  • 您声称侵权并应删除的材料的识别信息,以及合理充分的信息,以便我们找到该材料。

引用信息

N/A

贡献

感谢@jonfd添加此数据集。

搜集汇总
数据集介绍
jonfd/ICC 数据集图片
构建方式
在自然语言处理领域,高质量语料库的构建是推动语言模型发展的基石。ICC数据集(Icelandic Crawled Corpus)的构建过程体现了对冰岛语网络文本资源的系统性采集与整合。该数据集通过定向爬虫技术,从冰岛语新闻站点、政府门户网站及论坛等多元网络来源中抓取原始文本,最终累积约9.3亿个词元。所有文本均以未经标注、未分词、未去重的原始形态呈现,完整保留了网络语言的真实面貌,为冰岛语语言模型的预训练提供了纯净的底层数据资源。
特点
ICC数据集的核心特色在于其规模宏大与领域覆盖广泛。作为冰岛语领域罕见的十亿级词元语料库,它横跨新闻、政务与社交论坛等多个信息生态位,有效捕捉了冰岛语在不同社会语境下的使用特征。数据集采用无标注的原始文本格式,避免了人工标注引入的偏差,同时保留URL字段以追溯文本来源,增强了数据的可溯源性。这种设计使其在语言建模任务中具有高度的灵活性与通用性,能够与其他冰岛语语料库(如Icelandic Gigaword Corpus)无缝融合。
使用方法
ICC数据集专为自监督语言建模任务设计,其使用方法简洁而高效。用户可直接加载原始文本字段用于训练Transformer架构的语言模型,无需额外的预处理步骤。在实践应用中,该数据集常与Icelandic Gigaword Corpus及mC4的冰岛语子集联合使用,以扩充训练数据的多样性与规模。通过HuggingFace Datasets库,研究者可便捷地获取数据实例,每个样本包含URL与文本两个字段,支持流式加载以应对大规模数据的内存挑战。数据集采用CC-BY-4.0许可协议,允许学术与商业场景下的自由使用与二次分发。
背景与挑战
背景概述
冰岛语作为低资源语言,在自然语言处理领域长期面临数据匮乏的困境,这严重制约了该语言大语言模型的研发进程。为应对这一挑战,Jón Friðrik Daðason 于雷克雅未克大学语言与语音实验室创建了冰岛语爬取语料库(ICC),该数据集依托冰岛2019-2023年语言技术计划的资助,从新闻网站、政府门户及论坛等多样化冰岛语来源中收集了约9.3亿词元。ICC的诞生为冰岛语语言建模提供了基础性数据资源,填补了该语言大规模无标注文本语料的空白,其与冰岛语千兆词库及mC4冰岛语子集的互补性,进一步巩固了其在冰岛语自然语言处理研究中的基石地位。
当前挑战
当前ICC面临的核心挑战在于其原始性与非结构化特性所带来的多重困境。首先,语料未经去重、分词及标注处理,直接用于语言模型训练时可能引入噪声与冗余信息,影响模型的泛化能力与训练效率。其次,数据完全依赖网络爬取,虽源自公开网站,但不可避免地包含个人敏感信息,如何在保护隐私的前提下有效利用这些数据成为伦理与法律层面的棘手问题。此外,冰岛语作为形态丰富的语言,其复杂的屈折变化与有限的数字资源分布,使得从异构网络文本中提取高质量语料并构建鲁棒的语言模型,仍是一个亟待攻克的技术难关。
常用场景
经典使用场景
冰岛语爬取语料库(ICC)作为大规模无标注单语文本资源,其核心经典用途在于预训练语言模型的构建。凭借约9.3亿词元的庞大体量,该数据集为自回归或掩码语言模型的训练提供了丰富的冰岛语原始文本素材,尤其适用于从零开始训练针对低资源语言的Transformer架构模型,如GPT或BERT的变体。研究者可将其与冰岛语千兆词语料库及mC4中的冰岛语子集联合使用,以增强模型对冰岛语形态句法特征的建模能力。
解决学术问题
该数据集有效缓解了冰岛语作为低资源语言在自然语言处理领域面临的数据匮乏困境。在学术研究中,它解决了小语种语言模型预训练时语料规模不足、领域覆盖狭窄的核心问题,使得研究者能够探索冰岛语的神经语言建模、词向量表征学习及跨语言迁移学习等前沿课题。其无重复数据删除的原始形态保留策略,为分析网络文本的语言变异性和噪声鲁棒性提供了独特视角,推动了低资源语言NLP方法论的发展。
衍生相关工作
该数据集衍生了一系列冰岛语NLP领域的里程碑式工作,包括基于ICC和冰岛语千兆词语料库联合训练的IceBERT模型,以及针对冰岛语的GPT-like自回归语言模型。此外,它被用作冰岛语词性标注、命名实体识别等下游任务的基础预训练资源,催生了多项针对冰岛语形态复杂性的子词分词算法优化研究。这些工作共同构成了冰岛语计算语言学从资源建设到模型应用的完整技术链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务