Fineweb-LARD
收藏资源简介:
本数据集是FineWeb和FineWeb-2的合并版本,并添加了基于URL解析的地理区域标注。通过一个URL解析流程,为每条记录标注了ISO 3166-1 alpha-2区域标签(未解析为XX的记录已被剔除),形成了一个按语言-文字和地区进行Hive分区的视图。数据规模庞大,包含约29.6亿条已解析的记录,覆盖525种语言、243个地区以及30,012个语言-文字与地区的组合。数据以Parquet文件格式存储,并按language_script(如eng_Latn, cmn_Hani)和region(如GB, CN)进行分区,便于按需高效加载特定子集。每条记录包含原始文档文本(text)、唯一标识符(id)、来源URL(url)、语言信息(language, language_script)、区域标签(region)、区域置信度(region_confidence)以及来源数据集标识(source_dataset)等字段。区域标注主要基于URL查找表,标注精度尚未评估,使用者可通过region_confidence字段进行过滤。数据集适用于多语言文本生成、文本分类以及基于地理或语言分布的大规模语言模型预训练等任务。
This dataset is a merged version of FineWeb and FineWeb-2, with added geographic region annotations based on URL parsing. Through a URL parsing process, each record is annotated with an ISO 3166-1 alpha-2 region label (records not resolved to XX have been removed), forming a Hive-partitioned view by language-script and region. The dataset is large-scale, containing approximately 2.96 billion parsed records, covering 525 languages, 243 regions, and 30,012 language-script and region combinations. Data is stored in Parquet file format and partitioned by language_script (e.g., eng_Latn, cmn_Hani) and region (e.g., GB, CN), enabling efficient loading of specific subsets as needed. Each record includes fields such as original document text (text), unique identifier (id), source URL (url), language information (language, language_script), region label (region), region confidence (region_confidence), and source dataset identifier (source_dataset). Region annotations are primarily based on a URL lookup table, and annotation accuracy has not been evaluated; users can filter using the region_confidence field. The dataset is suitable for tasks such as multilingual text generation, text classification, and large-scale language model pre-training based on geographic or linguistic distributions.




