booteek-ai/fineweb2-bagaco2
收藏资源简介:
Bagaço2 🍷🇵🇹 是一个用于欧洲葡萄牙语的预训练数据集。它基于CulturaX数据集的葡萄牙语部分,通过fasttext-euptvid分类器筛选出欧洲葡萄牙语(PT-PT)文档,并为每个文档添加了教育分数和内容类别。数据集包含约3300万个文档,分为460个parquet分片,总大小约37GB。教育分数范围从0到4,表示文档的教育质量,其中0分占比最高(45.15%)。内容类别包括生活方式、新闻、商业、社会、艺术、体育、健康、游戏和科学,其中生活方式类别占比最高(18.44%)。数据集适用于文本分类、语言建模和文本评分等NLP任务,语言为葡萄牙语(欧洲葡萄牙语变体),许可证为MIT。
pretty_name: Bagaço2 🍷🇵🇹 language: - 葡萄牙语(pt) - 葡萄牙语(por) license: MIT协议 task_categories: - 文本分类 task_ids: - 语言建模 - 主题分类 - 文本评分 source_datasets: - uonlp/CulturaX tags: - 葡萄牙语 - pt-pt - 欧洲葡萄牙语 - 网页语料库 - CulturaX - 分类 - 教育 - 类别分类 configs: - config_name: 样本配置 data_files: fineweb2-ptpt-prototype/000_00000.parquet default: true - config_name: 全量配置 data_files: fineweb2-ptpt-prototype/*.parquet dataset_info: 字段信息: - 字段名: text 数据类型: 大字符串类型(large_string) - 字段名: id 数据类型: 大字符串类型(large_string) - 字段名: dump 数据类型: 大字符串类型(large_string) - 字段名: url 数据类型: 大字符串类型(large_string) - 字段名: date 数据类型: 大字符串类型(large_string) - 字段名: file_path 数据类型: 大字符串类型(large_string) - 字段名: language 数据类型: 大字符串类型(large_string) - 字段名: language_score 数据类型: 64位浮点型(float64) - 字段名: language_script 数据类型: 大字符串类型(large_string) - 字段名: minhash_cluster_size 数据类型: 64位整型(int64) - 字段名: top_langs 数据类型: 大字符串类型(large_string) - 字段名: ptpt_score 数据类型: 64位浮点型(float64) - 字段名: educational_score 数据类型: 8位整型(int8) - 字段名: category 数据类型: 大字符串类型(large_string) size_categories: - 1000万<n<1亿 # Bagaço2 🍷🇵🇹 本数据集为欧洲葡萄牙语预训练专用语料库。 处理流程: 1. 从[CulturaX](https://huggingface.co/datasets/uonlp/CulturaX)数据集中提取葡萄牙语子集 2. 使用[duarteocarmo/fasttext-euptvid](https://huggingface.co/duarteocarmo/fasttext-euptvid)分类器,仅保留欧洲葡萄牙语(PT-PT)文本 3. 通过额外训练的两个分类器,为每条样本添加教育质量得分与内容类别标签 数据集共包含**3300万**条文本,存储于**460个Parquet分片**中,总数据量约**37GB**。 ## 分类器模块 ### 统计与计数信息 基于datatrove的CulturaX数据集过滤统计: "统计信息": { "总样本量": 199737979, "过滤丢弃量": 166679183, "留存样本量": 33058796, "文本长度统计": { "总字符数": 90594584215, "有效样本数": 33058796, "平均长度": 2740.4078543876713, "方差": 36957836.43497764, "标准差": 6079.295718664921, "最小长度": 209, "最大长度": 668957 } 例如,共有3300万条文本通过了欧洲葡萄牙语(PT-PT)分类测试。 (以下为近似统计值,因Hugging Face接口限流未获取精确数据) | 教育质量得分 | 样本量 | 占比 | |---|---:|---:| | 0 | 14,926,917 | 45.15% | | 1 | 11,357,279 | 34.35% | | 2 | 4,536,413 | 13.72% | | 3 | 2,001,114 | 6.05% | | 4 | 237,073 | 0.72% | | 内容类别 | 样本量 | 占比 | |---|---:|---:| | 生活方式(Lifestyle) | 6,097,436 | 18.44% | | 新闻(News) | 5,116,428 | 15.48% | | 商业(Business) | 4,878,042 | 14.76% | | 社会(Society) | 4,145,611 | 12.54% | | 艺术(Arts) | 3,921,415 | 11.86% | | 体育(Sports) | 3,083,034 | 9.33% | | 健康(Health) | 2,483,649 | 7.51% | | 游戏(Games) | 2,066,688 | 6.25% | | 科学(Science) | 1,266,493 | 3.83% | ### 葡萄牙语变体过滤模块 本过滤步骤使用[duarteocarmo/fasttext-euptvid](https://huggingface.co/duarteocarmo/fasttext-euptvid)完成,该模型为面向葡萄牙语变体识别的fastText分类器。 - **任务目标**:区分欧洲葡萄牙语(PT-PT)与巴西葡萄牙语(PT-BR) - **保留标签**:`__label__PT_PT` - **分类阈值**:`0.7` - **模型文件**:`model_quantized.ftz`(量化版本) [查看模型卡片](https://huggingface.co/duarteocarmo/fasttext-euptvid)。 ### 教育质量得分分类器 每条文本将被分配一个教育质量得分。 #### 参考数据集 - **标注样本量**:30,000条 - **标注模型**:Qwen3 235B A22B - **参考数据集文件**:`classification/bagaco_reference_educational_score_0to5_qwen3_235b_30000.parquet` #### 分类器配置 - **词嵌入模型**:`intfloat/multilingual-e5-small` - **分类模型**:逻辑回归(Logistic Regression,`C=1.0`,`class_weight='balanced'`) - **验证方案**:20%数据作为留出验证集(训练集24,000条,测试集6,000条) ##### 验证报告 | 得分等级 | 精确率 | 召回率 | F1值 | 样本支持数 | |---|---|---|---|---| | 0 | 0.66 | 0.82 | 0.73 | 2,056 | | 1 | 0.83 | 0.54 | 0.65 | 3,438 | | 2 | 0.23 | 0.51 | 0.31 | 369 | | 3 | 0.21 | 0.60 | 0.31 | 131 | | 4 | 0.00 | 0.00 | 0.00 | 6 | | **整体准确率** | | | **0.63** | **6,000** | | **宏平均** | **0.39** | **0.49** | **0.40** | **6,000** | | **加权平均** | **0.72** | **0.63** | **0.65** | **6,000** | 混淆矩阵: text [[1679 319 40 15 3] [ 846 1840 564 172 16] [ 7 65 189 101 7] [ 1 3 40 78 9] [ 0 0 3 3 0]] ### 内容类别分类器 每条文本将被划分为以下9个类别之一:社会(Society)、艺术(Arts)、商业(Business)、科学(Science)、体育(Sports)、生活方式(Lifestyle)、健康(Health)、游戏(Games)、新闻(News)。 #### 参考数据集 - **标注样本量**:3,500条 - **标注模型**:Gemini 2.5 Flash Lite - **参考数据集文件**:`classification/bagaco_reference_category_9class_gemini25flashlite_3500.parquet` #### 分类器配置 - **词嵌入模型**:`intfloat/multilingual-e5-small` - **分类模型**:逻辑回归(Logistic Regression,`C=1.0`,`class_weight='balanced'`) - **验证方案**:20%数据作为留出验证集(训练集2,800条,测试集700条) ##### 验证报告 | 内容类别 | 精确率 | 召回率 | F1值 | 样本支持数 | |---|---|---|---|---| | 艺术(Arts) | 0.60 | 0.83 | 0.70 | 59 | | 商业(Business) | 0.81 | 0.78 | 0.79 | 131 | | 游戏(Games) | 0.75 | 0.91 | 0.82 | 23 | | 健康(Health) | 0.77 | 0.87 | 0.81 | 53 | | 生活方式(Lifestyle) | 0.81 | 0.75 | 0.78 | 111 | | 新闻(News) | 0.80 | 0.71 | 0.75 | 131 | | 科学(Science) | 0.42 | 0.87 | 0.57 | 15 | | 社会(Society) | 0.72 | 0.57 | 0.64 | 101 | | 体育(Sports) | 0.89 | 0.87 | 0.88 | 76 | | **整体准确率** | | | **0.76** | **700** | | **宏平均** | **0.73** | **0.80** | **0.75** | **700** | | **加权平均** | **0.77** | **0.76** | **0.76** | **700** |



