遇见数据集

fffoivos/hplt-greek-ge8-no-mt-clean60-wave4

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- language: - el license: other pretty_name: HPLT Greek GE8 No-MT Clean60 Wave4 task_categories: - text-generation size_categories: - 10M<n<100M configs: - config_name: default data_files: - split: train path: data/*.parquet --- # HPLT Greek GE8 No-MT Clean60 Wave4 A standalone release of the filtered Greek HPLT slice used in the GlossAPI Greek pretraining corpus. It contains the full `HPLT/ell_Grek_ge8_no_mt_clean60` source after the Wave4 re-cleaning and normalization pass. ## Snapshot - Rows: `48728774` - Data parquet files: `250` - Source dataset value: `HPLT/ell_Grek_ge8_no_mt_clean60` - Quality bins: `8`, `9`, `10` - MT/register filtering: applied before this release - Cleaner gate: `greek_badness_score <= 60` before Wave4 re-cleaning ## Token Count With ModernGreek-148k This full HPLT slice was tokenized with [`fffoivos/apertus-tokenizer-extension`](https://huggingface.co/fffoivos/apertus-tokenizer-extension)'s selected `ModernGreek-148k` tokenizer: - tokenizer vocab: `148480` tokens (`131072` Apertus base + `17408` modern Greek extension tokens) - tokenizer SHA-256: `358ae3f29ac17c99769d6d437339e28657d5fcaed3486f8550feed3d6adfc394` - rows/documents: `48,728,774` - tokens without special tokens/EOD: `44,195,950,025` - tokens with one EOD per row: `44,244,678,799` - average tokens per row without EOD: `906.9785` The count was produced on Clariden with a CPU-only `xfer` job (`2399397`) and uses `add_special_tokens=false`. ## Quality Bin Distribution | quality_bin | row_count | file_count | share_of_rows_percent | | --- | --- | --- | --- | | 8 | 38919919 | 199 | 79.87 | | 9 | 9709678 | 50 | 19.93 | | 10 | 99177 | 1 | 0.2 | ## Columns - `source_dataset` - `source_doc_id` - `text` - `title` - `author` - `source_metadata_json` - `is_historical_or_polytonic` - `contains_math` - `contains_latex` - `greek_percentage` - `latin_percentage` - `polytonic_ratio` - `table_ratio` - `greek_badness_score` - `len_greek` - `mojibake_badness_score` - `needs_ocr` - `is_empty` - `filter` - `ocr_success` - `quality_method` - `reevaluated_at` - `content_chars_kept` - `chars_dropped_by_line_drop` - `chars_dropped_by_normalization` - `chars_dropped_by_per_char_filter` - `lines_dropped_by_cleaner` - `marker_chars_passthrough` - `marker_chars_added` - `charset_greek_ratio` - `charset_moji_ratio` - `charset_punct_ratio` - `mojibake_noise_ratio` - `rule_a_match_count` - `rule_b_match_count` - `residue_line_drop_count` - `phase_a_fallback_reason` - `phase_a_dialect_ambiguous_input` - `cleaner_chars_before` - `cleaner_chars_after` ## Intended Use - Greek web-text pretraining experiments - HPLT-only baselines - Mixture construction with curated GlossAPI sources - Tokenizer and cleaning analysis over a large filtered web corpus ## Notes - This dataset is intentionally HPLT-only; the broader mixed corpus lives at `fffoivos/glossapi-greek-nanochat-pretraining-dataset`. - Source licensing remains governed by the upstream HPLT release.

HPLT Greek GE8 No-MT Clean60 Wave4 is a standalone release of the filtered Greek HPLT slice used in the GlossAPI Greek pretraining corpus. It contains the full HPLT/ell_Grek_ge8_no_mt_clean60 source after the Wave4 re-cleaning and normalization pass. The dataset has undergone quality filtering (MT/register filtering applied, with a cleaner gate of greek_badness_score <= 60 before Wave4 re-cleaning), comprising approximately 48.7 million rows across 250 Parquet files, distributed across quality bins 8, 9, and 10. Tokenized with the ModernGreek-148k tokenizer, it totals around 44.2 billion tokens. Intended uses include Greek web-text pretraining experiments, HPLT-only baselines, mixture construction with curated GlossAPI sources, and tokenizer and cleaning analysis over a large filtered web corpus. This dataset is intentionally HPLT-only, with source licensing governed by the upstream HPLT release.

提供机构:
fffoivos
搜集汇总
数据集介绍
fffoivos/hplt-greek-ge8-no-mt-clean60-wave4 数据集图片
构建方式
该数据集源自HPLT项目发布的希腊语网络文本切片,经Wave4阶段的重新清洗与规范化处理而成。构建过程中,首先对原始HPLT/ell_Grek_ge8_no_mt_clean60数据施加质量分箱筛选,仅保留质量等级为8、9、10的文档,并在此之前完成机器翻译与语域过滤。随后通过清洁器门控条件greek_badness_score <= 60进行预筛选,再执行Wave4再清洗,涵盖行级丢弃、字符归一化、逐字符过滤及乱码噪声抑制等操作,最终形成包含48,728,774行、250个Parquet文件的独立发布版本。
使用方法
该数据集适用于希腊语网络文本预训练实验、仅HPLT基线构建、与GlossAPI精选来源的混合语料构造,以及面向大规模过滤网络语料的令牌器与清洗分析。使用时可通过Hugging Face datasets库加载默认配置,训练集路径为data/*.parquet。鉴于数据集刻意限定为HPLT单一来源,若需更广泛的混合语料,可参考fffoivos/glossapi-greek-nanochat-pretraining-dataset。源数据许可遵循上游HPLT发布条款。
背景与挑战
背景概述
希腊语作为低资源语言,长期面临大规模高质量预训练语料匮乏的困境。为推进希腊语自然语言处理研究,相关研究人员依托HPLT项目构建了希腊语网页文本切片,并纳入GlossAPI希腊语预训练语料库。该数据集于Wave4再清洗与规范化阶段发布,包含约4872万行文本,基于ModernGreek-148k分词器统计令牌逾442亿,质量分层集中于8至10级。作为HPLT-only基线资源,它为希腊语网络文本预训练实验、混合语料构建及分词与清洗分析提供了大规模过滤语料,对希腊语语言模型的规模化训练具有基础性支撑作用。
当前挑战
该数据集所应对的领域问题在于希腊语预训练语料的稀缺与噪声,尤其是网络爬取文本中普遍存在的编码错误、混杂字符、数学公式与多调符残留等污染。构建过程中的核心挑战涉及多层面:需在保留真实语言现象的同时,通过希腊语坏度评分与字符比例等多重指标过滤低质内容,并处理OCR需求、空文档与拉丁字符混入等异常;Wave4再清洗还须精确追踪字符丢弃、行删除与规范化改动,以维持数据可追溯性。此外,质量分层分布高度不均衡,高分层样本占比极低,如何在过滤强度与语料规模之间取得平衡,构成持续性的技术难题。
常用场景
经典使用场景
在希腊语自然语言处理研究中,大规模单语预训练语料库的构建始终是推动语言模型性能提升的核心基础设施。该数据集作为HPLT项目中经过Wave4重清洗与标准化流程的希腊语网页文本切片,涵盖约四千八百七十万行文档、逾四百四十亿个ModernGreek-148k词元,天然适配于希腊语自回归语言模型的预训练任务。研究者可将其直接用于掩码语言建模或因果语言建模,借助其中质量分箱8至10的高质量文本,探索希腊语在低资源语境下的表征学习能力,并建立纯HPLT单源基线以衡量数据清洗策略对下游任务的影响。
解决学术问题
希腊语作为形态丰富且历史层次复杂的语言,其网页文本常混杂多调符号、OCR噪声、数学公式及拉丁字符侵入等问题,给语料质量带来严峻挑战。该数据集通过希腊语坏度评分门控、逐行清洗与规范化处理,有效缓解了原始HPLT切片中的噪声累积与领域偏移问题,为学术研究提供了可复现的过滤标准。其质量分箱分布与细粒度清洗元数据使研究者能够系统考察数据质量对模型困惑度、泛化能力及跨领域迁移的影响,从而深化对低资源语言预训练数据工程的理解。
实际应用
在实际应用层面,该数据集为希腊语信息检索、文本生成、机器翻译及语音识别等系统的预训练阶段提供了可靠的数据支撑。开发者可将其与GlossAPI精选语料混合,构建面向特定任务的预训练混合物,或直接用于希腊语词元分析器的训练与评估。其包含的希腊字符比率、多调比率与OCR需求标记等字段,亦可用于构建数据筛选管道,辅助工业级希腊语语言模型的迭代优化与领域适配。
数据集最近研究
最新研究方向
在希腊语预训练资源匮乏的背景下,该数据集作为纯HPLT过滤切片,正推动低资源语言模型的数据质量与分词效率研究。其基于ModernGreek-148k分词器的44.2B token计数与质量分箱(8-10)为分析Web文本清洗边界提供了基准。前沿方向聚焦于:利用greek_badness_score等细粒度元数据优化清洗门限,探索历史多音调文本与数学内容的过滤策略,并构建与GlossAPI精选源混合的配比实验。该数据集支持HPLT-only基线,对评估清洗对下游任务的影响及分词器扩展效果具有关键意义,助力希腊语生成模型的稳健发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务