遇见数据集

alexliap/high-quality-gr-text

收藏
Hugging Face2026-02-02 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - el license: apache-2.0 size_categories: - 1M<n<10M task_categories: - text-generation configs: - config_name: finepdfs_el data_files: finepdfs_el/*.parquet - config_name: fineweb_hq_el data_files: fineweb_hq_el/*.parquet - config_name: finewiki_el data_files: finewiki_el/*.parquet - config_name: wikipedia_el data_files: wikipedia_el/*.parquet tags: - llms - pretraining --- This dataset contains Greek language text data from multiple high-quality sources. ## Dataset Statistics - **Total tokens:** ~21.1 billion (GPT-4 tokenizer) - **Total records:** 5,032,854 ### Token Distribution - FineWeb2-HQ Greek: 14.6B tokens (68.9%) - FinePDFs-Edu Greek: 5.1B tokens (24.0%) - Wikipedia Greek: 752M tokens (3.6%) - FineWiki Greek: 745M tokens (3.5%) ## Dataset Structure The dataset consists of 4 subsets, each representing a different data source: ### finepdfs_el - **Files:** 1 - **Size:** 4.32 GB - **Source:** FinePDFs-Edu - Educational PDF content in Greek - **Repository:** [HuggingFaceFW/finepdfs-edu](https://huggingface.co/datasets/HuggingFaceFW/finepdfs-edu) ### fineweb_hq_el - **Files:** 2 - **Size:** 8.68 GB - **Source:** FineWeb2-HQ - Filtered high-quality Greek web content - **Repository:** [epfml/FineWeb2-HQ](https://huggingface.co/datasets/epfml/FineWeb2-HQ) ### finewiki_el - **Files:** 1 - **Size:** 0.43 GB - **Source:** FineWiki - High-quality Greek Wikipedia articles - **Repository:** [HuggingFaceFW/finewiki](https://huggingface.co/datasets/HuggingFaceFW/finewiki) ### wikipedia_el - **Files:** 1 - **Size:** 0.45 GB - **Source:** Greek Wikipedia and Wikisource - **Snapshots:** Wikipedia (20231101.el) + Wikisource (20231201.el) - **Repository:** [wikimedia/wikipedia](https://huggingface.co/datasets/wikimedia/wikipedia) ## Schema Each record in the dataset contains the following fields: - **text** (string): The text content - **url** (string): Source URL of the content - **language** (string): Language code (always 'el' for Greek) - **source** (string): Source dataset name (finewiki_el, fineweb_hq_el, finepdfs_el, or wikipedia_el) - **token_count** (integer): Number of GPT-4 tokens in the text ## Usage Load a specific subset: ```python from datasets import load_dataset # Load FineWiki Greek subset ds = load_dataset("alexliap/high-quality-gr-text", "finewiki_el", split="train") # Load FineWeb2-HQ Greek subset ds = load_dataset("alexliap/high-quality-gr-text", "fineweb_hq_el", split="train") # Access text and token count print(ds[0]["text"]) print(ds[0]["token_count"]) ``` ## License Apache 2.0 (inherits from source datasets) ## Code Repository The code used to build this dataset is available on GitHub: [https://github.com/alexliap/high-quality-gr-text](https://github.com/alexliap/high-quality-gr-text) ## Citation If you use this dataset, please cite the original sources: - FineWiki: HuggingFaceFW/finewiki - FineWeb2-HQ: epfml/FineWeb2-HQ - FinePDFs-Edu: HuggingFaceFW/finepdfs-edu - Wikipedia: Wikimedia Foundation

--- 语言: - 希腊语(el) 许可证:Apache-2.0 数据规模区间: - 100万 < 样本数 < 1000万 任务类别: - 文本生成 配置项: - 配置名称:finepdfs_el 数据文件:finepdfs_el/*.parquet - 配置名称:fineweb_hq_el 数据文件:fineweb_hq_el/*.parquet - 配置名称:finewiki_el 数据文件:finewiki_el/*.parquet - 配置名称:wikipedia_el 数据文件:wikipedia_el/*.parquet 标签: - 大语言模型(LLM) - 预训练 --- 本数据集收录了来自多个高质量数据源的希腊语文本数据。 ## 数据集统计 - **总Token(Token)数**:约211亿(采用GPT-4分词器计算) - **总记录数**:5,032,854 ### Token分布 - FineWeb2-HQ 希腊语子集:146亿Token(占比68.9%) - FinePDFs-Edu 希腊语子集:51亿Token(占比24.0%) - 希腊语维基百科子集:7.52亿Token(占比3.6%) - FineWiki 希腊语子集:7.45亿Token(占比3.5%) ## 数据集结构 本数据集包含4个子集,分别对应不同的数据源: ### finepdfs_el - **文件数**:1 - **大小**:4.32 GB - **数据源**:FinePDFs-Edu——希腊语教育类PDF内容 - **仓库地址**:[HuggingFaceFW/finepdfs-edu](https://huggingface.co/datasets/HuggingFaceFW/finepdfs-edu) ### fineweb_hq_el - **文件数**:2 - **大小**:8.68 GB - **数据源**:FineWeb2-HQ——经过筛选的高质量希腊语网页内容 - **仓库地址**:[epfml/FineWeb2-HQ](https://huggingface.co/datasets/epfml/FineWeb2-HQ) ### finewiki_el - **文件数**:1 - **大小**:0.43 GB - **数据源**:FineWiki——高质量希腊语维基百科文章 - **仓库地址**:[HuggingFaceFW/finewiki](https://huggingface.co/datasets/HuggingFaceFW/finewiki) ### wikipedia_el - **文件数**:1 - **大小**:0.45 GB - **数据源**:希腊语维基百科与维基文库 - **快照版本**:维基百科(20231101.el)+ 维基文库(20231201.el) - **仓库地址**:[wikimedia/wikipedia](https://huggingface.co/datasets/wikimedia/wikipedia) ## 数据Schema 数据集中的每条记录包含以下字段: - **text**(字符串类型):文本内容 - **url**(字符串类型):内容的源URL - **language**(字符串类型):语言代码(希腊语固定为'el') - **source**(字符串类型):所属数据集名称(可选值为finewiki_el、fineweb_hq_el、finepdfs_el或wikipedia_el) - **token_count**(整数类型):文本中包含的GPT-4 Token数量 ## 使用方法 加载指定子集的示例代码: python from datasets import load_dataset # 加载FineWiki希腊语子集 ds = load_dataset("alexliap/high-quality-gr-text", "finewiki_el", split="train") # 加载FineWeb2-HQ希腊语子集 ds = load_dataset("alexliap/high-quality-gr-text", "fineweb_hq_el", split="train") # 访问文本内容与Token计数 print(ds[0]["text"]) print(ds[0]["token_count"]) ## 许可证 Apache 2.0(继承自各源数据集) ## 代码仓库 构建本数据集的代码可在GitHub获取: [https://github.com/alexliap/high-quality-gr-text](https://github.com/alexliap/high-quality-gr-text) ## 引用说明 若使用本数据集,请引用以下原始数据源: - FineWiki:HuggingFaceFW/finewiki - FineWeb2-HQ:epfml/FineWeb2-HQ - FinePDFs-Edu:HuggingFaceFW/finepdfs-edu - 维基百科:维基媒体基金会

提供机构:
alexliap
二维码
社区交流群
二维码
科研交流群
商业服务