kurumikz/kaz-news-corpus
收藏资源简介:
--- language: - kk license: odc-by task_categories: - text-classification - text-generation pretty_name: KAZ-NEWS-CORPUS size_categories: - 10K<n<100K source_datasets: - original tags: - kazakh - news - nlp --- # kaz-news-corpus Қазақ тіліндегі жаңалықтар корпусы — egemen.kz, baq.kz және azattyq.org сайттарынан жиналған. ## Датасет туралы | Параметр | Мән | |---|---| | Мақала саны | **11,814** | | Жалпы көлемі | **53.86 MB** | | Жалпы сөз саны | **3,405,903** | | Орташа мақала ұзындығы | **2,274 символ / 288 сөз** | | Медиана ұзындығы | **1,503 символ** | | Ең ұзын мақала | 81,103 символ | | Ең қысқа мақала | 86 символ | | Бос тақырып (title) | 3 (0.025%) | ## Деректер көздері | Сайт | Мақала | Орташа ұзындық | Үлесі | |---|---|---|---| | Baq.kz | 4,993 | 1,620 символ | 42.3% | | Azattyq (RFE/RL) | 3,839 | 3,134 символ | 32.5% | | Egemen Qazaqstan | 2,982 | 2,262 символ | 25.2% | ## Мақала ұзындықтарының бөлінуі ``` 100–500 символ : ████ 986 (8.3%) 500–1000 символ : █████████ 2305 (19.5%) 1000–3000 символ : ███████████████████████ 6480 (54.9%) 3000–10000 символ : ███████ 1739 (14.7%) 10000+ символ : █ 301 (2.5%) ``` ## Тазалау туралы Бастапқы датасет `kazakh_media_dataset.jsonl` (11,824 мақала) автоматты түрде тазаланды: - Сайт навигациясы, фото астары, санат белгілері жойылды - Байлайндар жойылды (`BAQ.KZ тілшісі`, т.б.) - Қайталанатын жолдар алынды - `title` өрісі бос болған жағдайда мақаланың бірінші сөйлемінен автоматты түрде толтырылды - 10 мақала тазалаудан кейін 80 символдан аз болды — алынып тасталды ## Деректер форматы **JSONL** форматы — әр жол бір мақала: ```json { "article_id": 1, "source_name": "Egemen Qazaqstan", "url": "https://egemen.kz/article/...", "title": "Мақала тақырыбы", "content": "Мақала мәтіні осында..." } ``` | Өріс | Түрі | Сипаттамасы | |---|---|---| | `article_id` | int | Мақаланың реттік нөмірі | | `source_name` | string | Деректер көзінің атауы | | `url` | string | Бастапқы сілтеме | | `title` | string | Тақырып | | `content` | string | Мақала мәтіні | ## Пайдалану ```python import json with open("kaz_news_corpus_clean.jsonl", "r", encoding="utf-8") as f: for line in f: article = json.loads(line) print(article["source_name"], article["title"]) ``` ```python import pandas as pd df = pd.read_json("kaz_news_corpus_clean.jsonl", lines=True) print(df.groupby("source_name")["content"].count()) ``` ## Лицензия Датасет **[Open Data Commons Attribution License (ODC-BY) 1.0](https://opendatacommons.org/licenses/by/1-0/)** лицензиясы бойынша таратылады. Авторлықты көрсеткен жағдайда датасетті еркін пайдалануға, көшіруге және таратуға болады: ``` kurumikz. kaz-news-corpus: Kazakh news corpus. 2026. https://huggingface.co/datasets/kurumikz/kaz-news-corpus ``` Мәтіндердің авторлық құқығы бастапқы деректер көздеріне тиесілі (egemen.kz, baq.kz, azattyq.org). Датасет тек зерттеу мақсатында жиналған. --- *Author: [@kurumikz](https://huggingface.co/kurumikz) · 2026*
--- 语言: - 哈萨克语 许可证:ODC-BY 任务类别: - 文本分类 - 文本生成 美观名称:KAZ-NEWS-CORPUS 规模类别: - 10K < n < 100K 源数据集: - 原始数据集 标签: - 哈萨克语 - 新闻 - 自然语言处理(Natural Language Processing, NLP) --- # KAZ-NEWS-CORPUS 哈萨克语新闻语料库 本语料库的数据采集自egemen.kz、baq.kz及azattyq.org三家新闻网站。 ## 数据集概况 | 参数 | 数值 | |---|---| | 文章总数 | **11,814** | | 总数据量 | **53.86 MB** | | 总词数 | **3,405,903** | | 单篇平均长度 | **2,274 字符 / 288 词** | | 长度中位数 | **1,503 字符** | | 最长文章 | 81,103 字符 | | 最短文章 | 86 字符 | | 空标题 | 3 篇(占比 0.025%) | ## 数据来源 | 网站 | 文章数量 | 平均长度 | 占比 | |---|---|---|---| | Baq.kz | 4,993 | 1,620 字符 | 42.3% | | Azattyq(RFE/RL) | 3,839 | 3,134 字符 | 32.5% | | Egemen Qazaqstan | 2,982 | 2,262 字符 | 25.2% | ## 文章长度分布 100–500 字符 : ████ 986 (8.3%) 500–1000 字符 : █████████ 2305 (19.5%) 1000–3000 字符 : ███████████████████████ 6480 (54.9%) 3000–10000 字符 : ███████ 1739 (14.7%) 10000+ 字符 : █ 301 (2.5%) ## 数据清洗说明 原始数据集为`kazakh_media_dataset.jsonl`(共11,824篇文章),经自动化流程清洗如下: - 移除网站导航栏、图片注释及特殊符号标记 - 移除署名栏(如`BAQ.KZ 译者`等字样) - 去除重复段落 - 若`title`字段为空,则自动使用文章首句填充 - 清洗后剩余10篇长度不足80字符的文章,已予以剔除 ## 数据格式 本数据集采用**JSONL**格式,每一行对应一篇文章: json { "article_id": 1, "source_name": "Egemen Qazaqstan", "url": "https://egemen.kz/article/...", "title": "文章标题", "content": "文章正文内容在此处..." } 字段说明如下: | 字段 | 类型 | 说明 | |---|---|---| | `article_id` | 整数型 | 文章唯一编号 | | `source_name` | 字符串型 | 数据来源网站名称 | | `url` | 字符串型 | 原始文章链接 | | `title` | 字符串型 | 文章标题 | | `content` | 字符串型 | 文章正文 | ## 使用示例 python import json with open("kaz_news_corpus_clean.jsonl", "r", encoding="utf-8") as f: for line in f: article = json.loads(line) print(article["source_name"], article["title"]) python import pandas as pd df = pd.read_json("kaz_news_corpus_clean.jsonl", lines=True) print(df.groupby("source_name")["content"].count()) ## 许可证 本数据集采用**开放数据共同体署名许可协议1.0版(Open Data Commons Attribution License, ODC-BY 1.0)**进行分发。 在标注原作者的前提下,可自由使用、复制及分发本数据集: kurumikz. kaz-news-corpus: Kazakh news corpus. 2026. https://huggingface.co/datasets/kurumikz/kaz-news-corpus 文本内容的版权归原始数据来源所有(egemen.kz、baq.kz、azattyq.org)。本数据集仅用于学术研究目的。 --- *作者:[@kurumikz](https://huggingface.co/kurumikz) · 2026*



