遇见数据集

alwaysgood/ko-news-split-512

收藏
Hugging Face2026-03-23 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - ko license: cc-by-nc-4.0 tags: - korean - news - economics - finance - encyclopedia - text-corpus - pre-training pretty_name: Korean News & Terms Corpus (512-token chunks) size_categories: - 100K<n<1M task_categories: - text-generation - fill-mask configs: - config_name: default data_files: - split: train path: "*.jsonl" --- # Korean News & Terms Corpus (512-token chunks) 한국어 뉴스 기사 및 백과사전/용어사전 데이터를 Qwen3-4B 토크나이저 기준 **512 토큰 이하**로 분할한 사전학습/미세조정용 코퍼스입니다. ## 📊 Dataset Statistics | File | Source | Chunks | Size | Content Field | |---|---|---:|---:|---| | `hk.jsonl` | 한국경제 뉴스 | 82,533 | 122.7 MB | `content` | | `mk.jsonl` | 매일경제 뉴스 | 18,610 | 27.8 MB | `content` | | `naver_terms_clean.jsonl` | 네이버 지식백과 용어사전 | 25,699 | 28.9 MB | `text` | | `korea-bank-700-cleaned.jsonl` | 한국은행 경제용어 700선 | 796 | 1.0 MB | `text` | | **Total** | | **127,638** | **180.4 MB** | | ## 🗂️ Data Sources ### 한국경제 (hk.jsonl) - 경제, 금융, 산업, 국제 등 다양한 분야의 뉴스 기사 - 카테고리: 반도체, 자동차/배터리, 은행, 보험, 거시경제, 세금, 부동산, 암호화폐/핀테크, 조선/해운 등 30+ 카테고리 ### 매일경제 (mk.jsonl) - 매일경제 뉴스 기사 ### 네이버 지식백과 (naver_terms_clean.jsonl) - 학문명백과, 시사상식사전, 시사경제용어사전, 매일경제용어사전, 지식경제용어사전 - 학술 및 경제 용어에 대한 체계적인 설명 ### 한국은행 경제용어 700선 (korea-bank-700-cleaned.jsonl) - 한국은행에서 발간한 경제용어 해설집 - 카테고리: 통화정책, 거시경제, 금융시장, 금융기관, 금융규제, 국제금융, 재정, 지급결제 등 ## ✂️ Chunking Strategy - **Tokenizer**: Qwen/Qwen3-4B - **Max content tokens**: 480 (약 32 토큰은 프롬프트/특수 토큰용으로 예약) - **분할 단위**: 문단(`\n`) 기준 → 문단이 480 토큰 초과 시 문장 단위로 재분할 - **메타데이터**: 각 청크에 `chunk_id`, `total_chunks`, `original_char_count` 필드 포함 ## 📝 Schema ### hk.jsonl / mk.jsonl ```json { "title": "기사 제목", "content": "기사 본문 (분할된 청크)", "date": "YYYY-MM-DD", "author": "기자명", "category": "카테고리", "url": "원본 URL", "site_name": "매체명", "language": "ko", "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 3, "crawled_at": "2025-...", "method": "..." } ``` ### naver_terms_clean.jsonl ```json { "text": "용어 설명 본문 (분할된 청크)", "meta": { "source": "naver_terms", "category": "학문명백과", "title": "항목명", "url": "원본 URL", "chunk": 0, "total_chunks": 12 }, "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 3 } ``` ### korea-bank-700-cleaned.jsonl ```json { "term": "경제용어", "text": "용어 해설 (분할된 청크)", "categories": ["통화정책", "거시경제"], "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 2 } ``` ## 🚀 Usage ```python from datasets import load_dataset ds = load_dataset("alwaysgood/ko-news-split-512") print(ds) ``` 개별 파일 로드: ```python from datasets import load_dataset hk = load_dataset("json", data_files="hf://datasets/alwaysgood/ko-news-split-512/hk.jsonl") naver = load_dataset("json", data_files="hf://datasets/alwaysgood/ko-news-split-512/naver_terms_clean.jsonl") ``` ## ⚠️ License & Disclaimer 이 데이터셋은 연구 및 교육 목적으로 수집·가공되었습니다. 원본 데이터의 저작권은 각 원저작자(한국경제, 매일경제, 네이버, 한국은행)에게 있습니다. 상업적 이용 시 원저작자의 이용 약관을 확인해 주세요.

--- 语言:韩语 许可证:CC BY-NC 4.0 标签:韩语、新闻、经济、金融、百科、文本语料库、预训练 美观名称:韩语新闻与术语语料库(512 Token块) 规模类别:10万 < 样本数 < 100万 任务类别:文本生成、掩码填充 配置项: - 配置名称:default 数据文件: - 拆分:train 路径:"*.jsonl" --- # 韩语新闻与术语语料库(512 Token块) 本数据集基于Qwen3-4B分词器,将韩语新闻稿件及百科/术语词典数据分割为**512 Token以内**的块,用于预训练与微调的语料库。 ## 📊 数据集统计 | 文件 | 来源 | 块数 | 大小 | 内容字段 | |---|---|---:|---:|---| | `hk.jsonl` | 韩国经济新闻 | 82,533 | 122.7 MB | `content` | | `mk.jsonl` | 每日经济新闻 | 18,610 | 27.8 MB | `content` | | `naver_terms_clean.jsonl` | Naver知识百科术语词典 | 25,699 | 28.9 MB | `text` | | `korea-bank-700-cleaned.jsonl` | 韩国银行经济术语700选 | 796 | 1.0 MB | `text` | | **总计** | | **127,638** | **180.4 MB** | | ## 🗂️ 数据来源 ### 韩国经济新闻(hk.jsonl) 涵盖经济、金融、产业、国际等多领域新闻稿件,包含半导体、汽车/电池、银行、保险、宏观经济、税收、房地产、加密货币/金融科技、造船/海运等30余个分类。 ### 每日经济新闻(mk.jsonl) 每日经济新闻稿件。 ### Naver知识百科(naver_terms_clean.jsonl) 包含学术百科、时事常识词典、时事经济术语词典、每日经济术语词典、知识经济术语词典,提供学术与经济术语的系统化解释。 ### 韩国银行经济术语700选(korea-bank-700-cleaned.jsonl) 韩国银行出版的经济术语解说集,分类涵盖货币政策、宏观经济、金融市场、金融机构、金融监管、国际金融、财政、支付结算等。 ## ✂️ 分块策略 - **分词器**:Qwen/Qwen3-4B - **最大内容Token数**:480(约32 Token预留用于提示词/特殊Token) - **分割单位**:以段落(` `)为基准,若段落超过480 Token则按句子重新分割 - **元数据**:每个块包含`chunk_id`、`total_chunks`、`original_char_count`字段 ## 📝 数据格式 ### hk.jsonl / mk.jsonl json { "title": "文章标题", "content": "拆分后的文章正文", "date": "YYYY-MM-DD", "author": "记者姓名", "category": "分类标签", "url": "原始URL", "site_name": "媒体名称", "language": "ko", "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 3, "crawled_at": "2025-...", "method": "..." } ### naver_terms_clean.jsonl json { "text": "拆分后的术语解释正文", "meta": { "source": "naver_terms", "category": "学术百科", "title": "条目名称", "url": "原始URL", "chunk": 0, "total_chunks": 12 }, "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 3 } ### korea-bank-700-cleaned.jsonl json { "term": "经济术语", "text": "拆分后的术语解说", "categories": ["货币政策", "宏观经济"], "char_count": 1234, "original_char_count": 5678, "chunk_id": 0, "total_chunks": 2 } ## 🚀 使用方式 python from datasets import load_dataset ds = load_dataset("alwaysgood/ko-news-split-512") print(ds) 单独加载文件: python from datasets import load_dataset hk = load_dataset("json", data_files="hf://datasets/alwaysgood/ko-news-split-512/hk.jsonl") naver = load_dataset("json", data_files="hf://datasets/alwaysgood/ko-news-split-512/naver_terms_clean.jsonl") ## ⚠️ 许可证与免责声明 本数据集仅用于研究与教育目的收集与加工,原始数据的版权归各原版权方(韩国经济新闻、每日经济新闻、Naver、韩国银行)所有。商业使用前请确认原版权方的使用条款。

提供机构:
alwaysgood
二维码
社区交流群
二维码
科研交流群
商业服务