phonsobon/khmer-artical-summaries
收藏资源简介:
该数据集包含高棉语新闻文章及其人工撰写的摘要,旨在支持高棉语自然语言处理研究,特别是抽象和抽取式摘要任务。高棉语在NLP研究中仍是一种资源不足的语言,因此该数据集可用于训练和评估高棉语摘要模型。
--- ### 数据集元信息 - 支持语言:高棉语(km)、英语(en) - 许可协议:知识共享署名4.0(Creative Commons Attribution 4.0,CC BY 4.0) - 任务类别:摘要生成(Summarization)、文本生成(Text Generation) - 标签:高棉语、柬埔寨、新闻、文章、摘要生成、自然语言处理(Natural Language Processing, NLP) - 友好名称:高棉语文章摘要数据集 - 样本规模:1000 < 样本量 < 10000 --- # 📰 高棉语文章摘要数据集 本数据集收录配对的高棉语新闻文章与对应摘要,旨在助力高棉语自然语言处理(Natural Language Processing, NLP)研究,尤其是抽象式(Abstractive)与抽取式(Extractive)摘要生成任务。 ## 数据集说明 | 字段 | 详情 | |---------------|--------| | **语言** | 高棉语(ភាសាខ្មែរ) | | **任务** | 文本摘要生成 | | **许可协议** | CC BY 4.0 | | **维护者** | [phonsobon](https://huggingface.co/phonsobon) | ### 数据集概览 本数据集包含高棉语新闻文章及人工撰写的摘要,可用于训练与评估高棉语摘要生成模型——高棉语仍是自然语言处理研究中资源匮乏的语种之一。 ## 数据集结构 ### 数据字段 | 列名 | 类型 | 描述 | |--------|------|-------------| | `article` | `string` | 完整的高棉语新闻文章文本 | | `summary` | `string` | 该文章的人工撰写摘要 | > ⚠️ 列名可能存在变动,请根据实际使用的JSON键值对更新此表格。 ### 数据划分 | 划分集 | 规模 | |-------|------| | 训练集 | — | ## 使用方法 python from datasets import load_dataset dataset = load_dataset("phonsobon/khmer-artical-summaries") print(dataset["train"][0]) ## 数据来源与采集 - 文章源自高棉语新闻媒体平台 - 摘要由人工撰写或整理 ## 预期用途 - 训练高棉语摘要生成模型 - 在低资源语种上对多语言自然语言处理模型进行基准测试 - 东南亚语言处理相关研究 ## 引用说明 若您使用本数据集,请引用以下文献: @dataset{phonsobon_khmer_summaries, author = {phonsobon}, title = {Khmer Article Summaries}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/phonsobon/khmer-artical-summaries} } ## 联系方式 如有疑问或贡献想法,请前往[数据集页面](https://huggingface.co/datasets/phonsobon/khmer-artical-summaries/discussions)发起讨论。




