tugstugi/eduge
收藏资源简介:
--- annotations_creators: - expert-generated language_creators: - expert-generated language: - mn license: - unknown multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - original task_categories: - text-classification task_ids: - multi-class-classification pretty_name: Eduge dataset_info: features: - name: news dtype: string - name: label dtype: class_label: names: '0': урлаг соёл '1': эдийн засаг '2': эрүүл мэнд '3': хууль '4': улс төр '5': спорт '6': технологи '7': боловсрол '8': байгал орчин splits: - name: train num_bytes: 255275842 num_examples: 60528 - name: test num_bytes: 64451731 num_examples: 15133 download_size: 320395067 dataset_size: 319727573 --- # Dataset Card for Eduge ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage:** http://eduge.mn/ - **Repository:** https://github.com/tugstugi/mongolian-nlp - **Paper:** [Needs More Information] - **Leaderboard:** [Needs More Information] - **Point of Contact:** [Needs More Information] ### Dataset Summary Eduge news classification dataset provided by Bolorsoft LLC. Used to train the Eduge.mn production news classifier 75K news articles in 9 categories: урлаг соёл, эдийн засаг, эрүүл мэнд, хууль, улс төр, спорт, технологи, боловсрол and байгал орчин ### Supported Tasks and Leaderboards - `text-classification`: We can transform the above into a 9-class classification task. ### Languages The text in the dataset is in Mongolian ## Dataset Structure ### Data Instances For the `default` configuration: ``` { 'label': 0, # 'урлаг соёл' 'news': 'Шударга өрсөлдөөн, хэрэглэгчийн төлөө газар 2013 оны дөрөвдүгээр сараас эхлэн Монгол киноны ашиг орлогын мэдээллийг олон нийтэд хүргэж байгаа. Ингэснээр Монголын кино үйлдвэрлэгчид улсад ашиг орлогоо шударгаар төлөх, мөн чанартай уран бүтээлийн тоо өсөх боломж бүрдэж байгаа юм.', } ``` ### Data Fields - `news`: a complete news article on a specific topic as a string - `label`: the single class of the topic, among these values: "урлаг соёл" (0), "эдийн засаг" (1), "эрүүл мэнд" (2), "хууль" (3), "улс төр" (4), "спорт" (5), "технологи" (6), "боловсрол" (7), "байгал орчин" (8). ### Data Splits The set of complete articles is split into a training and test set. ## Dataset Creation ### Curation Rationale [Needs More Information] ### Source Data #### Initial Data Collection and Normalization [Needs More Information] #### Who are the source language producers? Eduge.mn which is a combination from shuud.mn, ikon.mn, olloo.mn, news.gogo.mn, montsame.mn, zaluu.com, sonin.mn, medee.mn, bloombergtv.mn. ### Annotations #### Annotation process [Needs More Information] #### Who are the annotators? [Needs More Information] ### Personal and Sensitive Information [Needs More Information] ## Considerations for Using the Data ### Social Impact of Dataset [Needs More Information] ### Discussion of Biases [Needs More Information] ### Other Known Limitations [Needs More Information] ## Additional Information ### Dataset Curators [Needs More Information] ### Licensing Information [Needs More Information] ### Citation Information No citation available for this dataset. ### Contributions Thanks to [@enod](https://github.com/enod) for adding this dataset.
--- 注释创建者: - 专家生成 语言创建者: - 专家生成 语言: - 蒙古语(ISO 639-1代码:mn) 许可协议: - 未知 多语言属性: - 单语言 样本规模区间: - 10000 < n < 100000 源数据集: - 原创数据集 任务类别: - 文本分类 任务子类别: - 多类别分类 易读名称: Eduge 数据集信息: 特征项: - 名称: news 数据类型: 字符串 - 名称: label 数据类型: 分类标签: 类别名称: '0': 文化艺术(урлаг соёл) '1': 经济(эдийн засаг) '2': 医疗卫生(эрүүл мэнд) '3': 法律(хууль) '4': 政治(улс төр) '5': 体育(спорт) '6': 科技(технологи) '7': 教育(боловсрол) '8': 环境(байгал орчин) 划分集: - 名称: 训练集 字节数: 255275842 样本数: 60528 - 名称: 测试集 字节数: 64451731 样本数: 15133 下载大小: 320395067 数据集总大小: 319727573 --- # Eduge 数据集卡片 ## 目录 - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [注释流程](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集维护者](#dataset-curators) - [许可信息](#licensing-information) - [引用信息](#citation-information) - [贡献者](#contributions) ## 数据集描述 - **主页**:http://eduge.mn/ - **代码仓库**:https://github.com/tugstugi/mongolian-nlp - **论文**:[暂无相关信息] - **排行榜**:[暂无相关信息] - **联系方式**:[暂无相关信息] ### 数据集概述 本数据集由Bolorsoft有限责任公司发布,为Eduge新闻分类数据集,用于训练Eduge.mn平台的生产级新闻分类模型。数据集共包含7.5万条新闻文章,涵盖9个分类类别:文化艺术(урлаг соёл)、经济(эдийн засаг)、医疗卫生(эрүүл мэнд)、法律(хууль)、政治(улс төр)、体育(спорт)、科技(технологи)、教育(боловсрол)与环境(байгал орчин)。 ### 支持任务与排行榜 - `文本分类`:可将本数据集转化为9分类任务。 ### 语言 数据集内所有文本均采用蒙古语撰写。 ## 数据集结构 ### 数据实例 针对`default`配置格式: { 'label': 0, # 文化艺术(урлаг соёл) 'news': 'Шударга өрсөлдөөн, хэрэглэгчийн төлөө газар 2013 оны дөрөвдүгээр сараас эхлэн Монгол киноны ашиг орлогын мэдээллийг олон нийтэд хүргэж байгаа. Ингэснээр Монголын кино үйлдвэрлэгчид улсад ашиг орлогоо шударгаар төлөх, мөн чанартай уран бүтээлийн тоо өсөх боломж бүрдэж байгаа юм.', } ### 数据字段 - `news`:代表特定主题的完整新闻文章,数据类型为字符串。 - `label`:代表该新闻主题的唯一分类标签,可选值如下: 0:文化艺术(урлаг соёл)、1:经济(эдийн засаг)、2:医疗卫生(эрүүл мэнд)、3:法律(хууль)、4:政治(улс төр)、5:体育(спорт)、6:科技(технологи)、7:教育(боловсрол)、8:环境(байгал орчин)。 ### 数据划分 完整的新闻文章集合被划分为训练集与测试集。 ## 数据集构建 ### 构建初衷 [暂无相关信息] ### 源数据 #### 初始数据收集与标准化 [暂无相关信息] #### 源语言文本的生产者 本数据集的源文本来自Eduge.mn平台,该平台整合了shuud.mn、ikon.mn、olloo.mn、news.gogo.mn、montsame.mn、zaluu.com、sonin.mn、medee.mn、bloombergtv.mn共9个新闻平台的内容。 ### 注释流程 #### 注释流程 [暂无相关信息] #### 注释人员 [暂无相关信息] ### 个人与敏感信息 [暂无相关信息] ## 数据使用注意事项 ### 数据集的社会影响 [暂无相关信息] ### 偏差讨论 [暂无相关信息] ### 其他已知局限性 [暂无相关信息] ## 附加信息 ### 数据集维护者 [暂无相关信息] ### 许可信息 [暂无相关信息] ### 引用信息 本数据集暂无公开可用的引用文献。 ### 贡献者 感谢[@enod](https://github.com/enod)为本数据集的收录提供支持。
数据集卡片 for Eduge
数据集描述
数据集摘要
Eduge新闻分类数据集由Bolorsoft LLC提供,用于训练Eduge.mn生产新闻分类器。包含75K篇新闻文章,分为9个类别:文化艺术、经济、健康、法律、政治、体育、技术、教育和环境。
支持的任务和排行榜
text-classification:可以将其转换为9类分类任务。
语言
数据集中的文本为蒙古语。
数据集结构
数据实例
对于default配置:
json
{
label: 0, # 文化艺术
news: Шударга өрсөлдөөн, хэрэглэгчийн төлөө газар 2013 оны дөрөвдүгээр сараас эхлэн Монгол киноны ашиг орлогын мэдээллийг олон нийтэд хүргэж байгаа. Ингэснээр Монголын кино үйлдвэрлэгчид улсад ашиг орлогоо шударгаар төлөх, мөн чанартай уран бүтээлийн тоо өсөх боломж бүрдэж байгаа юм.,
}
数据字段
news:特定主题的完整新闻文章,类型为字符串。label:主题的单一类别,取值范围为:"文化艺术" (0), "经济" (1), "健康" (2), "法律" (3), "政治" (4), "体育" (5), "技术" (6), "教育" (7), "环境" (8)。
数据分割
完整文章集被分为训练集和测试集。
数据集创建
数据来源
初始数据收集和规范化
[需要更多信息]
源语言生产者是谁?
Eduge.mn,结合了shuud.mn, ikon.mn, olloo.mn, news.gogo.mn, montsame.mn, zaluu.com, sonin.mn, medee.mn, bloombergtv.mn。
注释
注释过程
[需要更多信息]
注释者是谁?
[需要更多信息]
个人和敏感信息
[需要更多信息]
使用数据的注意事项
数据集的社会影响
[需要更多信息]
偏见的讨论
[需要更多信息]
其他已知限制
[需要更多信息]
附加信息
数据集策展人
[需要更多信息]
许可信息
[需要更多信息]
引用信息
该数据集没有可用的引用。
贡献
感谢@enod添加此数据集。




