遇见数据集

A dataset of Chinese-Mongolian-Tibetan-Uyghur for multi-document summarization

收藏
DataCite Commons2025-04-27 更新2025-04-16 收录
官方服务:

资源简介:

This dataset comprises multi-document summaries in Chinese, Mongolian, Tibetan, and Uyghur, with high alignment between data in each language. Each language includes 1044 clusters of news articles for each language, totaling 6234 news articles. Each article is stored in a TXT file, with the name of the news event and the corresponding cluster summary saved in an XLSX spreadsheet. The multi-document summary data for each language are stored in their respective compressed files.

本数据集包含中文、蒙古语、藏语、维吾尔语的多文档摘要数据,各语言内部的数据对齐度较高。各语言均包含1044个新闻文章簇,总计6234篇新闻文章。单篇新闻文章以TXT文件格式存储,新闻事件名称及对应簇的摘要信息保存于XLSX电子表格中。各语言的多文档摘要数据均存储于各自对应的压缩文件内。

提供机构:
Science Data Bank
创建时间:
2024-05-21
搜集汇总
数据集介绍
A dataset of Chinese-Mongolian-Tibetan-Uyghur for multi-document summarization 数据集图片
背景与挑战
背景概述
该数据集是一个面向多文档摘要任务的中文-蒙古文-藏文-维吾尔文多语言数据集,各语言间数据高度对齐,便于跨语言研究。数据集包含每种语言1044个新闻文章簇,总计6234篇文章,以TXT和XLSX文件格式存储,支持多文档摘要的模型训练与评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务