GigaWord|自然语言处理数据集|文本摘要数据集
收藏
- GigaWord数据集首次发表,包含超过10亿个中文词汇,标志着大规模中文文本数据集的诞生。
- GigaWord数据集首次应用于自然语言处理研究,特别是在中文信息检索和机器翻译领域,显著提升了模型的性能。
- GigaWord数据集的扩展版本发布,增加了更多的语料和多样性,进一步推动了中文自然语言处理技术的发展。
- GigaWord数据集被广泛应用于深度学习模型训练,特别是在神经机器翻译和文本分类任务中,成为重要的基准数据集。
- GigaWord数据集的最新版本发布,引入了更多的领域和语种,继续为中文自然语言处理研究提供丰富的资源。
- 1Gigaword Corpus: Third EditionLinguistic Data Consortium (LDC) · 2011年
- 2A Neural Attention Model for Abstractive Sentence SummarizationUniversity of Cambridge · 2015年
- 3Deep Recurrent Generative Decoder for Abstractive Text SummarizationUniversity of Science and Technology of China · 2017年
- 4A Survey on Neural Network-Based Summarization MethodsUniversity of Edinburgh · 2018年
- 5Multi-News: A Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical ModelNew York University · 2019年
中国高分辨率高质量PM2.5数据集(2000-2023)
ChinaHighPM2.5数据集是中国高分辨率高质量近地表空气污染物数据集(ChinaHighAirPollutants, CHAP)中PM2.5数据集。该数据集利用人工智能技术,使用模式资料填补了卫星MODIS MAIAC AOD产品的空间缺失值,结合地基观测、大气再分析和排放清单等大数据生产得到2000年至今全国无缝隙地面PM2.5数据。数据十折交叉验证决定系数R2为0.92,均方根误差RMSE为10.76 µg/m3。主要范围为整个中国地区,空间分辨率为1 km,时间分辨率为日、月、年,单位为µg/m3。注意:该数据集持续更新,如需要更多数据,请发邮件联系作者(weijing_rs@163.com; weijing@umd.edu)。 数据文件中包含NC转GeoTiff的四种代码(Python、Matlab、IDL和R语言)nc2geotiff codes。
国家青藏高原科学数据中心 收录
Traditional-Chinese-Medicine-Dataset-SFT
该数据集是一个高质量的中医数据集,主要由非网络来源的内部数据构成,包含约1GB的中医各个领域临床案例、名家典籍、医学百科、名词解释等优质内容。数据集99%为简体中文内容,质量优异,信息密度可观。数据集适用于预训练或继续预训练用途,未来将继续发布针对SFT/IFT的多轮对话和问答数据集。数据集可以独立使用,但建议先使用配套的预训练数据集对模型进行继续预训练后,再使用该数据集进行进一步的指令微调。数据集还包含一定比例的中文常识、中文多轮对话数据以及古文/文言文<->现代文翻译数据,以避免灾难性遗忘并加强模型表现。
huggingface 收录
ImageNet-1K(ILSVRC2012)
ImageNet-1K(ILSVRC2012)是一个大规模的图像分类数据集,包含1000个类别的图像,用于训练和验证图像分类模型。
github 收录
HazyDet
HazyDet是由解放军工程大学等机构创建的一个大规模数据集,专门用于雾霾场景下的无人机视角物体检测。该数据集包含383,000个真实世界实例,收集自自然雾霾环境和正常场景中人工添加的雾霾效果,以模拟恶劣天气条件。数据集的创建过程结合了深度估计和大气散射模型,确保了数据的真实性和多样性。HazyDet主要应用于无人机在恶劣天气条件下的物体检测,旨在提高无人机在复杂环境中的感知能力。
arXiv 收录
FER2013
FER2013数据集是一个广泛用于面部表情识别领域的数据集,包含28,709个训练样本和7,178个测试样本。图像属性为48x48像素,标签包括愤怒、厌恶、恐惧、快乐、悲伤、惊讶和中性。
github 收录