遇见数据集

glossAPI/libduth

收藏
Hugging Face2026-06-02 更新2026-06-14 收录
官方服务:

资源简介:

色雷斯德谟克利特大学机构知识库数据集是该大学官方的数字知识库,由欧盟和希腊共同资助开发。该数据集包含多种类型的学术作品,如硕士论文、本科/文凭论文、博士论文等。该知识库作为色雷斯德谟克利特大学学术和研究产出的集中存档,确保科学知识的长期保存和公共可访问性。记录时间跨度从1983年到2026年,覆盖了超过四十年的学术产出,但数据集主要集中在近年。

The Institutional Repository (IR) of Democritus University of Thrace (DUTH) is the official digital repository of the university, developed with co-funding from the European Union and Greece. The dataset includes multiple types of academic works such as Master’s thesis, Undergraduate / diploma thesis , PhD dissertation. The repository serves as a centralized archive of DUTH’s academic and research production, ensuring long-term preservation and public accessibility of scientific knowledge. The records span from 1983 to 2026, covering more than four decades of academic production.However, the dataset is heavily concentrated in recent years.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/libduth 数据集图片
构建方式
libduth数据集源自色雷斯德谟克利特大学(DUTH)的机构知识库,该知识库由欧盟与希腊共同资助建设,作为大学学术与研究产出的集中归档平台,旨在确保科学知识的长期保存与公共可及。数据集通过OCR技术从公开的PDF档案中提取,收录了自1983年至2026年间涵盖硕士论文、本科/学位论文及博士论文等多种类型的学术作品,尽管时间跨度逾四十年,但数据集中近年来的产出占据主导地位。
使用方法
研究者可直接从HuggingFace平台加载该数据集,利用其丰富的元数据字段进行自然语言处理、学术文献挖掘或科学计量学研究。建议在预处理阶段关注出版日期的缺失值与近年数据的偏重,并针对希腊语文本进行分词或词干化处理。由于OCR引入的噪声可能影响文本质量,使用时可结合语言模型进行文本修复或过滤,以提升下游任务的准确性。
背景与挑战
背景概述
LibDUTH数据集是由色雷斯德谟克利特大学(DUTH)于2024年创建并发布的机构知识库数据集,旨在系统化地收集、保存并提供该大学自1983年至2026年间产生的学术成果,涵盖硕士论文、本科/毕业论文及博士论文等多种类型。该数据集由欧盟和希腊共同资助开发,作为DUTH学术研究生产的中央存档,其核心研究问题聚焦于构建一个结构化的多语言学术语料库(以希腊语为主),以支持自然语言处理、学术文献挖掘及科研评价等领域的深度研究。凭借超过40年的时间跨度和约2.68亿词的庞大体量,LibDUTH为小语种学术资源的数字化利用树立了重要标杆,推动了非英语国家学术数据集在国际NLP社区的可及性与影响力。
当前挑战
LibDUTH面临的核心挑战在于其解决的领域问题:学术文献资源的多语言、多类型异构整合。OCR衍生的元数据存在不完整(如部分出版日期缺失)、不一致(如关键词标注方式多样)及长尾分布(近十年数据高度集中)等问题,这给序列标注、信息抽取及时间序列分析等下游任务带来严峻考验。构建过程中,团队需应对不同年代扫描件的质量参差不齐、希腊语多义性及学科分类的跨文化对齐等难题,同时需严格遵循CC BY-NC-ND 4.0许可协议,在公开访问与知识产权保护之间寻求平衡,确保数据集在非商业研究中的可持续服务能力。
常用场景
经典使用场景
libduth数据集汇聚了德谟克利特大学四十余载的学术瑰宝,涵盖硕士论文、本科毕业论文及博士论文等多种类型,是希腊语学术文本挖掘领域的一座丰碑。其最经典的用途在于构建大规模、多领域的希腊语学术语料库,支持从文本分类、关键词提取到学术趋势分析等自然语言处理任务,为研究希腊语学术写作的历时演变提供了前所未有的数据基础。
解决学术问题
该数据集直面希腊语学术资源分散、数字化程度不足的长期困境,通过结构化元数据(如标题、作者、摘要、关键词及委员会成员等)统一了异构文献的范式。它解决了学术文献自动摘要生成、跨学科交叉研究识别及学者合作网络构建等核心问题,显著推动了低资源语言在学术文本挖掘领域的发展,其开放性更打破了小语种学术研究的数据壁垒,对促进全球学术话语体系的多样性具有深远意义。
实际应用
在实际应用中,libduth数据集可赋能智能学术检索系统,通过元数据字段实现精准的论文检索与推荐;图书馆与机构知识库可借此优化学术成果的管理与长期保存流程。此外,基于摘要与关键词的深度语义分析,该数据集支撑了学术影响力评估、学位论文选题趋势预测等实用功能,为高校科研管理部门的决策提供了数据驱动的洞察,切实提升了学术资源利用的效率与科学性。
数据集最近研究
最新研究方向
libduth数据集的构建旨在系统化整合色雷斯德谟克利特大学四十余年的学术成果,涵盖硕博论文与本科毕业论文,为希腊语学术文本挖掘与自然语言处理提供了稀缺的领域资源。当前前沿研究方向聚焦于利用该数据集进行低资源语言下的学术知识图谱构建、跨学科研究趋势分析以及基于OCR文本的学术影响力评估。随着开放科学与数字人文学科的兴起,该数据集不仅服务于机构知识库的长期保存与可访问性,更成为推动希腊语学术语料库标准化、支持多模态学术文献分析的关键基石,对欧洲非英语国家的学术数据生态建设具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务