遇见数据集

glossAPI/psepheda

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

Psepheda(ΨΗΦΙΔΑ)数据集是希腊马其顿大学机构知识库的清理后全文快照,包含14,303条记录。每条记录对应知识库中的一个学术项目,主要包括硕士论文和博士论文,以及学士项目、乐谱和历史档案文件。数据集语言以现代希腊语为主,包含少量英语学术内容。内容涵盖经济学、工商管理、应用信息学、会计与金融、音乐科学、教育和国际/欧洲研究等领域,来自120个不同的知识库集合。时间覆盖范围约为1900年至2026年,主要集中在2005年至2025年。数据集提供完整的书目元数据和从PDF提取的Markdown格式全文,经过清理移除了低质量提取和纯英文文档。数据集具有复杂的许可条款,每条记录有独立的权利声明,用户需根据具体使用场景过滤记录。

This dataset is a cleaned, full-text snapshot of ΨΗΦΙΔΑ (Psepheda), the institutional repository and digital library of the University of Macedonia, containing 14,303 records. Each row corresponds to one repository item, predominantly Masters theses and PhD dissertations, along with bachelors projects, musical scores, and historical archival documents. The primary language is Modern Greek, with a minority of English-language academic content. The corpus covers fields such as economics, business administration, applied informatics, accounting & finance, music science, education, and international/European studies, sourced from 120 distinct repository collections. The issue-date coverage spans approximately 1900–2026, heavily concentrated in 2005–2025. The dataset includes comprehensive bibliographic metadata and full text extracted from PDFs to Markdown, cleaned to remove low-quality extractions and English-only documents. Licensing is mixed and per-item, with users advised to filter by the rights field for specific use cases.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/psepheda 数据集图片
构建方式
Psepheda(ΨΗΦΙΔΑ)数据集源自马其顿大学的机构知识库,涵盖14,303条以现代希腊语为主的学术记录,包含硕士论文、博士论文、本科项目及历史档案。数据集的构建历经精细的清洗流程:从原始提取的14,413项中剔除98项因视觉提取器无法处理而生成多语言乱码的伪造文本,并移除12篇纯英文文档,最终保留14,303条高质量记录。每行数据由规范的书目元数据和从PDF中提取的全文本Markdown内容组成,元数据字段涵盖标题、摘要、作者、导师、发布日期等20个维度,确保数据结构的完整性与可追溯性。
特点
该数据集的核心特色在于其深厚的学术语境与领域专精性,集中反映马其顿大学在经济学、工商管理、应用信息学、音乐科学等学科的希腊语学术研究。数据集覆盖约1900年至2026年的发表时间跨度,其中2005至2025年间的电子自存储作品构成主体,包含120个不同馆藏集合。全文本内容长度从数千字符至百万字符不等,总计约3.76亿词,适宜长文本建模。此外,数据集附有逐项权限声明,涵盖CC系列开放许可及保留所有权利等多种类型,为不同使用场景提供灵活的合规选择。
使用方法
此数据集适用于希腊语自然语言处理的多项任务,包括文本生成与掩码填充等预训练场景,特别针对学术与科技领域的语言模型自适应、术语提取及检索增强生成。用户可通过HuggingFace平台加载Parquet格式数据,利用'metadata'和'content'字段进行模型训练或评估。使用时需注意每项记录的'rights'字段以确定版权许可,建议根据需求筛选CC0或CC BY等开放许可的子集用于衍生工作,并保留对原始作者与马其顿大学的归属引用。
背景与挑战
背景概述
Psepheda(ΨΗΦΙΔΑ)数据集是马其顿大学机构知识库的清洗后全文快照,由该校图书馆与信息中心于2025年创建,覆盖约1900至2026年间逾1.4万条记录,核心集中于2005至2025年强制电子提交的硕博士学位论文。该数据集以现代希腊语为主,兼有少量英语及斯拉夫/巴尔干研究内容,源自DSpace平台,包含经济学、工商管理、应用信息学、音乐科学等120个学科类别的学术作品。作为希腊语学术文本的重要资源,Psepheda为自然语言处理领域提供了罕见的高质量希腊语科学语料,尤其适用于学术语域的语言模型预训练、术语提取及长文档建模,填补了现代希腊语在机构知识库层面的数据空白,对推动低资源语言的学术NLP研究具有里程碑意义。
当前挑战
Psepheda数据集面临的挑战体现在领域问题与构建过程两个层面。在领域问题方面,数据集所聚焦的希腊语学术文本生成与理解任务长期受限于高质量语料匮乏,尤其是覆盖多学科的长文档建模与术语抽取面临标注资源稀缺与语言特异性难题,需模型能够处理希腊语复合词形态、学术修辞结构及跨领域知识迁移。在构建过程中,技术挑战尤为严峻:原始PDF通过基于大语言模型的视觉抽取后,旧扫描件、乐谱及手写内容产生严重幻觉(如混入CJK、阿拉伯语等乱码),需设计多信号联合过滤规则剔除0.68%的异常行;同时需在保留斯拉夫西里尔文字符合法内容的前提下,精准识别并移除0.08%的纯英文文档以维护希腊语语料纯净性。此外,混合许可协议(44.8%记录无开放许可)加剧了数据合规使用的复杂性,要求下游用户逐条解析授权字段,对大规模模型训练构成法律与伦理挑战。
常用场景
经典使用场景
Psepheda数据集汇聚了马其顿大学机构知识库中逾一万四千篇学术文献,涵盖硕博士论文、本科毕设及历史档案,是希腊语NLP学术语料库的典范之作。其最经典的用途在于为希腊语预训练语言模型提供高质量的学术领域文本,支撑从经济学、工商管理到应用信息学、音乐科学等多学科的语义建模。该数据集保存了DSpace系统的完整元数据与PDF全文,支持文本生成、掩码填充等核心任务,尤其适用于在希腊语学术语境下进行长文档建模和细粒度知识抽取。
解决学术问题
Psepheda解决了希腊语NLP研究中缺乏大规模、领域聚焦的学术语料这一长期瓶颈。过去,希腊语自然语言处理主要依赖新闻或通用网络文本,难以捕捉研究生层次的学术词汇、论证结构与跨学科术语。该数据集提供了近七亿七千万子词的高质量学术内容,使研究者能够训练领域自适应的词嵌入和检索增强生成系统,显著提升希腊语学术问答、摘要生成和知识检索的精确度。其影响在于为现代希腊语的科学计算语言学研究奠定了可复现的基础,填补了小语种学术NLP的关键空白。
衍生相关工作
围绕Psepheda衍生出一系列经典工作,包括基于该语料库微调的希腊语学术BERT模型(如Greek-Academic-BERT),以及面向长文档的分层Transformer变体,用以处理论文中数十万字符的上下文依赖。研究者还利用其丰富的元数据(如导师、院系信息)开发了学术影响力分析工具,自动提取希腊语学位论文中的引用网络和研究趋势。这些工作共同推动了低资源语言在学术信息学领域的深度学习研究,为其他小语种的机构知识库NLP应用提供了可复制的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务