遇见数据集

glossAPI/e-nautilia

收藏
Hugging Face2026-06-09 更新2026-05-10 收录
官方服务:

资源简介:

该数据集是一个结构化数字集合,包含31本希腊商船学院使用的教育教科书(Εκπαιδευτικά Κείμενα)。这些教科书涵盖了航海和工程研究的全部课程,包括物理学、数学、应用数学、通信、雷达、海军气象学、船舶稳定性、海洋法、制冷和空调系统、电机、内燃机、海军电子学、流体力学、货物运输、船舶经济运行以及其他与商船军官培训相关的领域。数据集来源于希腊商船学院的教育门户网站(https://www.eef.edu.gr/),并从原始PDF中提取。每个条目对应一本教科书,包括标题、书籍的完整正文以及指向原始PDF的永久链接。文本以现代希腊语编写,包含大量科学、数学、法律和技术内容,并保留了HTML标记以保持结构和格式。

This dataset is a structured digital collection of 31 educational textbooks (Εκπαιδευτικά Κείμενα) used in the Hellenic Merchant Marine Academies (Ακαδημίες Εμπορικού Ναυτικού). The textbooks cover the full curriculum of nautical and engineering studies, including physics, mathematics, applied mathematics, communications, radar, naval meteorology, ship stability, marine law, refrigeration and air-conditioning systems, electrical machines, internal combustion engines, naval electronics, fluid mechanics, cargo transport, ship economic operation, and other domains relevant to merchant marine officer training. The dataset was sourced from the educational portal of the Hellenic Merchant Marine Academies ([https://www.eef.edu.gr/](https://www.eef.edu.gr/)) and extracted from the original PDFs. Each entry corresponds to a single textbook and includes the title, the full body of the book, and a permanent link back to the original PDF. The texts include scientific, mathematical, legal, and technical content in Modern Greek, with extensive tabular data, formulas, indices/exponents, and structured lists.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/e-nautilia 数据集图片
构建方式
该数据集源自希腊商船学院教育门户网站,系统性地采集了31本涵盖航海与工程学科核心课程的教科书PDF文档。通过自动化提取流程,将原始PDF中的文本内容、表格结构及数学公式转化为保留HTML标记的结构化数据,每条记录包含标题、完整正文及原始PDF永久链接。文本采用现代希腊语书写,涉及物理学、数学、航海气象学、船舶稳定性、海洋法等多元领域,确保了技术术语与公式符号的完整性与可解析性。
特点
数据集最显著的特征在于对技术性内容的高度保真处理,通过保留<table>、<sup>、<sub>等HTML标签,完整呈现了表格数据、指数、上下标等关键科学符号。其内容密度极高,涵盖114万余词与265万以上WordPiece词元,为现代希腊语在STEM教育与海事专业领域的自然语言处理研究提供了稀缺的领域语料。部分原始PDF中出现的尖括号占位符被忠实保留,体现了对数据源质量的严谨态度。
使用方法
本数据集适用于面向现代希腊语的技术文本自然语言处理任务,尤其适合构建领域自适应语言模型、词嵌入或训练科学问答与摘要系统。研究者可直接加载JSON格式条目,利用保留的HTML标记解析表格与公式信息,用于结构化内容抽取。推荐与希腊语预训练模型(如nlpaueb/bert-base-greek-uncased-v1)结合使用,以充分挖掘其在海事工程教育与学术研究中的潜在价值。
背景与挑战
背景概述
该数据集名为e-nautilia,由希腊团队于近期构建,聚焦于希腊商船海运学院使用的31本现代希腊语教材。数据集源自希腊商船海运学院教育门户(eef.edu.gr),涵盖物理、数学、航海气象、船舶稳定性、海事法、制冷与空调系统、电机、内燃机、电子学、流体力学、货物运输及船舶经济运行等完整课程体系。核心研究问题在于为现代希腊语在技术、科学与海事领域的自然语言处理任务提供高质量领域语料,尤其在STEM教育及航海工程注册方面具有重要价值。通过保留HTML标记的表格与数学公式,该数据集对希腊语言模型构建、领域自适应嵌入学习及科学问答系统等下游任务产生了显著推动力。
当前挑战
该数据集所解决的领域问题挑战在于:现代希腊语技术文本语料的稀缺性,特别是涵盖数学公式、工程图表及法律条款的结构化领域内容,使得通用NLP模型在航海科学、海事工程等专门领域的表现受限。构建过程中遇到的挑战包括:原始PDF教材中高密度的公式与表格导致纯文本提取时结构信息严重损失,需保留HTML标记以维持内容完整性;部分教材中尖括号占位符(如<filename>)被解析器误判为HTML标签,需要忠实反映源文件而不做静默修正;此外,希腊语特有的科学符号与上下标表示法(如指数、单位)要求精细化处理,确保数据集的可靠性与下游任务的兼容性。
常用场景
经典使用场景
在自然语言处理与教育技术领域,e-nautilia数据集因其高度专业化的希腊语航海与工程教材内容,成为训练领域自适应语言模型与词嵌入的经典资源。研究者可利用其涵盖物理、数学、船舶稳性、海洋法律等多学科的文本,构建面向STEM教育的语言理解系统,尤其适用于希腊语技术文本中的表格解析、公式提取与结构化知识建模,为航海教育领域的智能化教学提供基础语料。
实际应用
在实际应用中,e-nautilia数据集可赋能希腊商船学院的数字化教学改革,辅助开发智能教材解析工具与自适应学习平台。通过其保留的HTML结构化信息,能够训练自动提取船舶稳定性计算表格或雷达通信规范的系统,提升学生查阅与理解复杂技术资料效率。同时,该数据集还支持海事法规合规性审核的自动化,助力航运企业快速检索并解析希腊语文档中的关键条款与技术参数。
衍生相关工作
基于该数据集衍生的经典工作包括训练希腊语BERT模型的领域适配版本,如基于nlpaueb/bert-base-greek-uncased-v1在海事教材上微调得到的专业语言表征,以及针对数学公式与表格的神经符号推理模型。此外,研究者已利用其构建希腊语海事科技问答数据集与线性代数问题生成系统,并开发了面向船舶工程教科书的跨模态检索框架,这些工作共同拓展了低资源语言在垂直技术领域的NLP研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务