遇见数据集

glossAPI/enautilia

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个结构化的数字集合,包含31本希腊商船学院使用的教育教科书,涵盖了航海和工程研究的全部课程,包括物理学、数学、应用数学、通信、雷达、海军气象学、船舶稳定性、海洋法、制冷和空调系统、电机、内燃机、海军电子学、流体力学、货物运输、船舶经济运行等与商船军官培训相关的领域。数据集来源于希腊商船学院的教育门户网站,每本教科书包括标题、全文内容和原始PDF的永久链接。文本内容以现代希腊语书写,包含科学、数学、法律和技术内容,以及大量的表格数据、公式、指数和结构化列表。数据集保留了HTML标记以保持内容的原始结构,特别是数学公式和表格。

This dataset is a structured digital collection of 31 educational textbooks used in the Hellenic Merchant Marine Academies, covering the full curriculum of nautical and engineering studies, including physics, mathematics, applied mathematics, communications, radar, naval meteorology, ship stability, marine law, refrigeration and air-conditioning systems, electrical machines, internal combustion engines, naval electronics, fluid mechanics, cargo transport, ship economic operation, and other domains relevant to merchant marine officer training. The dataset was sourced from the educational portal of the Hellenic Merchant Marine Academies, with each entry including the title, the full body of the book, and a permanent link back to the original PDF. The texts include scientific, mathematical, legal, and technical content in Modern Greek, with extensive tabular data, formulas, indices/exponents, and structured lists. The dataset preserves HTML markup to maintain the original structure of the content, particularly for mathematical formulas and tables.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/enautilia 数据集图片
构建方式
该数据集源自希腊商船学院教育门户网站(https://www.eef.edu.gr/)上公开发布的31本教科书PDF文件,经过系统化的数字提取与结构化处理而成。每本教科书对应数据集中的一条记录,保留了包括标题、完整正文内容以及PDF原始链接在内的元数据信息。为确保技术文档中大量数学公式、科学表格、工程图示和结构化列表的完整性,正文以HTML标记形式存储,表格使用<table>/<tr>/<td>结构,上下标以<sup>/<sub>保留,从而避免了纯文本转换中常见的信息丢失问题。
使用方法
此数据集适用于希腊语自然语言处理任务,尤其在技术、科学与航海领域的文本建模中具有独特价值。研究者可基于此训练希腊语STEM领域专用的语言模型或领域适配的词嵌入,亦可开发面向希腊语科学问答、文本摘要和文档分类的下游工具。由于正文保留了HTML格式的表格与数学标记,该数据集特别适合用于表格内容提取、公式建模以及结构化技术文本的解析研究。数据集以CC BY-NC-ND 4.0许可发布,仅供非商业学术与教育用途。
背景与挑战
背景概述
enautilia数据集由希腊研究团队于近期构建,源自希腊商船学院教育门户(eef.edu.gr)的31本教科书,涵盖物理、数学、海事法、船舶稳定性等完整航海与工程课程。该数据集聚焦于现代希腊语在技术、科学及海事领域的自然语言处理,旨在缓解专业领域语料匮乏的问题,为希腊语STEM与航海教育的语言模型、领域嵌入及下游工具(如问答、摘要、分类)提供高质量资源。其影响力体现在推动非英语、低资源语言的专业NLP研究,为海事教育数字化与智能化奠定基础。
当前挑战
该数据集面临双重挑战:领域问题层面,需处理现代希腊语中高密度的科学、数学与法律文本,尤其是表格、公式(如指数、下标)的结构化表达,这些内容在传统NLP任务中易被丢失或误读。构建过程中,从PDF提取时需保留HTML标记(如<table>、<sup>)以维持结构信息,但会引入代码歧义(如占位符<filename>被误解析为标签);同时,31本教材规模较小,限制了模型泛化能力,需依赖领域适配或数据增强策略以提升实用性。
常用场景
经典使用场景
在现代希腊语自然语言处理研究中,Enautilia数据集因其独树一帜的专业性和领域深度而备受瞩目。该数据集汇集了希腊商船学院使用的31本教科书,内容横跨物理学、数学、航海气象学、船舶稳性、海事法、制冷与空调系统、电机、内燃机、船舶电子、流体力学、货物运输及船舶经济运营等广泛学科。这些文本不仅包含了丰富的科学技术与法律术语,更以现代希腊语为载体,保留了大量表格、公式和结构化数据。因此,该数据集的经典使用场景主要集中在领域自适应的语言模型预训练与微调、面向STEM与海事教育的希腊语自然语言理解任务,以及需要处理复杂表格与数学符号的文本挖掘与信息抽取研究。
解决学术问题
在学术研究层面,Enautilia数据集有效填补了现代希腊语在专业技术与海事教育领域语料资源的空白。长期以来,希腊语自然语言处理研究普遍聚焦于通用文本,导致面向科学、数学及工程领域的语言模型表现不佳,尤其是在处理蕴含大量公式、符号和表格的复杂技术文档时,传统模型往往力不从心。该数据集的提出,使得研究者能够针对性地开展跨领域迁移学习、结构化文档理解、数学表达式建模以及表格内容语义解析等前沿课题。其意义在于推动了希腊语在专业知识传递与高精度问答系统中的能力跃升,为构建更具领域深度的多语言技术文档处理框架奠定了坚实的语料基础。
实际应用
在实际应用层面,Enautilia数据集展现出广泛且深远的价值。海事培训机构与教育科技公司可基于该数据集开发智能化的希腊语教学辅助系统,例如自动生成技术习题、知识点问答机器人以及课程内容摘要工具。海运企业与港口管理部门可利用该数据训练面向船舶操作手册和国际海事法规的智能搜索与合规审查系统,提升作业效率与安全水平。此外,该数据集还可用于构建多语言海事知识图谱,助力跨国航运协作中的信息互通与决策支持。其实际应用不仅局限于教育场景,更延伸至工业维护、应急预案生成以及船舶工程文档自动化处理等核心业务环节。
数据集最近研究
最新研究方向
enautilia数据集聚焦于希腊商船学院航海与工程教育教材的结构化数字整理,涵盖物理、数学、海洋法、雷达技术等31本专业教科书,包含大量现代希腊语科学、数学、法律及技术内容,并以HTML标记保留表格与公式布局。该数据集在自然语言处理领域的前沿研究方向包括:面向现代希腊语STEM与海事领域的语言模型微调与领域适应嵌入构建、希腊语科学问答与摘要生成系统开发、以及结构化表格与数学内容的提取与建模。其发布恰逢希腊海事教育数字化与AI辅助教学工具兴起的热点期,为低资源语言希腊语的技术语料库建设、海事专业知识库构建及跨模态信息检索提供了稀缺的高质量资源,对推动希腊语在航海工程、海洋法学等专业方向的AI应用具有重要战略意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务