遇见数据集

Dataset Samples and Templates for: Automating Named Entity Recognition for Indonesian Diplomas via Template-Based Synthetic Data Generation

收藏
Zenodo2026-03-02 更新2026-05-26 收录
官方服务:

资源简介:

This repository contains the supplementary data, anonymized templates, and structural formatting for the manuscript titled "Automating Named Entity Recognition for Indonesian Diplomas via Template-Based Synthetic Data Generation", accepted for publication in Engineering, Technology & Applied Science Research (ETASR). 📌 Repository Objective The objective of this repository is to provide visibility into the data formats, label alignments (BIO/CoNLL tagging schemes), and structural layouts used in our NER training pipeline. This ensures methodological transparency while strictly adhering to Indonesian data privacy laws and protecting proprietary intellectual property. 📂 Repository Content Structure To verify the data formats and directory structures used in our experiments, this repository is strictly organized as follows: data/ : Contains alumni_dummy.csv (sample data for generation) and ijazah_dummy.png (sample image for OCR template extraction). dataset/ : Format samples of the final split datasets (Train/Valid/Test). model/ : Output directory placeholder for fine-tuned models. output/ : Intermediate output placeholder (e.g., full.json). diploma_templates/ : Extracted anonymized template files. requirements_prep.txt : Dependencies for Env Dataset Generation. requirements_model.txt : Dependencies for Env Model Training. README.md : Project documentation. ⚠️ Data Privacy and Code Availability Disclaimer Please note the following constraints as stated in the official manuscript's Data and Code Availability Statement: Proprietary Source Code: The core generation and training pipeline scripts (.ipynb / .py) are considered proprietary intellectual property. They are NOT included in this public repository. Confidential Real-World Data: To comply with the Indonesian Personal Data Protection Law (UU PDP No. 27 of 2022), the raw real-world diploma dataset remains strictly confidential to protect the privacy of the data subjects. 📧 Code Request & Contact The proprietary source code is available strictly for non-commercial research purposes upon reasonable request. To request access, please direct your inquiries to the Corresponding Author as explicitly listed in the final published version of the manuscript in the ETASR journal.

本仓库包含已被《Engineering, Technology & Applied Science Research(ETASR)》期刊接收的论文"基于模板合成数据生成的印尼文凭命名实体识别自动化"的补充数据、匿名化模板与结构化格式文件。 📌 仓库目标 本仓库旨在公开本研究命名实体识别(Named Entity Recognition, NER)训练流程中所采用的数据格式、标签对齐规则(BIO/CoNLL标注体系)与结构化布局,在严格遵循印度尼西亚数据隐私法律、保护专有知识产权的同时,保障研究方法的透明度。 📂 仓库内容结构 为便于核验本实验中所采用的数据格式与目录结构,本仓库严格按照如下组织: data/ : 包含alumni_dummy.csv(生成用示例数据)与ijazah_dummy.png(OCR模板提取用示例图像)。 dataset/ : 最终拆分数据集(训练集/验证集/测试集)的格式示例。 model/ : 微调模型的输出目录占位符。 output/ : 中间输出占位符(如full.json)。 diploma_templates/ : 提取的匿名化模板文件。 requirements_prep.txt : 数据集生成环境依赖项。 requirements_model.txt : 模型训练环境依赖项。 README.md : 项目文档。 ⚠️ 数据隐私与代码可用性声明 请参阅论文官方数据与代码可用性声明中的相关约束: 1. 专有源代码:核心生成与训练流程脚本(.ipynb/.py)属于专有知识产权,未包含于本公开仓库。 2. 机密真实世界数据:为遵守《印度尼西亚个人数据保护法(UU PDP No. 27/2022)》,原始真实世界文凭数据集严格保密,以保护数据主体的隐私。 📧 代码申请与联系方式 专有源代码仅可在合理申请后,用于非商业研究用途。如需申请访问,请向ETASR期刊最终发表版论文中明确列出的通讯作者发送咨询邮件。

提供机构:
Zenodo
创建时间:
2026-03-02
二维码
社区交流群
二维码
科研交流群
商业服务