遇见数据集

SEACrowd/indowiki

收藏
Hugging Face2024-06-24 更新2024-06-29 收录
官方服务:

资源简介:

IndoWiki是一个从WikiData中提取的知识图谱数据集,并与印度尼西亚语维基百科对齐作为其语料库。

IndoWiki是一个从WikiData中提取的知识图谱数据集,并与印度尼西亚语维基百科对齐作为其语料库。

提供机构:
SEACrowd
原始信息汇总

Indowiki 数据集概述

数据集简介

IndoWiki 是一个知识图谱数据集,源自 WikiData 并与印度尼西亚语的 Wikipedia 语料库对齐。

语言

  • 印度尼西亚语 (ind)

支持的任务

  • 无具体任务描述

数据集使用

使用 datasets

python from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/indowiki", trust_remote_code=True)

使用 seacrowd

python import seacrowd as sc

使用默认配置加载数据集

dset = sc.load_dataset("indowiki", schema="seacrowd")

查看数据集的所有可用子集(配置名称)

print(sc.available_config_names("indowiki"))

使用特定配置加载数据集

dset = sc.load_dataset_by_config_name(config_name="<config_name>")

数据集主页

https://github.com/IgoRamli/IndoWiki

数据集版本

  • 源版本: 1.0.0
  • SEACrowd 版本: 2024.06.20

数据集许可证

MIT (mit)

引用

bibtex @INPROCEEDINGS{ramli2022indokepler, author={Ramli, Inigo and Krisnadhi, Adila Alfa and Prasojo, Radityo Eko}, booktitle={2022 7th International Workshop on Big Data and Information Security (IWBIS)}, title={IndoKEPLER, IndoWiki, and IndoLAMA: A Knowledge-enhanced Language Model, Dataset, and Benchmark for the Indonesian Language}, year={2022}, volume={}, number={}, pages={19-26}, doi={10.1109/IWBIS56557.2022.9924844} }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/indowiki 数据集图片
构建方式
IndoWiki数据集是一个以维基数据(WikiData)为源、以印度尼西亚语维基百科(Wikipedia Bahasa Indonesia)为语料库对齐构建的知识图谱数据集。其构建过程首先从WikiData中抽取结构化知识,包括实体、属性及其相互关系,随后将这些知识节点与印尼语维基百科中的文本内容进行语义对齐,形成统一的图结构数据。这一方法确保了知识图谱的语义丰富性与语言本地化,使得数据集能够有效捕捉印尼语语境下的实体关联与事实信息。
使用方法
使用IndoWiki数据集时,可借助HuggingFace的datasets库直接加载:通过load_dataset('SEACrowd/indowiki', trust_remote_code=True)即可获取数据。同时,SEACrowd库提供了更灵活的接口,支持按特定配置(config)加载子集,例如使用sc.load_dataset_by_config_name(config_name='<config_name>')。数据集采用MIT许可证,可自由用于学术与商业研究,其引用格式已在相关论文中明确给出。
背景与挑战
背景概述
IndoWiki是由Igo Ramli、Adila Alfa Krisnadhi和Radityo Eko Prasojo于2022年创建的知识图谱数据集,其研究背景植根于印尼语自然语言处理领域的知识增强需求。该数据集源自WikiData,并以印尼语维基百科为语料库进行对齐,旨在为印尼语提供结构化的知识表示。作为IndoKEPLER项目的一部分,IndoWiki与IndoLAMA基准共同推动了知识增强语言模型在低资源语言中的发展,其影响力体现在为东南亚语言研究社区SEACrowd所采纳,并成为评估印尼语知识推理能力的关键资源。该数据集的发布填补了印尼语知识图谱资源的空白,促进了跨语言知识迁移和语义理解的研究。
当前挑战
IndoWiki所面临的挑战首先体现在领域问题上:印尼语作为低资源语言,其知识图谱构建面临数据稀疏性和覆盖不全的难题,如何从有限的维基百科语料中提取高质量的三元组关系以支持知识增强语言模型,是该数据集需要解决的核心任务。其次,构建过程中遭遇多重困难,包括从WikiData中筛选并过滤与印尼语相关的实体和关系时,需处理多语言歧义和不一致性;对齐印尼语维基百科文本与结构化知识时,面临语料库规模较小且噪声较多的困境;以及确保知识图谱的时效性和准确性,因为维基百科内容持续更新,而数据集版本需保持稳定。
常用场景
经典使用场景
IndoWiki 是一个源自 Wikidata 并基于印尼语维基百科语料对齐构建的知识图谱数据集。在自然语言处理与知识工程交叉领域中,它被广泛用于知识增强的语言模型预训练与微调,尤其适用于印尼语场景下的实体链接、关系抽取和知识图谱补全任务。研究者常借助该数据集将结构化知识融入语言模型,以提升模型对印尼语文本中实体与关系的理解能力,从而在低资源语言的知识驱动型 NLP 任务中发挥关键作用。
解决学术问题
该数据集有效解决了印尼语知识图谱资源匮乏的学术难题。传统上,印尼语因缺乏大规模结构化知识库,导致知识感知的语言模型研究进展缓慢。IndoWiki 通过系统化地抽取 Wikidata 中与印尼语百科对应的三元组知识,为知识增强模型提供了标准化的训练与评测基准。它推动了跨语言知识迁移的研究,使印尼语能够参与到知识图谱与语言模型融合的前沿探索中,显著提升了低资源语言在知识推理和语义理解任务上的表现。
实际应用
在实际应用中,IndoWiki 为印尼语智能问答系统、信息检索和对话机器人提供了坚实的知识底座。借助该数据集,开发者可以构建能够理解印尼语用户意图并返回精确结构化答案的应用程序,例如在电商客服、教育辅导和公共服务领域。此外,它还被用于印尼语新闻事件的知识抽取与舆情分析,助力企业从海量非结构化文本中自动提取关键实体与关系,实现数据驱动的决策支持。
数据集最近研究
最新研究方向
在东南亚语言自然语言处理领域,知识增强型语言模型的研究正成为前沿热点。IndoWiki作为从WikiData抽取并与印尼语维基百科对齐的知识图谱数据集,为印尼语知识驱动的语言模型提供了关键基础资源。当前,研究者正致力于将此类结构化知识融入预训练语言模型,以解决低资源语言在常识推理和实体关系理解上的瓶颈。该数据集支撑的IndoKEPLER和IndoLAMA等项目,不仅推动了印尼语知识图谱构建与评估的标准化,更在跨语言知识迁移、多模态语义对齐等方向上开辟了新路径。随着SEACrowd数据枢纽的整合,IndoWiki的广泛应用有望加速东南亚语言在信息检索、问答系统和智能对话等场景中的落地,对促进该区域语言技术的包容性发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务