遇见数据集

Dataset KBBI Indonesia

收藏
github2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

完整的印度尼西亚语大词典(KBBI)数据集,包含209,868个单词及其含义和词类,并附带1,453对规范和非规范单词对。数据以CSV格式提供,包含word(单词)、arti(定义,HTML格式)和type(词类,整数)等列。

Complete Kamus Besar Bahasa Indonesia (KBBI) dataset, which contains 209,868 words with their definitions and part-of-speech tags, along with 1,453 pairs of standard and non-standard words. The dataset is provided in CSV format, with columns including word, arti (definition in HTML format), and type (part-of-speech tag with integer data type).

创建时间:
2026-05-28
原始信息汇总

数据集概述:KBBI Indonesia

该数据集提供完整的印尼语大词典(Kamus Besar Bahasa Indonesia, KBBI)数据,包含词条释义和词性分类,以及标准词与非标准词对照表。

数据集内容

  1. KBBI 词典数据

    • 文件: kbbi.csv
    • 记录数: 209,868 条
    • 大小: 约 24 MB
    • 分隔符: 逗号 (,)
    • 字段:
      • word: 词条(例如 cinta
      • arti: 释义(HTML 格式,例如 suka sekali; sayang benar
      • type: 词性类别(整数,如 1 表示名词)
  2. 标准词与非标准词对照表

    • 文件: kata-baku-tidak-baku.csv
    • 记录数: 1,453 条
    • 大小: 约 23 KB
    • 分隔符: 分号 (;)
    • 字段:
      • salah: 非标准词(例如 praktek
      • benar: 标准词(例如 praktik

数据来源

数据来源于印度尼西亚教育与文化部语言发展与建设机构(Badan Pengembangan dan Pembinaan Bahasa, Kemendikbud)。

许可证

MIT 许可证。

相关资源

  • 提供 REST API,可通过 https://api.ibnuhabib.web.id 访问,支持前缀搜索、精确匹配、标准词校验和 CSV 下载。
搜集汇总
数据集介绍
Dataset KBBI Indonesia 数据集图片
构建方式
在印度尼西亚语言资源数字化建设的背景下,Dataset KBBI Indonesia应运而生。该数据集系统整合了印度尼西亚国家语言发展与建设机构发布的权威词典内容,构建过程严谨规范。数据采集自《大印度尼西亚词典》(KBBI)的官方资源,通过结构化处理形成两个核心子集:其一为包含209,868条词条的词典数据库,每条记录清晰标注词汇、基于HTML格式的详细释义以及词类编号(如名词标记为1);其二为收录1,453组语言标准形与非标准形对照表的规范性数据集。所有数据以CSV文件格式存储,分别采用逗号和分号作为字段分隔符,确保数据解析的便捷性与兼容性。
特点
该数据集呈现出鲜明的语言学应用价值与结构化优势。作为目前最完整的KBBI数字化资源,其覆盖近21万词条的海量规模,为自然语言处理任务提供了扎实的词汇基础。值得关注的是,数据集不仅包含常规的词汇释义与词类标注,还专门设立了标准语言形与非标准形对照模块,这一特色设计有效回应了印尼语言规范化研究的实际需求。此外,数据采用轻量级的CSV格式存储,兼具可读性与机器解析效率,而公开的REST API接口更为开发者提供了实时查询、前缀匹配、精准检索及批量下载等灵活访问方式。
使用方法
使用者可通过多种途径便捷调用该数据集。直接下载CSV文件适用于离线分析场景,其中kbbi.csv和kata-baku-tidak-baku.csv分别对应词典数据与正误词对照表,支持在Python、R等数据工具中加载处理。对于需要在线交互的应用,可调用由专用API服务提供支持的REST接口,基础URL为https://api.ibnuhabib.web.id,支持以curl命令执行精确词汇查询、前缀模糊搜索(如查找以'cinta'开头的词汇)以及标准语言形校验(如验证'praktek'的正确形式为'praktik')。开发者还可通过统一的下载端点批量获取完整数据集,便于集成到各类印尼语处理系统中。
背景与挑战
背景概述
Dataset KBBI Indonesia由研究者Ibnul Habib于2025年创建,其核心研究问题在于构建一个结构化、完整且易于访问的印度尼西亚语大词典数据集。该数据集来源于印度尼西亚国家语言发展与建设机构(Badan Pengembangan dan Pembinaan Bahasa, Kemendikbud),收录了209,868条词条及其释义与词性分类,并额外包含1,453条标准与非标准词语配对。通过提供CSV格式数据与REST API接口,该数据集极大便利了自然语言处理与印尼语语言学研究,成为学术界与工业界开展词义消歧、拼写纠错及语言教育等任务的重要基础资源,对推动印尼语计算语言学领域的发展具有显著影响力。
当前挑战
该数据集所应对的领域挑战集中于印尼语词汇资源的稀疏性与非标准化问题。印尼语领域长期缺乏大规模、统一标注的词典数据集,传统纸质KBBI难以满足自动化处理需求,导致词性标注、语义解析等任务依赖零散或过时资源。在构建过程中,主要挑战包括:从分散的官方语言资源中提取、清洗与规范化超过二十万条词条,确保词性编码(如名词、动词)的准确映射;同时处理HTML格式释义的解析与去噪,并建立标准与非标准词语的可靠对应关系,以弥补印尼语拼写变体与口语化表达带来的歧义。此外,还需设计可扩展的API架构以支持高效查询与数据分发。
常用场景
经典使用场景
在印度尼西亚语自然语言处理(NLP)领域,Dataset KBBI Indonesia作为最权威的词汇资源,常被用于构建语言模型的基础词典,支持词性标注、词汇规范化以及拼写纠错等核心任务。研究人员利用其包含近21万词条及对应词类标签的结构化数据,训练印尼语分词器或词嵌入模型,例如通过提取‘cinta’(爱)等词的释义与词性信息,为语义分析提供可靠锚点。该数据集亦常作为基准语料,评估印尼语文本预处理工具的性能,在学术论文中频繁现身于语言资源建设相关章节。
实际应用
在实际应用中,Dataset KBBI Indonesia被集成到印尼语拼写检查工具与文本编辑器插件中,例如教育软件可借其自动纠正常见的非标准拼写如将‘praktek’校正为‘praktik’,提升文档规范性。语言学习平台利用该数据集开发单词查询与释义推送功能,帮助学习者理解正式用语。政府部门和媒体机构则将其作为术语标准化参考,确保公文与新闻报道中词汇使用的严谨性,从而在语言规划与数字人文领域发挥关键作用。
衍生相关工作
基于该数据集衍生出多项标志性工作,其中包括由同一开发者构建的REST API服务(api-datasets-indonesia),实现了词典查询的网络化实时调用。此外,研究者借鉴其数据格式,延伸构建了印尼学校、高等教育机构及行政区划等多类结构化数据集,形成本土信息基础设施的有机组成部分。在学术领域,后续工作如印尼语词向量预训练模型常以KBBI词表作为基础词汇集,其规范词汇对也为拼写纠错算法提供了标准化的训练与评测基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务