遇见数据集

SEACrowd/indotacos

收藏
Hugging Face2024-06-24 更新2024-03-04 收录
官方服务:

资源简介:

Indotacos数据集是一个用于分析和预测税务法庭判决结果或胜诉概率的数据集。该数据集的语言为印尼语(ind),支持的任务是税务法庭判决分析。通过自然语言处理技术,可以研究影响税务法庭判决结果的因素。数据集的使用可以通过`datasets`库或`seacrowd`库进行加载。

The Indotacos dataset is designed for analyzing and predicting the outcomes or the probability of winning tax court verdicts. The dataset is in Indonesian (ind) and supports the task of tax court verdict analysis. By using Natural Language Processing, it is possible to investigate the factors that influence the outcomes of tax court verdicts. The dataset can be loaded using the `datasets` library or the `seacrowd` library.

提供机构:
SEACrowd
原始信息汇总

数据集概述

语言

  • 印尼语 (ind)

支持的任务

  • 税务法庭判决 (Tax Court Verdict)

数据集使用

使用 datasets

python from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/indotacos", trust_remote_code=True)

使用 seacrowd

python import seacrowd as sc

使用默认配置加载数据集

dset = sc.load_dataset("indotacos", schema="seacrowd")

查看数据集的所有可用子集(配置名称)

print(sc.available_config_names("indotacos"))

使用特定配置加载数据集

dset = sc.load_dataset_by_config_name(config_name="<config_name>")

数据集主页

数据集版本

  • 源版本: 1.0.0
  • SEACrowd版本: 2024.06.20

数据集许可证

  • Creative Common Attribution Share-Alike 4.0 International

引用

@misc{wibisono2022indotacos, title = {IndoTacos}, howpublished = {url{https://www.kaggle.com/datasets/christianwbsn/indonesia-tax-court-verdict}}, note = {Accessed: 2022-09-22} }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/indotacos 数据集图片
构建方式
Indotacos数据集源自印度尼西亚税务法院的判决文书,由研究者从Kaggle平台收集并整理,后经SEACrowd社区标准化处理,形成适用于自然语言处理研究的结构化资源。该数据集以税务案件判决结果为核心,聚焦于通过文本分析预测诉讼胜负概率,构建过程中对原始法律文本进行了清洗、标注与格式统一,确保数据质量与可复现性。
特点
该数据集以印度尼西亚语为单一语言载体,专攻税务法院判决这一细分法律领域,具有高度的专业性与领域聚焦性。其独特之处在于将法律文本与机器学习任务结合,为研究影响税务判决结果的关键因素提供了实证基础,填补了该领域公开数据集的空白。数据版本明确标注为1.0.0,采用Creative Commons Attribution Share-Alike 4.0国际许可协议,兼顾开放共享与版权保护。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,调用load_dataset('SEACrowd/indotacos', trust_remote_code=True)即可获取。此外,SEACrowd库提供了更灵活的配置选项,支持按默认Schema或特定子集加载,便于适配不同研究需求。数据集主页及引用信息均已在README中明确列出,方便学术引用与后续拓展研究。
背景与挑战
背景概述
在司法科学与实践中,预测案件结果或胜诉概率始终是极具吸引力的研究课题。然而,针对税务法庭判决的量化分析领域长期面临数据匮乏的困境,这严重制约了自然语言处理技术在法律文本挖掘中的应用。Indotacos数据集由Christian Wibisono等人于2022年创建,旨在填补印度尼西亚税务法庭判决分析的数据空白,为研究者提供首个专注于税务案件结果预测的标准化语料库。该数据集通过收录真实的税务法庭判决文书,结合自然语言处理技术,系统探索影响判决结果的关键因素,为法律智能辅助决策提供了重要的数据支撑。其发布不仅推动了东南亚语言法律文本分析的研究进程,更在SEACrowd数据枢纽的整合下,成为多语言法律人工智能领域具有里程碑意义的资源。
当前挑战
Indotacos数据集面临的核心挑战源于税务法庭判决分析这一领域的固有复杂性。首先,税务法律文本具有高度专业化的术语体系与复杂的逻辑结构,传统自然语言处理模型难以精准捕捉其中的因果关联与隐含法律意图,导致判决结果预测的准确率受限。其次,数据集构建过程中需应对印度尼西亚语法律文书的非标准化表述,包括句式冗长、多义表达及跨文档引用等语言现象,这要求标注团队具备法学与语言学的双重专业知识,显著增加了数据清洗与标注的难度。此外,税务案件涉及敏感商业信息,数据脱敏处理需在保留法律要素完整性与保护隐私之间寻求平衡,这一过程进一步提升了构建高质量训练集的挑战性。
常用场景
经典使用场景
Indotacos数据集在税务法判决预测领域具有里程碑式的意义,其经典使用场景聚焦于利用自然语言处理技术对印度尼西亚税务法院的判决文书进行深度分析。研究者通过构建文本分类模型,从案件事实、法律依据和争议焦点等维度提取关键特征,进而预测判决结果或胜诉概率。该数据集为法庭判决分析提供了稀缺的标注语料,使得基于机器学习的税务案件结果预测成为可能,显著推动了法律文本挖掘在东南亚语境下的应用边界。
衍生相关工作
围绕Indotacos数据集,衍生出多项具有影响力的经典工作。其中,SEACrowd项目将其纳入东南亚多语言多模态数据枢纽,作为税务法律领域的基准测试集,推动了跨语言法律NLP研究。后续研究者基于该数据集提出了针对印尼法律文本的领域预训练模型,并开发了融合法律知识图谱的判决预测框架,显著提升了模型的可解释性。这些工作共同构筑了税务法律智能分析的技术生态。
数据集最近研究
最新研究方向
在法律科学与实务领域,裁判结果预测始终是极具吸引力的前沿课题,然而针对税务法庭判决的细粒度分析数据集长期匮乏。Indotacos数据集应运而生,它聚焦于印度尼西亚税务法庭判决文本,为利用自然语言处理技术探究影响判决结果的关键因素提供了结构化资源。当前研究热点集中于基于该数据集构建可解释的判决预测模型,通过挖掘案件事实、法律条文与判决倾向之间的深层关联,推动司法智能化与透明化进程。这一方向不仅有助于提升税务争议解决的效率,也为东南亚低资源语言的法律AI研究树立了标杆,其影响力正随着SEACrowd数据枢纽的发布而向多语言、多模态场景延伸。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务