CLARA: Um Dataset Validado e Enriquecido para Classificação de Conformidade Documental no Setor Público Brasileiro
收藏资源简介:
CLARA (Classificação Legal de Arquivos e Registros Administrativos) é um dataset público com cerca de 10.000 registros textuais para a classificação de conformidade de documentos no setor público brasileiro. Ele é balanceado entre as classes Público, Interno e Sigiloso, definidas com base na Lei de Acesso à Informação (LAI) e na Lei Geral de Proteção de Dados (LGPD). O dataset é composto por aproximadamente 10.000 registros textuais, meticulosamente balanceados em três classes fundamentais: Público (2): Documentos de acesso irrestrito, como atos administrativos finais e resultados de licitações. Interno (1): Informações de circulação restrita a agentes da instituição, como documentos preparatórios e pareceres. Sigiloso (0): Dados cujo acesso é limitado por lei, incluindo informações pessoais sensíveis e investigações em andamento. Para garantir a privacidade e resolver o desbalanceamento de classes, o dataset é 100% artificial, criado a partir de documentos do TRT-13 com técnicas de reformulação semântica e geração sintética de dados via Large Language Model (LLM). A qualidade dos rótulos foi atestada por validação humana em uma amostra de 10% do corpus, alcançando um índice Kappa de Cohen de 0.821.O dataset foi validado experimentalmente no fine-tuning do modelo Legal-BERT, que atingiu um F1-Score médio de 0.89 na tarefa de classificação. O CLARA é disponibilizado em formato JSON para fomentar a pesquisa e o desenvolvimento de novas soluções em governança de dados.
CLARA(行政文件与记录合法分类,Classificação Legal de Arquivos e Registros Administrativos)是一款公开数据集,包含约1万条文本记录,用于巴西公共部门的文档合规性分类。该数据集基于《信息自由法》(Lei de Acesso à Informação, LAI)与《通用数据保护法》(Lei Geral de Proteção de Dados, LGPD)划定的分类标准,在公开、内部、机密三个类别间实现了严格的均衡分布。 本数据集共包含约1万条文本记录,经精心配置划分为三大核心类别: - 公开(2):无限制访问的文档,例如最终行政决议与招投标结果。 - 内部(1):仅限机构内部人员流通的信息,例如筹备文件与专业意见书。 - 机密(0):受法律限制访问的数据,包括敏感个人信息与正在进行的调查项目。 为保障数据隐私并解决类别不平衡问题,本数据集100%为人工合成数据,源自TRT-13的原始文档,通过语义重构技术与大语言模型(Large Language Model, LLM)生成。标签质量经10%语料样本的人工验证得到确认,科恩Kappa系数达0.821。该数据集已在Legal-BERT模型的微调实验中得到验证,在此分类任务中取得了平均F1值0.89的性能。CLARA以JSON格式发布,旨在推动数据治理领域的研究与新型解决方案开发。



