遇见数据集

Dataset e análise de contorno de Guardrails de LLMs em Saúde Mental: O papel das gírias no Português Brasileiro

收藏
Zenodo2026-05-24 更新2026-05-29 收录
官方服务:

资源简介:

Resumo: Este artefato contém o conjunto de dados (dataset) e os scripts de análise utilizados para avaliar a eficácia dos guardrails de segurança em Modelos de Linguagem de Grande Escala (LLMs) diante de ataques semânticos baseados em gírias, roleplay e apelos emocionais em Português Brasileiro. O estudo foca no contexto de saúde mental, onde a precisão na recusa de danos é crítica. Conteúdo do Artefato: data/: Contém as saídas brutas (formato JSON) das interações com os modelos. scripts/: Contém os algoritmos para processamento dos resultados, geração de gráficos comparativos e cálculo de confiabilidade inter-codificadores. Dockerfile: Configuração de ambiente para reprodução exaustiva de todas as análises estatísticas apresentadas no artigo. README.md: Instruções detalhadas para execução e interpretação dos dados. Metodologia de Validação: A avaliação foi conduzida sobre a totalidade da amostra, eliminando vieses de amostragem. Para mitigar o "Problema do Oráculo" e a subjetividade inerente à interpretação de linguagem natural, aplicou-se um protocolo de validação inter-rater reliability com dois pesquisadores independentes. A concordância entre os avaliadores foi mensurada por meio do Coeficiente Kappa de Cohen, garantindo a robustez estatística dos resultados reportados. Instruções de Uso: Este artefato foi estruturado para ser executado via Docker, garantindo que o ambiente de análise seja idêntico ao utilizado na pesquisa original. Instruções detalhadas de compilação e execução constam no arquivo README.md incluso no repositório.

提供机构:
Zenodo
创建时间:
2026-05-24
二维码
社区交流群
二维码
科研交流群
商业服务