vitorandrade/wikipedia_portugues
收藏资源简介:
# Dataset Card para Wikipedia em Português <h2 style='text-align: center;'> Time 1 - NLP </h2> ## Dados Gerais - **Nome:** portuguese_wikipedia_sentences - **Página WEB:** [portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences) - **Repositório:** [portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences/tree/main/data) ## Resumo Este dataset é adequado para o projeto devido à sua vasta coleção de frases em português extraídas da Wikipedia, oferecendo uma ampla gama de conhecimentos gerais e específicos. Contendo artigos limpos em português, cada exemplo, contém um artigo completo da Wikipedia com limpeza para remover marcações e seções indesejadas(referências, citações, etc) Foi realizado uma [Análise Exploratória dos dados](https://github.com/CPqD/resid2023-nlp-1/blob/main/EDA_wikipedia_setences_pt.ipynb) dos arquivos, sendo eles: > Conjunto de Treinamento: train-00000-of-00001.parquet (7.01MB); > Conjunto de Validação: evaluation-00000-of-00001.parquet (1.17MB); > Conjunto de Teste: test-00000-of-00001.parquet (1.18MB); ## Utilização Pretendida <!-- Indique quais as tarefas de NLP podem utilizar este dataset. Por exemplo, classificação de texto, reconhecimento de entidades, etc. Nesta seção, você pode detalhar e expandir o que foi apresentado no resumo. --> O portuguese_wikipedia_sentences no projeto vai ajudar o modelo aprender o idioma português. ## Idiomas <!-- Indique os idiomas presentes no dataset. --> Foi traduzida automáticamente para a Lingua Portuguesa. ## Criação <!-- Se o dataset foi construído por você, indique a fonte dos dados usados e descreva o processo de coleta e processamento. Se foi usado um dataset já existente, indique a URL do dataset original. Se o dataset existente foi modificado, descreva a modificação realizada e as ferramentas usadas. --> Na [Análise Exploratória dos dados](https://github.com/CPqD/resid2023-nlp-1/blob/main/EDA_wikipedia_setences_pt.ipynb) realizada, verificou-se que os 3 arquivos parquet, para treinamento, teste e validação, possuem, respectivamente, 63.387, 10.565 e 10.565 registros, totalizando assim: 84.517 dados. Dataset [portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences) ## Estrutura ### Amostras Os 3 arquivos disponibilizados de dados no formato [parquet](https://www.alura.com.br/artigos/arquivos-parquet), conforme apresentado abaixo: ```parquet text 0 Estas atividades fizeram dela uma das mulheres... 1 Ryan também anunciou que o nome da personagem ... 2 O solo, é constituído por uma calçada em mosai... 3 Em 1514, ele apelou a Roma e uma comissão foi ... 4 O Los Angeles Clippers é um time de basquete d... ``` <!-- Se achar importante, dê informações adicionais sobre os dados e que não estejam em outras seções, por exemplo, estatísticas sobre as amostras do dataset, distribuição dos dados coletados, etc. --> ### Campos dos Dados <!-- Indique e descreva os campos presentes no dataset. Informe o tipo do campo. Se for um campo de categoria, informe os valores possíveis. --> * **text**: campo que trata de um determinado assunto/tema relacionado. ### Divisão dos Dados <!-- Descreva as divisões existentes no dataset. Por exemplo, conjuntos de treinamento, validação e teste. Forneça os tamanhos das divisões. Se achar pertinente, forneça também estatísticas úteis de cada divisão. --> Conforme apresentado anteriormente,o conjunto de dados está dividido em treinamento com 63.387 registros, validação com 10.565 registros e teste também com 10.565 registros. Totalizando 84.517 registros. Foram gerados 3 arquivos parquet, e carregados na plataforma [HungginFace](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences/tree/main/data), sendo eles: > evaluation-00000-of-00001.parquet > test-00000-of-00001.parquet > train-00000-of-00001.parquet Para carregar os datasets basta utilizar os seguintes comandos: ``` # importar a biblioteca from datasets import load_dataset # carregar os datasets dataset = load_dataset("jvanz/portuguese_wikipedia_sentences") ``` Que devem gerar a seguinte saída: ``` Saída comando DatasetDict({ train: Dataset({ features: ['text'], num_rows: 63387 }) test: Dataset({ features: ['text'], num_rows: 10565 }) evaluation: Dataset({ features: ['text'], num_rows: 10565 }) }) ```
# 葡萄牙语维基百科数据集卡片 ## <div style="text-align: center;">第一小组——自然语言处理(Natural Language Processing, NLP)</div> ## 基本信息 - **名称**:portuguese_wikipedia_sentences - **网页地址**:[portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences) - **代码仓库**:[portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences/tree/main/data) ## 数据集摘要 本数据集适配本项目需求,其收录了从维基百科(Wikipedia)中提取的海量葡萄牙语文本语句,涵盖广泛的通用与专业知识。数据集内含经过清洗的葡萄牙语维基百科文章,每个样本均为完整的维基百科文章,已通过预处理移除了格式标记与冗余章节(如参考文献、引用等)。 已针对数据集文件开展[数据探索性分析(Exploratory Data Analysis, EDA)](https://github.com/CPqD/resid2023-nlp-1/blob/main/EDA_wikipedia_setences_pt.ipynb),具体文件如下: > 训练集:train-00000-of-00001.parquet(7.01MB) > 验证集:evaluation-00000-of-00001.parquet(1.17MB) > 测试集:test-00000-of-00001.parquet(1.18MB) ## 预期应用场景 <!-- 请说明可使用本数据集的自然语言处理任务类型,例如文本分类、实体识别等。本节可对摘要内容进行细化与拓展。 --> 本项目中,portuguese_wikipedia_sentences数据集将用于辅助模型学习葡萄牙语语言特征。 ## 语言分布 <!-- 请说明数据集包含的语言 --> 本数据集所有内容均为葡萄牙语文本,经自动处理适配葡萄牙语语言规范。 ## 数据集构建 <!-- 若数据集由您本人构建,请说明数据源并描述数据收集与处理流程;若基于现有数据集开发,请注明原始数据集链接;若对现有数据集进行了修改,请说明修改内容与所用工具。 --> 在本次开展的[数据探索性分析(EDA)](https://github.com/CPqD/resid2023-nlp-1/blob/main/EDA_wikipedia_setences_pt.ipynb)中,经统计可知:训练、测试与验证所用的3个Parquet(Parquet)文件分别包含63387、10565与10565条样本,总计84517条数据。 数据集详情见[portuguese_wikipedia_sentences](https://huggingface.co/datasets/jvanz/portuguese_wikipedia_sentences)。 ## 数据集结构 ### 样本示例 本次发布的3个数据文件均采用Parquet(Parquet)文件格式,示例如下: parquet text 0 这些活动使其成为一众女性中的佼佼者…… 1 瑞安还宣布,该角色的名称为…… 2 地面由马赛克铺装而成…… 3 1514年,他向罗马教廷申诉,随后成立了专门委员会…… 4 洛杉矶快船队(Los Angeles Clippers)是一支位于…… <!-- 若有必要,可补充其他章节未涵盖的数据集相关信息,例如样本统计、数据分布情况等。 --> ### 数据字段 <!-- 请说明并描述数据集中的所有字段,包括字段类型;若为分类字段,请注明可选取值范围。 --> * **text**:存储与特定主题相关的完整文本内容。 ### 数据划分 <!-- 请说明数据集的划分方式,例如训练集、验证集与测试集,并给出各划分的规模;若有必要,可补充各子集的有效统计信息。 --> 如前文所述,本数据集划分为训练集(63387条样本)、验证集(10565条样本)与测试集(10565条样本),总计84517条样本。 本次共生成3个Parquet数据文件,并上传至Hugging Face平台,具体文件如下: > evaluation-00000-of-00001.parquet > test-00000-of-00001.parquet > train-00000-of-00001.parquet 若需加载该数据集,可使用如下代码: python # 导入依赖库 from datasets import load_dataset # 加载数据集 dataset = load_dataset("jvanz/portuguese_wikipedia_sentences") 运行后将输出如下结果: DatasetDict({ train: Dataset({ features: ['text'], num_rows: 63387 }) test: Dataset({ features: ['text'], num_rows: 10565 }) evaluation: Dataset({ features: ['text'], num_rows: 10565 }) })
数据集概述
- 名称: portuguese_wikipedia_sentences
- 网页: portuguese_wikipedia_sentences
- 仓库: portuguese_wikipedia_sentences
数据集内容
-
摘要: 该数据集包含大量从葡萄牙语维基百科中提取的句子,适用于广泛的知识领域,包括一般和特定知识。每个示例包含一个经过清理的维基百科文章,去除了标记和不需要的部分(如参考文献、引用等)。
-
数据结构:
-
样本: 数据以parquet格式存储,包含多个文本样本,如:
text 0 Estas atividades fizeram dela uma das mulheres... 1 Ryan também anunciou que o nome da personagem ... 2 O solo, é constituído por uma calçada em mosai... 3 Em 1514, ele apelou a Roma e uma comissão foi ... 4 O Los Angeles Clippers é um time de basquete d...
-
数据字段:
- text: 描述特定主题或话题的文本字段。
-
-
数据分割:
- 训练集: 包含63,387条记录。
- 验证集: 包含10,565条记录。
- 测试集: 包含10,565条记录。
- 总计: 84,517条记录。
使用意图
- 用途: 该数据集旨在帮助模型学习葡萄牙语,适用于文本分类、实体识别等NLP任务。
语言
- 语言: 数据集语言为葡萄牙语。
数据创建
- 数据来源: 数据集来源于葡萄牙语维基百科,经过自动翻译和清理处理。
- 数据处理: 进行了数据探索分析,确认了训练、验证和测试集的记录数量。




