five

PTPARL Corpus

收藏
DataCite Commons2022-06-01 更新2024-07-13 收录
下载链接:
https://live.european-language-grid.eu/catalogue/corpus/914
下载链接
链接失效反馈
官方服务:
资源简介:
The PTPARL Corpus contains 1,076 texts consisting of adapted transcriptions of the Portuguese Parliament sessions. The corpus contains 1,000,441 tokens. <p><p>The corpus is delivered in one file, in two different formats. The txt version has one sentence per line, an identification number for each text and no further annotation. The cqpweb file is one token per line, followed by pos tag and lemma, and is annotated for NP chunks. The PTPARL Corpus is a subset of the Corpus of Reference of Contemporary Portuguese and follows the same annotation scheme. For more information on its preparation and annotation, see: Généreux, M., I. Hendrickx, A. Mendes (2012) “A Large Portuguese Corpus On-Line: Cleaning and Preprocessing”. In Caseli, H. et al. (eds.) Computational Processing of the Portuguese Language. Proceedings of the 10th International Conference PROPOR1012. Berlin, Heidelberg: Springer-Verlag, pp. 113-120. <p>The Corpus is delivered with the annotation manual of the CRPC corpus, a metadata file and a narrative description of the resource.

PTPARL语料库(PTPARL Corpus)收录1076段经标准化适配的葡萄牙议会会议转录文稿,总计1,000,441个词元(Token)。 本语料库以单个文件形式交付,包含两种格式版本。其中TXT格式版本每行对应一个句子,每段文本配有唯一标识编号,无额外标注。 cqpweb格式版本则每行对应一个词元,其后附带词性标注(POS tag)与词元原形(lemma),并完成了名词短语组块(NP chunks)的标注。 PTPARL语料库是《当代葡萄牙语参考语料库》(Corpus of Reference of Contemporary Portuguese,CRPC)的子集,遵循统一的标注规范。如需了解其构建与标注细节,请参阅:Généreux, M.、I. Hendrickx、A. Mendes(2012)《大型葡萄牙语在线语料库:清洗与预处理》,收录于Caseli, H. 等主编《葡萄牙语计算处理》(*Computational Processing of the Portuguese Language*),第10届国际葡萄牙语计算处理会议(PROPOR1012)论文集,柏林、海德堡:施普林格出版社,第113-120页。 本语料库随附CRPC语料库的标注手册、元数据文件及该资源的叙述性说明文档。
提供机构:
ELG
创建时间:
2022-06-01
5,000+
优质数据集
54 个
任务类型
进入经典数据集
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

数据驱动未来

携手共赢发展

商业合作