TransAlign
收藏官方服务:
资源简介:
This dataset contains a large-scale Portuguese corpus for the Open Information Extraction (OpenIE) task, generated using the TransAlign cross-linguistic data alignment framework. English OpenIE datasets were translated into Portuguese and aligned using linguistic rules based on part-of-speech and syntactic dependency information. After translation, alignment, and data cleaning, the resulting corpus contains 96,067 high-quality triples (arg0, relation, arg1) for training Portuguese OpenIE models. The complete methodology is described in the article listed under Related works.
提供机构:
Zenodo创建时间:
2026-10-01



