遇见数据集

TransAlign

收藏
Zenodo2026-10-01 更新2026-10-01 收录
官方服务:

资源简介:

This dataset contains a large-scale Portuguese corpus for the Open Information Extraction (OpenIE) task, generated using the TransAlign cross-linguistic data alignment framework. English OpenIE datasets were translated into Portuguese and aligned using linguistic rules based on part-of-speech and syntactic dependency information. After translation, alignment, and data cleaning, the resulting corpus contains 96,067 high-quality triples (arg0, relation, arg1) for training Portuguese OpenIE models. The complete methodology is described in the article listed under Related works.

提供机构:
Zenodo
创建时间:
2026-10-01
二维码
社区交流群
二维码
科研交流群
商业服务