遇见数据集

mpapucci/impacts

收藏
Hugging Face2026-05-08 更新2026-03-29 收录
官方服务:

资源简介:

IMPaCTS是一个大规模意大利语平行语料库,用于受控文本简化,包含使用大型语言模型自动生成的复杂-简化句子对。每个句子对都标注了可读性分数(通过Read-IT工具)和通过ProfilingUD工具提取的丰富语言特征集。该数据集是为LREC2026论文构建的数据集的清理子集,包含1,066,828个句子对。数据集提供多个配置:all、wikipedia和public_administration(仅包含核心列,共12列),以及对应的_profiling配置(包含核心列和约300个额外语言特征)。核心列包括句子对索引、原始句子索引、原始文本、简化文本,以及每个句子的四个Read-IT可读性分数(基础、词汇、句法和总体分数)。数据集适用于意大利语文本简化模型的训练和评估、基于可读性分数的受控文本生成,以及语言特征对可读性影响的研究。

IMPaCTS is a large-scale Italian parallel corpus for controlled text simplification, containing complex–simple sentence pairs automatically generated using Large Language Models. Each pair is annotated with readability scores (via Read-IT) and a rich set of linguistic features obtained with ProfilingUD. The dataset is a cleaned subset of the dataset constructed for the LREC2026 paper, containing 1,066,828 pairs. It comes in multiple configs: all, wikipedia, and public_administration (core columns only, 12 columns), and corresponding _profiling configs (core columns plus ~300 additional linguistic features). Core columns include pair index, original sentence index, original text, simplified text, and four Read-IT readability scores (base, lexical, syntactic, and overall) for each sentence. The dataset is suited for training and evaluating text simplification models for Italian, controlled text generation conditioned on readability scores, and studying the effect of linguistic features on readability.

提供机构:
mpapucci
二维码
社区交流群
二维码
科研交流群
商业服务