遇见数据集

Simple Italian sentences ranked by readability

收藏
Zenodo2020-07-17 更新2026-05-25 收录
数据链接:
官方服务:

资源简介:

The dataset contains 500,000 sentences extracted from the Paisà corpus (https://www.corpusitaliano.it/) which have been selected for being easy to read according to four parameters: token number, average word length, depth of the parse tree and verb "arity". The sentences are ranked by readability.

本数据集包含抽取自Paisà语料库(Paisà corpus,https://www.corpusitaliano.it/)的50万条语句,这些语句依据四项易读性参数筛选而出:Token(Token)数量、平均词长、句法分析树(parse tree)深度以及动词配价(verb arity)。所有语句将按照易读性进行排序。

提供机构:
Zenodo
创建时间:
2019-01-24
二维码
社区交流群
二维码
科研交流群
商业服务