登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Text simplification resources for English/Spanish.
Text simplification resources for English/Spanish.
收藏
NIAID Data Ecosystem
2026-05-01 收录
文本简化
双语自然语言处理
数据链接:
https://figshare.com/articles/dataset/Text_simplification_resources_for_English_Spanish_/22593639
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Text simplification resources for English/Spanish.
应用场景:
创建时间:
2023-04-12
相关数据集
MCTS
文本简化
语言处理
MCTS是首个公开的汉语文本简化任务数据集,是目前汉语文本简化任务中最大的评估数据集,包含最多的参考文献。该数据集包含723个从新闻语料库中选取的复杂结构句子,每个句子都有多个手动简化的句子。
github
2024-05-21 更新
105
0
dennlinger/klexikon
文本简化
机器翻译
Klexikon数据集是一个德语资源,包含德语维基百科和儿童词典Klexikon之间的文档对齐文本。该数据集旨在联合进行文本简化和摘要任务,包含近2900个对齐的文章对。儿童文章使用的语言比原始维基百科文章更简单,且源(维基百科)和目标(Klexikon)领域之间存在明显的长度差异。数据集的结构包括数据实例、数据字段和数据分割。数据实例表示维基百科文本和Klexikon文本,数据字段包括唯一标识符
Hugging Face
2022-10-25 更新
23
0
CATIE-AQ/frenchSIMPLIFICATION
文本简化
法语处理
--- dataset_info: features: - name: sentence dtype: string - name: simplification dtype: string - name: dataset dtype: string splits: - name: train num_bytes: 339019973
Hugging Face
2025-12-01 更新
11
0
chaojiang06/wiki_auto
文本简化
句子对齐
WikiAuto数据集提供了一组从英文维基百科和简单英文维基百科中对齐的句子,作为训练句子简化系统的资源。作者首先通过众包方式在简单英文维基百科和英文维基百科的子集中手动对齐句子,然后训练了一个神经CRF系统来预测这些对齐。训练好的对齐预测模型随后应用于简单英文维基百科中具有英文对应版本的其他文章,以创建更大的对齐句子语料库。数据集支持文本简化任务,通常使用SARI和FKBLEU指标进行评估。数据
Hugging Face
2024-01-18 更新
55
0
davebulaval/CSMD
文本简化
意义保留评估
CSMD数据集是为评估句子之间的意义保留而创建的,包含1,355个英文文本简化意义保留注释。数据集结构包括多个配置,如`Meaning`、`meaning_with_data_augmentation`、`meaning_holdout_identical`和`meaning_holdout_unrelated`,每个配置都有不同的数据实例和字段。数据字段包括原始句子、简化句子和意义保留评分。数据
Hugging Face
2024-03-23 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广