登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
gplsi/Simplification_clearText
gplsi/Simplification_clearText
收藏
Hugging Face
2024-05-23 更新
2024-06-12 收录
文本简化
数据链接:
https://hf-mirror.com/datasets/gplsi/Simplification_clearText
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-4.0 ---
应用场景:
提供机构:
gplsi
原始信息汇总
数据集许可证信息
许可证类型
:CC-BY-4.0
许可证说明
:该数据集遵循知识共享署名4.0国际许可协议。
相关数据集
MCTS
文本简化
语言处理
MCTS是首个公开的汉语文本简化任务数据集,是目前汉语文本简化任务中最大的评估数据集,包含最多的参考文献。该数据集包含723个从新闻语料库中选取的复杂结构句子,每个句子都有多个手动简化的句子。
github
2024-05-21 更新
105
0
dennlinger/klexikon
文本简化
机器翻译
Klexikon数据集是一个德语资源,包含德语维基百科和儿童词典Klexikon之间的文档对齐文本。该数据集旨在联合进行文本简化和摘要任务,包含近2900个对齐的文章对。儿童文章使用的语言比原始维基百科文章更简单,且源(维基百科)和目标(Klexikon)领域之间存在明显的长度差异。数据集的结构包括数据实例、数据字段和数据分割。数据实例表示维基百科文本和Klexikon文本,数据字段包括唯一标识符
Hugging Face
2022-10-25 更新
23
0
gplsi/alia_tourism
旅游
文本生成
ALIA_TOURISM数据集是一个多语言资源,专为旅游领域的文本生成而设计。数据集包含以Markdown格式(`.md`)提供的文本文档,每个文档以结构化的JSONL条目形式呈现。每个条目包括文本的源、语言、格式、文本内容和元数据等信息。数据集涵盖西班牙语(es)、瓦伦西亚语(va)和英语(en)三种语言,领域为旅游,格式为JSON Lines(`.jsonl`)。每个条目代表一个独立的旅游相关
Hugging Face
2026-06-02 更新
12
0
chaojiang06/wiki_auto
文本简化
句子对齐
WikiAuto数据集提供了一组从英文维基百科和简单英文维基百科中对齐的句子,作为训练句子简化系统的资源。作者首先通过众包方式在简单英文维基百科和英文维基百科的子集中手动对齐句子,然后训练了一个神经CRF系统来预测这些对齐。训练好的对齐预测模型随后应用于简单英文维基百科中具有英文对应版本的其他文章,以创建更大的对齐句子语料库。数据集支持文本简化任务,通常使用SARI和FKBLEU指标进行评估。数据
Hugging Face
2024-01-18 更新
55
0
CATIE-AQ/bisect_fr_prompt_textual_simplification
文本简化
自然语言处理
bisect_fr_prompt_textual_simplification是DFP数据集的一个子集,包含9,889,420条可用于文本简化任务的数据。该数据集基于BiSECT数据集的法语部分构建,并应用了20种提示语来构建输入和目标列。数据集分为训练集、验证集和测试集,遵循cc-by-nc-4.0许可证。
Hugging Face
2025-02-10 更新
18
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广