登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
TLDR pages translation pairs dataset
TLDR pages translation pairs dataset
收藏
kaggle
2026-06-03 更新
2024-03-08 收录
多语言翻译
文档摘要
数据链接:
https://www.kaggle.com/datasets/tldr-pages/tldr-pages-translation-pairs-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A multilingual dataset that maps the strings across localized TLDR pages.
应用场景:
创建时间:
2024-03-01
相关数据集
WCEP Dataset
文档摘要
新闻事件
WCEP数据集是一个用于多文档摘要(MDS)的数据集,包含关于新闻事件的人工编写简短摘要,每个摘要都与一个事件相关联的新闻文章簇配对。这些文章来源于Wikipedia当前事件门户(WCEP)编辑引用的来源,并扩展了从Common Crawl新闻数据集自动获取的文章。
github
2024-04-18 更新
121
0
GEM/wiki_cat_sum
领域特定摘要生成
文档摘要
WikiCatSum是一个用于摘要生成的英文数据集,涵盖了动物、公司和电影三个领域。数据集提供了多段文本及其对应的摘要。数据集的创建是自动化的,语言为英语,许可证为CC-BY-SA-3.0。数据集的主要任务是摘要生成,旨在研究多文档摘要生成的能力。数据集的结构包括ID、标题、段落和摘要等字段。数据集被分为训练集、验证集和测试集,分割标准是独立同分布(i.i.d.)。数据集的主要贡献是评估模型在噪声
Hugging Face
2022-10-24 更新
13
0
HEBTEASESUM
自然语言处理
文档摘要
HEBTEASESUM是由耶路撒冷希伯来大学研究团队构建的首个希伯来语多文档摘要数据集,基于历史报纸的前页提要自动提取而成。该数据集包含7,774条高质量摘要-文档对,数据源自数字化报纸档案,通过两阶段流程实现:首先识别前页提要中的关键词短语定位摘要,随后匹配对应版面的完整新闻文档。该资源专门针对低资源语言场景设计,有效解决了希伯来语等语言缺乏高质量摘要训练数据的问题,为跨语言摘要模型评估与优化提
arXiv
2025-11-18 更新
10
0
Helsinki-NLP/bible_para
多语言翻译
圣经文本
--- annotations_creators: - found language_creators: - found language: - acu - af - agr - ake - am - amu - ar - bg - bsn - cak - ceb - ch - chq - chr - cjp - cni - cop - crp - cs - da - de - dik - dje
Hugging Face
2024-01-18 更新
19
0
AbderrahmanSkiredj1/arabml_darija_english_parallel_dataset
多语言翻译
该数据集包含阿拉伯语和英语的双语数据,主要用于翻译任务。
Hugging Face
2024-07-15 更新
12
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广