登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
thanhlehazoom/opus-jrc-acquis.it.test
thanhlehazoom/opus-jrc-acquis.it.test
收藏
Hugging Face
2024-02-01 更新
2024-03-04 收录
欧盟法律文本
多语言处理
数据链接:
https://hf-mirror.com/datasets/thanhlehazoom/opus-jrc-acquis.it.test
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
许可证:MIT许可证
应用场景:
提供机构:
thanhlehazoom
原始信息汇总
数据集概述
许可证
该数据集的许可证为 MIT 许可证。
相关数据集
jhu-clsp/seamless-align-expressive
语音翻译
多语言处理
Seamless-Align-Expressive数据集是一个用于翻译和音频到音频任务的多语言数据集,支持德语、英语、西班牙语、法语、意大利语和中文。数据集基于Meta AI发布的表达性语音到语音(S2S)数据,包含5种语言对的数据,压缩后约为228GB。数据集未进行分割,且数据可能包含个人身份信息、敏感内容或互联网上公开的有毒内容。数据集的创建过程中使用了SONAR Expressive编码器来
Hugging Face
2024-02-22 更新
50
0
stefan-it/autotrain-flair-hipe2022-fr-hmbert
实体识别
多语言处理
该数据集主要用于命名实体识别(NER)模型的微调,涉及多种语言和数据集,包括英语、德语、法语、芬兰语、瑞典语和荷兰语。数据集来源于HIPE-2020、HIPE-2022和Europeana等项目,具体包括AjMC、NewsEye、TopRes19th、ICDAR-Europeana和LeTemps等。
Hugging Face
2023-09-04 更新
26
0
sproos/wikipedia-title-text-pairs
多语言处理
自然语言处理
--- dataset_info: - config_name: ab features: - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1644341 num_examples: 1576 download_si
Hugging Face
2024-01-03 更新
15
0
baoanhtran/guanaco-llama2-200
多语言处理
语言模型
CulturaX 是一个多语言数据集,包含 167 种语言的 6.3 万亿个标记,专为大规模语言模型(LLM)开发而设计。该数据集经过严格的清洗和去重处理,包括语言识别、基于 URL 的过滤、基于指标的清洗、文档精炼和数据去重等多个阶段。数据集结合了 mC4(版本 3.1.0)和所有可访问的 OSCAR 语料库,经过深度清洗和去重后,包含 16TB 的数据(解压后为 27TB)。超过一半的数据集用
Hugging Face
2023-09-24 更新
32
0
WenWW/KD_multilingual_dataset
多语言处理
文本数据
该数据集包含多种语言的文本数据,每种语言的数据集都有不同的字节大小和样本数量。数据集的特征包括文本内容(text)和唯一标识符(id)。数据集涵盖了德语(de)、法语(fr)、西班牙语(es)、意大利语(it)、波兰语(pl)、罗马尼亚语(ro)、荷兰语(nl)、希腊语(el)、匈牙利语(hu)、葡萄牙语(pt)、捷克语(cs)、瑞典语(sv)、保加利亚语(bg)、丹麦语(da)、芬兰语(fi)、
Hugging Face
2024-12-04 更新
18
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广