登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
10892_vi_en_v1_0.tab
10892_vi_en_v1_0.tab
收藏
B2FIND
2026-04-05 收录
多语言数据
越南语-英语翻译
数据链接:
https://b2find.eudat.eu/dataset/ba8d465a-58d6-51b3-809e-b3e763b5a85c
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Variable identifiers and descriptions – machine-readable – English
变量标识符及其描述——机器可读形式·英文
应用场景:
相关数据集
Bharat Scene Text Dataset
场景文本识别
多语言数据
Bharat场景文本数据集包含13种语言的图像和文本标注,用于场景文本识别和检测。数据集详细记录了每种语言的图像数量、总词数及带有识别标注的词数,并通过JSON文件格式提供文本的标注信息。
github
2024-05-03 更新
49
0
LeWiDi-2025
自然语言处理
多语言数据
LeWiDi-2025数据集是一个用于训练和评估自然语言处理模型的资源,它包含了四个数据集,分别是:Conversational Sarcasm Corpus (CSC)、MultiPICo dataset (MP)、VariErr NLI dataset (VEN)和Paraphrase Detection dataset (Par)。这些数据集覆盖了自然语言处理的多个领域,包括讽刺检测、自然语
arXiv
2025-10-10 更新
44
0
classla/xlm-r-bertic-data
自然语言处理
多语言数据
该数据集包含115亿个克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语的文本单词,是BERTić-data数据集的扩展。新增了MaCoCu HBS爬取集合和mC4 HBS数据集。数据集通过`onion`工具基于5个单词的元组进行去重,重复阈值为90%。
Hugging Face
2024-05-29 更新
28
0
sentence-transformers/miracl
句子嵌入
多语言数据
MIRACL数据集是一个多语言数据集,支持包括英语、阿拉伯语、孟加拉语、西班牙语、波斯语、芬兰语、法语、印地语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语、泰语和中文在内的多种语言。该数据集主要用于特征提取和句子相似性任务。数据集包含多种配置,每种配置都有不同的特征和分割,主要关注三元组数据结构(anchor、positive、negative)。README文件中还提供了每种配置的字节数、示
Hugging Face
2024-06-20 更新
47
0
C4Corpus
多语言数据
网络数据分析
C4Corpus是一个多语言的Web规模数据集,具有免费许可证,用于处理和分析来自CommonCrawl的Creative Commons内容。
github
2024-03-01 更新
31
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广