官方服务:
资源简介:
Source: Jude the Apostle
应用场景:
相关数据集
clips/mteb-nl-dutch-cola
荷兰语可接受性语料库(Dutch CoLA)是一个针对荷兰语编写文本的可接受性分类的语料库。它包含文本和对应的可接受性标签,用于训练和评估文本嵌入模型。
Hugging Face2025-10-15 更新310
clips/beir-nl-trec-covid
BEIR-NL是BEIR基准的荷兰语翻译版本,涵盖了多个领域的任务,如事实核查、问答、生物医学信息检索等。数据集结构包括corpus、queries和qrels文件,分别包含文档、查询和查询文档相关性判断。数据集创建的目的是为了促进荷兰语信息检索模型的发展,通过自动翻译BEIR数据集实现。此外,数据集存在一些局限性,如非原生荷兰语资源、数据污染和基准有效性随时间变化的问题。
Hugging Face2025-02-10 更新150
BramVanroy/belebele_dutch
这是一个处理过的Facebook Belebele荷兰语数据集版本,数据格式适用于监督微调(SFT)和偏好调优(如DPO)。数据集包含两个配置:sft和prefs,分别用于监督微调和偏好调优。sft配置包含prompt、prompt_id和messages列,而prefs配置包含prompt、prompt_id、chosen和rejected列。数据集的处理方式受到bagel项目的启发,但在Flo
Hugging Face2024-04-15 更新130
BEIR-NL
BEIR-NL是一个用于荷兰语信息检索的零样本评估基准,由安特卫普大学CLiPS团队通过自动翻译BEIR数据集中的14个子数据集创建。该数据集涵盖了从生物医学到金融等多个领域的信息检索任务,包含大量查询和文档,平均每个查询对应多个相关文档。数据集的创建过程包括选择合适的翻译工具(如Gemini-1.5flash)进行批量翻译,并进行了翻译质量评估。BEIR-NL旨在为荷兰语信息检索模型的开发和评估
arXiv2024-12-11 更新190
jjzha/imdb-dutch-instruct
该数据集是原始IMDB电影评论数据集的荷兰语翻译版本,并转换为指令风格,用于情感分类。数据集包含荷兰语数据,分为训练集和测试集,每个集合包含24992个样本。数据字段包括inputs(以问题开头的字符串,询问评论是正面还是负面)、targets(带有模板前缀和最终标签的字符串)、template_lang(指示句子语言的字符串)和template_id(指示使用模板的整数)。
Hugging Face2024-01-23 更新140



