遇见数据集

MaltCommunity/fair-freelancer-retrieval

收藏
Hugging Face2026-05-05 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多语言检索数据集,专门用于信息检索和性别相关文本的评估。数据集包含多个配置:基础配置(如brief-corpus、brief-queries、brief-qrels)提供通用检索任务的语料库、查询和相关性标注;性别相关配置(如brief-gender-*-corpus等)针对法语、英语、德语、荷兰语和西班牙语,包含带有性别标记(is_feminine_form字段指示是否为女性形式)的平行语料库。所有数据仅包含测试集,语料库规模从133到4019个示例不等,查询集有200个示例,相关性标注涉及大量查询-文档对。数据集旨在支持跨语言检索和性别偏见分析的研究。

This is a multilingual retrieval dataset designed for information retrieval and gender-related text evaluation. It includes multiple configurations: basic configurations (e.g., brief-corpus, brief-queries, brief-qrels) provide corpus, queries, and relevance judgments for general retrieval tasks; gender-related configurations (e.g., brief-gender-*-corpus, etc.) target French, English, German, Dutch, and Spanish, featuring parallel corpora with gender markers (the is_feminine_form field indicates feminine forms). All data is split into test sets only, with corpus sizes ranging from 133 to 4019 examples, query sets containing 200 examples, and relevance judgments covering a large number of query-document pairs. The dataset aims to support research in cross-lingual retrieval and gender bias analysis.

提供机构:
MaltCommunity
二维码
社区交流群
二维码
科研交流群
商业服务