遇见数据集

sadeem-ai/sadeem-ar-eval-retrieval-keywords

收藏
Hugging Face2024-05-15 更新2024-06-12 收录
官方服务:

资源简介:

Sadeem Arabic Keywords Retrieval是一个用于阿拉伯语关键词检索任务的评估基准数据集。该数据集属于文本检索类别,包含三个主要部分:qrels、corpus和queries,分别用于存储查询与文档的相关性信息、文档内容和查询内容。数据集的特征包括query-id、corpus-id、score和text,数据类型均为字符串。数据集的下载大小为2859918字节,总大小为5561641字节。

提供机构:
sadeem-ai
原始信息汇总

数据集概述

基本信息

  • 语言: 阿拉伯语 (ar)
  • 多语言性: 单语种
  • 任务类别: 文本检索
  • 任务ID: 文档检索

配置名称

  • 配置名称: test

数据集特征

  • 查询ID (query-id): 数据类型 - 字符串
  • 文库ID (corpus-id): 数据类型 - 字符串
  • 评分 (score): 数据类型 - 字符串
  • 文本 (text): 数据类型 - 字符串

数据集分割

  • qrels分割:
    • 字节数: 105561
    • 示例数: 4178
  • corpus分割:
    • 字节数: 5191545
    • 示例数: 7179
  • queries分割:
    • 字节数: 264535
    • 示例数: 4178

数据集大小

  • 下载大小: 2859918字节
  • 数据集大小: 5561641字节

配置详情

  • 配置名称: test
  • 数据文件路径:
    • qrels分割: test/qrels-*
    • corpus分割: test/corpus-*
    • queries分割: test/queries-*
二维码
社区交流群
二维码
科研交流群
商业服务