登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
dewikIRS36k
dewikIRS36k
收藏
NIAID Data Ecosystem
2026-03-11 收录
多语言信息检索
文档检索
数据链接:
https://zenodo.org/record/3597308
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
German Information Retrieval dataset build with the wikIR tool.
应用场景:
创建时间:
2020-03-12
相关数据集
Fetch-A-Set (FAS)
文档分析
文档检索
Fetch-A-Set (FAS) 是一个专为立法历史文档分析系统设计的大型基准,旨在解决大规模历史文档检索的挑战。该数据集包含从17世纪至今的文档,总计约40万样本,来源于西班牙的立法文档,覆盖三个世纪。FAS数据集的创建过程涉及使用Mask-RCNN模型识别文档区域,并通过sentencebert编码匹配查询与OCR文本。该数据集主要应用于历史文档分析领域,特别是在文本到图像的检索任务中,旨在
arXiv
2024-06-11 更新
83
0
MMDocIR-Challenge
多模态信息检索
文档检索
MMDocIR数据集是为2025年Web会议中的多模态信息检索挑战(MIRC)设计的,属于多模态文档检索挑战赛道。该数据集包含313个文档的20,395页截图,每页包含OCR文本和视觉语言模型(VLM)生成的文本。数据集的主要文件包括`MMDocIR_gt_remove.jsonl`(包含问题及其相关信息)、`MMDocIR_doc_passages.parquet`(包含文档页面的截图和文本信息
Hugging Face
2025-01-26 更新
20
0
EnglishFinance1Retrieval-sample
文档检索
信息检索
这是一个用于金融文档检索评估的样本数据集。它包含6个描述信息需求的查询、10个相应的文档以及6个将查询与文档相关联的相关性判断。
Hugging Face
2025-09-16 更新
8
0
AIR-Bench/qa_news_zh
新闻问答
文档检索
该数据集是一个中文单语文本检索数据集,主要用于文档检索任务。数据集包含一个名为AIR-Bench_24.04的版本,其中包括默认的查询和语料库文件。任务类型为问答(qa),领域为新闻(news),语言为中文(zh)。
Hugging Face
2024-09-28 更新
32
0
mteb/NeuCLIR2023Retrieval_rus_top_250_only_w_correct-v2
多语言信息检索
俄语文本检索
该数据集包含三个配置:corpus、default和queries。corpus配置存储文本数据,default配置可能表示查询和文本之间的关系,queries配置存储查询文本数据。数据集包含测试集,适用于自然语言处理任务。
Hugging Face
2024-09-28 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广