遇见数据集

mteb/llm-eval-public-health-qa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于信息检索或文本匹配任务的数据集,包含三个主要配置:1) corpus配置:包含172个文档,每个文档有_id、title和text字段,用于构建文档库;2) queries配置:包含100个查询,每个查询有_id和text字段;3) default配置:包含100个测试样本,每个样本有query-id、corpus-id和score字段,用于评估查询与文档之间的相关性得分。数据集总大小约150KB,适用于自然语言处理中的检索和排序实验。

This dataset is designed for information retrieval or text matching tasks, consisting of three main configurations: 1) corpus configuration: includes 172 documents, each with _id, title, and text fields, used to build a document repository; 2) queries configuration: includes 100 queries, each with _id and text fields; 3) default configuration: includes 100 test samples, each with query-id, corpus-id, and score fields, used to evaluate relevance scores between queries and documents. The total dataset size is approximately 150KB, suitable for retrieval and ranking experiments in natural language processing.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/llm-eval-public-health-qa 数据集图片
构建方式
llm-eval-public-health-qa数据集专为大语言模型在公共健康领域的问答评估而构建,其设计基于信息检索与查询匹配的范式。数据集包含三个核心配置:corpus配置存储了172篇公共健康相关的文档,每篇文档包含标题与正文;queries配置收录了100条查询问题,每条问题对应一个文本描述;default配置则提供了100条测试样本,每条样本将查询与文档通过相关性分数进行配对。这种多配置结构使得数据集能够支持从文档检索到答案生成的完整评估流程。
特点
该数据集的一个显著特点在于其高度聚焦于公共健康领域,涵盖的172篇文档和100条查询均围绕该领域的核心主题展开,确保了评估任务的领域专精性。此外,数据集通过明确的查询-文档配对和相关性评分,为衡量语言模型在信息检索和知识利用方面的能力提供了标准化的测试基准。其规模虽精简,但每个样本均经过精心设计,能够有效考察模型在专业语境下处理问答任务的表现。
使用方法
使用该数据集时,研究人员通常需从加载corpus和queries两个配置开始,构建文档索引与查询集合。随后,通过default配置中的测试样本,利用查询文本在文档库中检索相关文档,并与给定的相关性分数进行对比,以评估模型检索的准确性。此外,该数据集也适用于训练或微调检索式问答系统,其中查询与文档的配对可直接作为监督信号。使用Hugging Face的datasets库加载时,应指定config_name参数以获取所需的数据子集。
背景与挑战
背景概述
在自然语言处理与公共健康交叉领域,如何高效、准确地从海量非结构化医学文献中检索与公共卫生问题相关的信息,成为一项关键挑战。llm-eval-public-health-qa数据集应运而生,旨在评估和提升大规模语言模型在公共卫生问答任务中的表现。该数据集由研究机构构建,包含172篇公共卫生相关文档构成的语料库,以及100个精心设计的查询问题和对应的相关性标注,覆盖了疾病防控、健康政策、流行病学等多个核心议题。其创建立足于推动信息检索系统在专业领域的鲁棒性与可解释性,为公共健康领域的智能决策支持提供了标准化评测基准,对促进AI辅助医疗信息获取具有重要学术和实践价值。
当前挑战
该数据集所解决的领域核心挑战在于,公共卫生信息检索面临专业术语歧义性高、知识更新频繁、用户查询意图多样等问题,传统检索模型难以精准匹配用户实际需求。构建过程中,研究者需克服多重困难:其一,从权威来源筛选并清洗非结构化文本,确保语料覆盖全面且无医学知识偏差;其二,设计能反映真实用户情景的查询语句,避免过度简化或偏离实际应用场景;其三,人工标注关联性分数时需兼顾专家经验的一致性与可重复性,降低主观噪声。这些挑战共同决定了数据集能否真实评估模型在复杂公共卫生语境下的泛化能力。
常用场景
经典使用场景
llm-eval-public-health-qa数据集专为评估大语言模型在公共卫生领域的问答能力而设计。该数据集包含了100个精心构建的查询问题与172篇相关语料文档,覆盖公共卫生知识、政策、疫情应对等多个维度。研究者可借助该数据集,系统性地检验语言模型在医疗健康信息检索、证据综合与答案生成方面的表现,尤其关注模型能否从专业语料中精准提取关键信息并形成可靠回答。这一场景模拟了真实世界中公众或卫生工作者向智能系统咨询健康问题的互动过程。
衍生相关工作
围绕该数据集,学术界已衍生出多项具有影响力的工作,包括面向医疗领域的检索增强生成模型优化研究、基于该基准的跨模型对比分析,以及针对公共卫生文本的指代消解与实体链接任务。部分研究者进一步扩展了该数据集,引入多语种查询与跨机构知识库,探索语言模型在低资源场景下的泛化能力。这些工作共同丰富了面向特定领域的语言模型评估方法论,为构建安全可靠的医疗AI系统奠定了实证基础。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型在公共卫生领域的问答能力评估,当前前沿研究方向包括利用检索增强生成技术提升模型对专业医学知识的引用准确性与回答可靠性。研究热点围绕全球公共卫生事件中的信息可信度验证,例如新冠疫情相关症状、预防措施及疫苗接种等问题的自动化应答,以检验模型在低资源、高敏感场景下的表现。该数据集的意义在于推动医疗AI从通用对话向领域垂直化发展,为构建可解释、可溯源的健康信息助手提供标准化评测基准,同时为应对健康谣言传播与临床决策支持场景奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务