登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Question answering accuracy (overall) on real scene benchmark.
Question answering accuracy (overall) on real scene benchmark.
收藏
Figshare
2025-11-13 更新
2026-04-28 收录
医疗问答系统评估
真实场景基准测试
数据链接:
https://figshare.com/articles/dataset/Question_answering_accuracy_overall_on_real_scene_benchmark_/30613877
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Question answering accuracy (overall) on real scene benchmark.
应用场景:
创建时间:
2025-11-13
相关数据集
RepLiQA
医疗问答系统评估
语言模型测试
RepLiQA是一个评估数据集,包含上下文-问题-答案三元组,上下文涉及虚构的实体,如人物或地点,不真实存在。该数据集旨在测试大型语言模型(LLMs)在提供文档中查找和使用上下文信息的能力。与现有问答数据集不同,RepLiQA的非事实性确保模型性能不受LLMs记忆训练数据中事实的能力影响,可以更自信地测试模型利用提供上下文的能力。数据集涵盖17个主题或文档类别,每个文档附带5个问题-答案对。此外,
github
2024-06-19 更新
32
1
relai-ai/rasa-reasoning
对话式AI推理
医疗问答系统评估
这是一个针对问题回答任务的英文数据集,由RELAI使用rasa数据源生成,遵循CC BY 4.0许可。数据集的详细描述在README文件中并未直接给出。
Hugging Face
2025-04-21 更新
9
0
rob-substrate/agent-answers
智能体回答
医疗问答系统评估
该数据集包含了三个子数据集:Gaia、Math和SimpleQA。每个子数据集都由模型ID、动作类型、问题、原始问题、答案、正确答案、来源、中间步骤、开始时间、结束时间和输入输出token计数等特征构成。数据集以测试集的形式提供,分别包含不同数量的示例。
Hugging Face
2025-04-07 更新
7
0
math-extraction-comp/allenai__Llama-3.1-Tulu-3-8B-SFT
医疗问答系统评估
模型性能比较
这是一个包含问题、答案、目标、预测以及其他评估分数字段的数据集,用于训练和评估模型。数据集分为训练集,共有1324个示例。
Hugging Face
2025-01-26 更新
10
0
kap_bir_inference_results
知识问答
医疗问答系统评估
该数据集包含52个训练样本,主要字段包括:唯一标识符(id)、公司名称(company)、问题文本(question)、预期答案(expected_answer)、模型生成答案(model_answer)、模型名称(model_name)以及上下文匹配标记(context_found)。数据集采用单训练集划分,总大小约22KB。数据格式包含字符串、整型和布尔型字段,适用于问答系统评估、企业知识库构
Hugging Face
2026-05-05 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广