Biomedical associations predictions
收藏相关数据集
CAMEL
The CAMEL dataset features an extensive collection of around 584K instructions, among which 107K have been translated into multiple languages. This dataset provides a wide array of dialogue resources
github.com2023-03-31 更新1200
MOLE
MOLE数据集由KAUST研究机构创建,包含10000个标记的Tokens,用于命名实体识别(NER)和词性标注(PoS)任务。该数据集旨在帮助从科学论文中自动提取元数据属性,支持多语言数据集,包括阿拉伯语、英语、俄语、法语和日语。数据集的创建过程涉及对52篇不同语言的论文进行手动标注,并使用结构化模式进行元数据属性的提取和验证。MOLE数据集的发布旨在促进科学研究的可发现性和可重复性,并推动基于
arXiv2025-05-26 更新610
Dataset and code for automated classical and EDoF lens design
This file includes (1) automated classical lens design code and (2) test images and reconstruction network checkpoints for EDoF imaging.
Zenodo2023-09-19 更新20
PlanQA
PlanQA是一个诊断性基准,用于评估大型语言模型(LLMs)在室内场景中进行几何和空间推理的能力。数据集包含1800个结构化的2D室内布局,包括厨房、客厅和卧室,每个布局都配有一个自然语言问题,要求模型计算距离、评估放置可行性、评估可见性以及推理空间约束。数据集涵盖了各种问题类型,包括度量推理、拓扑推理以及室内设计约束,例如可达性、间隙、平衡和可用性。通过这个数据集,研究人员可以评估LLMs在模
arXiv2025-07-10 更新670
ITU Radio Regulations QA Dataset
本数据集是一个针对无线电法规领域的问题回答专用数据集,由权威来源构建,并经过自动化过滤和人工验证。数据集内容直接来源于国际电信联盟(ITU)的无线电法规,包含多个选择题对,经过自动化生成、LLM判断和人工验证。数据集的创建旨在为评估RAG在无线电法规领域的性能提供一个测试平台,并为未来研究提供一个可重用的测试床。数据集应用于无线电法规领域,旨在解决对法规的精确解释问题。
arXiv2025-09-12 更新320



