CasiMedicos-Arg|医学问答数据集|论证分析数据集
收藏Antidote CasiMedicos Datasets
数据集概述
该数据集基于CasiMedicos项目,该项目由医学专业人员组成的社区,自愿且免费地发布关于Resident Medical Intern考试(MIR)中可能答案的书面解释。这些考试通过多选题问卷评估医学生,有时通过简短的临床案例进行情境化。
数据集内容
- casimedicos-raw: 包含原始MIR考试和西班牙医学医生编写的解释的纯文本文档。
- casimedicos-exp: 对解释部分的标注,将解释中的部分与可能的答案相关联。
- casimedicos-arg: 对论证结构的标注,包括论证组件、关系、话语标记、医疗治疗和诊断。
casimedicos-raw
- 包含2011-2014年、2016年以及2018-2022年的1,561个带注释的问题。
- 选择包含临床案例的问题后,文档数量从1,561减少到622。
- 下载链接: casimedicos-raw
casimedicos-exp
- 基于casimedicos-raw中包含临床案例的文档。
- 手动标注了正确和错误答案解释的开始和结束位置。
- 提供了格式化的数据集: casimedicos-exp-squad-format
引用
-
casimedicos-raw: bibtex @inproceedings{Agerri2023HiTZAntidoteAE, title={HiTZ@Antidote: Argumentation-driven Explainable Artificial Intelligence for Digital Medicine}, author={Rodrigo Agerri and I{~n}igo Alonso and Aitziber Atutxa and Ander Berrondo and Ainara Estarrona and Iker Garc{i}a-Ferrero and Iakes Goenaga and Koldo Gojenola and Maite Oronoz and Igor Perez-Tejedor and German Rigau and Anar Yeginbergenova}, booktitle={SEPLN 2023: 39th International Conference of the Spanish Society for Natural Language Processing.}, year={2023} }
-
casimedicos-exp: bibtex @misc{goenaga2023explanatory, title={Explanatory Argument Extraction of Correct Answers in Resident Medical Exams}, author={Iakes Goenaga and Aitziber Atutxa and Koldo Gojenola and Maite Oronoz and Rodrigo Agerri}, year={2023}, eprint={2312.00567}, archivePrefix={arXiv} }
联系信息
- Rodrigo Agerri (rodrigo.agerri@ehu.eus)

- 1CasiMedicos-Arg: A Medical Question Answering Dataset Annotated with Explanatory Argumentative Structures法国蔚蓝海岸大学,CNRS,Inria,I3S · 2024年
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
MUStARD++
MUStARD++是一个多模态讽刺检测数据集,由萨里大学创建,旨在通过语言、语音和视觉线索全面捕捉讽刺现象。数据集包含1202个视频样本,来源于多个流行电视节目,通过手动标注确保高质量的讽刺标签。创建过程中,研究者们通过多轮标注和验证确保数据的准确性和多样性。该数据集主要应用于自动讽刺检测,帮助机器理解并识别讽刺语境,解决讽刺识别中的多模态挑战。
arXiv 收录
GME Data
关于2021年GameStop股票活动的数据,包括每日合并的GME短期成交量数据、每日失败交付数据、可借股数、期权链数据以及不同时间框架的开盘/最高/最低/收盘/成交量条形图。
github 收录
中国行政区划数据
本项目为中国行政区划数据,包括省级、地级、县级、乡级和村级五级行政区划数据。数据来源于国家统计局,存储格式为sqlite3 db文件,支持直接使用数据库连接工具打开。
github 收录
Solar Radiation Data
该数据集包含全球多个地点的太阳辐射数据,涵盖了不同时间段和气象条件下的辐射强度。数据包括直接辐射、散射辐射和总辐射等指标,适用于太阳能资源评估和气候研究。
www.nrel.gov 收录