Mammal Yawn Videos
收藏ICLR Peer Review and Rebuttal Process Dataset
该数据集包含从ICLR 2024和2025年收集的同行评审和反驳过程数据,数据来自OpenReview平台,包括评审者ID、初始评分和反驳后评分。评审者评分变化被追踪,使用追踪分数指标来评估评审者连续性,分数≤1表示有效使用,≥2需双重检查。数据许可证为CC BY 4.0。
github 收录
COCA (Corpus of Contemporary American English)
COCA是一个包含超过5.2亿词的英语语料库,涵盖了从1990年至今的文本。它包括口语、小说、流行杂志、报纸和学术文章五种文体,旨在反映当代美国英语的使用情况。
www.english-corpora.org 收录
AirSafe_DB
该数据集包含了从Plane Crash Info网站上抓取的飞机事故的结构化信息,原始数据为CSV格式,经过AI模型处理后生成了标准化的JSON格式数据。数据集包含5049条记录,每条记录包括事故信息(日期、时间、地点等)、飞机信息(运营商、航班号、机型等)、伤亡统计(总死亡人数、机组人员、乘客、地面人员等)、事故摘要(事故描述、事故类型、飞行阶段等)等内容。数据经过标准化处理,确保数据质量和一致性,适用于分析和研究。
huggingface 收录
TCM-Tongue
TCM-Tongue是一个专门用于人工智能辅助中医舌诊的标准化舌像数据集,包含6719张在标准化条件下捕获的高质量图像,并标注了20种病理症状类别(平均每张图像有2.54个经过临床验证的标签,所有标签均由持有执照的中医执业医师验证)。数据集支持多种标注格式(COCO、TXT、XML),以方便广泛使用,并使用九种深度学习模型进行了基准测试,以展示其在人工智能开发中的实用性。该资源为推进可靠的中医计算工具提供了关键基础,填补了该领域的数据短缺,并通过标准化、高质量的诊断数据促进了人工智能在研究和临床实践中的整合。
arXiv 收录
全国兴趣点(POI)数据
POI(Point of Interest),即兴趣点,一个POI可以是餐厅、超市、景点、酒店、车站、停车场等。兴趣点通常包含四方面信息,分别为名称、类别、坐标、分类。其中,分类一般有一级分类和二级分类,每个分类都有相应的行业的代码和名称一一对应。 POI包含的信息及其衍生信息主要包含三个部分:
CnOpenData 收录
