imdb_dataset_offical|文本分类数据集|情感分析数据集
收藏数据集概述
数据集信息
- 特征:
- text: 数据类型为字符串。
- label: 数据类型为分类标签,包含两个类别:
0
: 表示负面情感 (neg
)1
: 表示正面情感 (pos
)
数据集划分
- train:
- 样本数量: 25000
- 数据大小: 32941755 字节
- test:
- 样本数量: 25000
- 数据大小: 32158562 字节
- unsupervised:
- 样本数量: 50000
- 数据大小: 66097970 字节
数据集大小
- 下载大小: 76731910 字节
- 数据集总大小: 131198287 字节
配置
- config_name: default
- 数据文件路径:
- train:
data/train-*
- test:
data/test-*
- unsupervised:
data/unsupervised-*
- train:
- 数据文件路径:

中国交通事故深度调查(CIDAS)数据集
交通事故深度调查数据通过采用科学系统方法现场调查中国道路上实际发生交通事故相关的道路环境、道路交通行为、车辆损坏、人员损伤信息,以探究碰撞事故中车损和人伤机理。目前已积累深度调查事故10000余例,单个案例信息包含人、车 、路和环境多维信息组成的3000多个字段。该数据集可作为深入分析中国道路交通事故工况特征,探索事故预防和损伤防护措施的关键数据源,为制定汽车安全法规和标准、完善汽车测评试验规程、
北方大数据交易中心 收录
YOLO Drone Detection Dataset
为了促进无人机检测模型的开发和评估,我们引入了一个新颖且全面的数据集,专门为训练和测试无人机检测算法而设计。该数据集来源于Kaggle上的公开数据集,包含在各种环境和摄像机视角下捕获的多样化的带注释图像。数据集包括无人机实例以及其他常见对象,以实现强大的检测和分类。
github 收录
Beijing Traffic
The Beijing Traffic Dataset collects traffic speeds at 5-minute granularity for 3126 roadway segments in Beijing between 2022/05/12 and 2022/07/25.
Papers with Code 收录
AgiBot World
为了进一步推动通用具身智能领域研究进展,让高质量机器人数据触手可及,作为上海模塑申城语料普惠计划中的一份子,智元机器人携手上海人工智能实验室、国家地方共建人形机器人创新中心以及上海库帕思,重磅发布全球首个基于全域真实场景、全能硬件平台、全程质量把控的百万真机数据集开源项目 AgiBot World。这一里程碑式的开源项目,旨在构建国际领先的开源技术底座,标志着具身智能领域 「ImageNet 时刻」已到来。AgiBot World 是全球首个基于全域真实场景、全能硬件平台、全程质量把控的大规模机器人数据集。相比于 Google 开源的 Open X-Embodiment 数据集,AgiBot World 的长程数据规模高出 10 倍,场景范围覆盖面扩大 100 倍,数据质量从实验室级上升到工业级标准。AgiBot World 数据集收录了八十余种日常生活中的多样化技能,从抓取、放置、推、拉等基础操作,到搅拌、折叠、熨烫等精细长程、双臂协同复杂交互,几乎涵盖了日常生活所需的绝大多数动作需求。
github 收录
IMDb Datasets
IMDb Datasets包含电影和电视节目的详细信息,包括电影名称、演员、导演、评分、评论等。数据集分为多个文件,如title.basics.tsv.gz、title.ratings.tsv.gz等,每个文件包含不同类型的信息。
www.imdb.com 收录