官方服务:
资源简介:
294,000 science-relevant tuples
包含294,000个与科学相关的元组
应用场景:
相关数据集
pixmo-cap
PixMo-Cap是一个包含详细描述(平均约200字)的图像到文本数据集,主要用于预训练和微调视觉语言模型。数据集的创建过程包括记录注释者对图像的60-90秒的描述,然后使用Claude大型语言模型将音频转录转换为长篇描述。数据集还包括音频转录。PixMo-Cap是PixMo数据集集合的一部分,并用于训练Molmo系列模型。数据集的图像以URL形式存储,需要单独下载。数据集的许可证为ODC-BY-
Hugging Face2024-11-28 更新250
Sera-4.5A-Lite-T2
该数据集包含35615条轨迹数据,是通过在121个SWE-smith代码库上使用GLM-4.5-Air作为教师模型进行第二次SVG rollout生成的,每个函数包含一次SVG运行。其中16000个样本用于训练SERA-32B-GA模型。数据集Sera-4.5-Full-T2是该数据集的超集,每个函数包含三次SVG运行。数据字段包括:messages(生成的轨迹)、instance_id(轨迹ID
Hugging Face2026-01-30 更新150
tulu-3-wildchat-unused
该数据集是Tulu 3偏好混合数据集的一部分,包含来自WildChat的提示,并包含82,783个生成对。这些生成对是通过多种模型生成的,包括Mistral 7B Instruct v0.2、Mistral Nemo Instruct 2407、Tulu 2 7B、Tulu 2 13B、Yi-34B-Chat、Yi-6B-Chat、MPT 30B Chat、MPT 7B 8k Chat、Googl
Hugging Face2024-11-22 更新110
molmo2-ref-davis17
ref-davis17 跟踪数据集是一个用于视频对象跟踪任务的数据集,包含视频对象跟踪的标注信息。数据集配置包括默认的 'track' 配置,该配置跟踪所有帧中的点,并提供训练和验证两个分割。数据集的许可证为 Apache 2.0,适用的任务类别包括视频分类和对象检测,标签涉及视频对象跟踪和视频分割。用户可以通过 HuggingFace 的 datasets 库加载数据集,具体使用示例见 READ
Hugging Face2026-03-03 更新150
tulu-3-ultrafeedback-cleaned-on-policy-8b
该数据集是一个偏好数据集,属于Tulu 3偏好混合的一部分。它包含从Ai2的Ultrafeedback清理版本中提取的提示,并进一步过滤以移除ShareGPT的实例。数据集包含41.6k生成对,这些生成对来自多个模型,包括Mistral 7B Instruct v0.2、Tulu 2 7B、Yi-34B-Chat等。生成过程结合了on-policy和off-policy数据,并使用Ultrafee
Hugging Face2024-11-22 更新120



