遇见数据集

MLLM-CL/Domain8k

收藏
Hugging Face2026-04-01 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: - config_name: AD features: - name: conversations list: - name: from dtype: string - name: value dtype: string - name: problem dtype: string - name: answer dtype: string - name: images list: image - name: _qid dtype: string splits: - name: train num_bytes: 1832634757 num_examples: 6000 - name: test num_bytes: 610387522 num_examples: 2000 download_size: 2440446183 dataset_size: 2443022279 - config_name: Fin features: - name: conversations list: - name: from dtype: string - name: value dtype: string - name: problem dtype: string - name: answer dtype: string - name: images list: image - name: _qid dtype: string splits: - name: train num_bytes: 270956162 num_examples: 6000 - name: test num_bytes: 89936199 num_examples: 2000 download_size: 359025457 dataset_size: 360892361 - config_name: Med features: - name: conversations list: - name: from dtype: string - name: value dtype: string - name: problem dtype: string - name: answer dtype: string - name: images list: image - name: _qid dtype: string splits: - name: train num_bytes: 338955566 num_examples: 4568 - name: test num_bytes: 144597963 num_examples: 1958 download_size: 483278398 dataset_size: 483553529 - config_name: RS features: - name: conversations list: - name: from dtype: string - name: value dtype: string - name: problem dtype: string - name: answer dtype: string - name: images list: image - name: _qid dtype: string splits: - name: train num_bytes: 2897511270 num_examples: 6000 - name: test num_bytes: 804278517 num_examples: 1702 download_size: 3701283972 dataset_size: 3701789787 - config_name: Sci features: - name: conversations list: - name: from dtype: string - name: value dtype: string - name: problem dtype: string - name: answer dtype: string - name: images list: image - name: _qid dtype: string splits: - name: train num_bytes: 939833758 num_examples: 6000 - name: test num_bytes: 256405446 num_examples: 1537 download_size: 1195524367 dataset_size: 1196239204 configs: - config_name: AD data_files: - split: train path: AD/train-* - split: test path: AD/test-* - config_name: Fin data_files: - split: train path: Fin/train-* - split: test path: Fin/test-* - config_name: Med data_files: - split: train path: Med/train-* - split: test path: Med/test-* - config_name: RS data_files: - split: train path: RS/train-* - split: test path: RS/test-* - config_name: Sci data_files: - split: train path: Sci/train-* - split: test path: Sci/test-* ---

### 数据集元信息 本数据集包含5个配置分支,各分支详情如下: 1. **配置分支:AD** 数据特征包括: - `conversations`:对话列表(conversations),为列表类型,每个列表项包含两个子字段: - `from`:字符串(string)类型,用于标识对话来源 - `value`:字符串(string)类型,存储对话内容 - `problem`:字符串类型,对应问题文本 - `answer`:字符串类型,对应参考答案 - `images`:图像(image)列表,包含该样本关联的图像资源 - `_qid`:字符串类型,样本唯一标识符 数据集划分信息: - 训练集(train):字节占用量为1832634757,共包含6000个样本 - 测试集(test):字节占用量为610387522,共包含2000个样本 该配置分支的下载大小为2440446183,数据集总存储大小为2443022279。 2. **配置分支:Fin** 该分支的数据特征与AD分支完全一致。数据集划分信息如下: - 训练集:字节占用量为270956162,共包含6000个样本 - 测试集:字节占用量为89936199,共包含2000个样本 该配置分支的下载大小为359025457,数据集总存储大小为360892361。 3. **配置分支:Med** 该分支的数据特征与AD分支完全一致。数据集划分信息如下: - 训练集:字节占用量为338955566,共包含4568个样本 - 测试集:字节占用量为144597963,共包含1958个样本 该配置分支的下载大小为483278398,数据集总存储大小为483553529。 4. **配置分支:RS** 该分支的数据特征与AD分支完全一致。数据集划分信息如下: - 训练集:字节占用量为2897511270,共包含6000个样本 - 测试集:字节占用量为804278517,共包含1702个样本 该配置分支的下载大小为3701283972,数据集总存储大小为3701789787。 5. **配置分支:Sci** 该分支的数据特征与AD分支完全一致。数据集划分信息如下: - 训练集:字节占用量为939833758,共包含6000个样本 - 测试集:字节占用量为256405446,共包含1537个样本 该配置分支的下载大小为1195524367,数据集总存储大小为1196239204。 ### 全局配置规则 各配置分支对应的数据文件路径规则如下: - 训练集数据路径:`{配置名}/train-*` - 测试集数据路径:`{配置名}/test-*`

提供机构:
MLLM-CL
二维码
社区交流群
二维码
科研交流群
商业服务