遇见数据集

Harvard-DCML/tis-dolci-subset-datasets-Llama-3.2-3B

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多配置的对话格式数据集,用于训练和评估语言模型,特别是针对推理和问答任务。它包含多个子集,每个子集基于不同的源数据集(如BBH(Big-Bench Hard)、GSM8K(数学问题)、MMLU Pro(多学科选择题)、TyDiQA(多语言问答)和Codex(代码生成))构建,并采用不同的数据采样或增强方法(例如less_dg、less_knn_kde、less_rr、less_uot、rds_rr)。每个配置包含10,000个训练示例,数据以消息列表形式组织,包括角色(如用户或助手)和内容字段,适用于监督微调或对话生成任务。数据集未提供验证或测试分割,仅包含训练分割。

This dataset is a multi-configuration dialogue-formatted dataset designed for training and evaluating language models, particularly for reasoning and question-answering tasks. It includes multiple subsets, each built from different source datasets (e.g., BBH (Big-Bench Hard), GSM8K (math problems), MMLU Pro (multidisciplinary multiple-choice questions), TyDiQA (multilingual QA), and Codex (code generation)) and employs various data sampling or augmentation methods (such as less_dg, less_knn_kde, less_rr, less_uot, rds_rr). Each configuration contains 10,000 training examples, with data organized as message lists including roles (e.g., user or assistant) and content fields, suitable for supervised fine-tuning or dialogue generation tasks. The dataset does not provide validation or test splits, only training splits.

提供机构:
Harvard-DCML
二维码
社区交流群
二维码
科研交流群
商业服务