Harvard-DCML/tis-dolci-subset-datasets-SmolLM3-3B-Base
收藏资源简介:
该数据集包含多个配置,每个配置基于不同的源数据集(如BBH、Codex、GSM8K、MMLU-Pro、TyDiQA)和采样方法(如less_dg、less_knn_kde、less_knn_uniform、less_rr、less_uot、rds_rr)生成,用于训练或评估语言模型。每个配置包含10000个训练示例,特征包括id、消息列表(含内容、角色等)、源数据集和领域信息。数据集旨在支持多样化任务,如推理、问答和代码生成,通过不同采样策略增强模型泛化能力。
This dataset includes multiple configurations, each generated from different source datasets (e.g., BBH, Codex, GSM8K, MMLU-Pro, TyDiQA) and sampling methods (e.g., less_dg, less_knn_kde, less_knn_uniform, less_rr, less_uot, rds_rr), designed for training or evaluating language models. Each configuration contains 10,000 training examples, with features such as id, messages list (including content, role, etc.), source dataset, and domain information. The dataset aims to support diverse tasks like reasoning, question answering, and code generation, enhancing model generalization through varied sampling strategies.




