Harvard-DCML/tis-dolci-subset-datasets-Qwen3-4B-Base
收藏资源简介:
该数据集包含多个配置,每个配置针对不同的源数据集(如BBH、Codex、GSM8K、MMLU Pro、TyDiQA)和应用不同处理方法(如dg、knn_kde、knn_uniform、rr、uot、rds_rr)。每个配置包含10000个训练示例,特征包括id、messages(含content和role字段)、source_dataset和domain。数据以对话或消息格式组织,可能用于自然语言处理任务,但未提供具体应用描述。
This dataset includes multiple configurations, each targeting different source datasets (e.g., BBH, Codex, GSM8K, MMLU Pro, TyDiQA) and applying different processing methods (e.g., dg, knn_kde, knn_uniform, rr, uot, rds_rr). Each configuration contains 10,000 training examples, with features including id, messages (with content and role fields), source_dataset, and domain. The data is organized in a conversational or message format, potentially for natural language processing tasks, but no specific application description is provided.



