遇见数据集

Harvard-DCML/tis-dolci-subset-datasets-Qwen3-4B-Base

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多个配置,每个配置针对不同的源数据集(如BBH、Codex、GSM8K、MMLU Pro、TyDiQA)和应用不同处理方法(如dg、knn_kde、knn_uniform、rr、uot、rds_rr)。每个配置包含10000个训练示例,特征包括id、messages(含content和role字段)、source_dataset和domain。数据以对话或消息格式组织,可能用于自然语言处理任务,但未提供具体应用描述。

This dataset includes multiple configurations, each targeting different source datasets (e.g., BBH, Codex, GSM8K, MMLU Pro, TyDiQA) and applying different processing methods (e.g., dg, knn_kde, knn_uniform, rr, uot, rds_rr). Each configuration contains 10,000 training examples, with features including id, messages (with content and role fields), source_dataset, and domain. The data is organized in a conversational or message format, potentially for natural language processing tasks, but no specific application description is provided.

提供机构:
Harvard-DCML
二维码
社区交流群
二维码
科研交流群
商业服务