Harvard-DCML/tis-dolci-subset-datasets-gtr-t5-base
收藏资源简介:
该数据集是一个用于嵌入或检索重排任务的数据集集合,包含多个子数据集,每个子数据集基于不同的源数据集构建。具体包括embed_rr_bbh_10000、embed_rr_codex_10000、embed_rr_gsm8k_10000、embed_rr_mmlu_pro_10000和embed_rr_tydiqa_10000,每个子数据集包含10,000个训练示例。数据特征包括id、messages(消息列表,每个消息包含内容、角色等信息)、source_dataset(源数据集标识)和domain(领域)。这些数据集可能用于训练或评估自然语言处理模型,特别是在多轮对话或问答任务中。
This dataset is a collection for embedding or retrieval reranking tasks, consisting of multiple sub-datasets each built from different source datasets. It includes embed_rr_bbh_10000, embed_rr_codex_10000, embed_rr_gsm8k_10000, embed_rr_mmlu_pro_10000, and embed_rr_tydiqa_10000, with each sub-dataset containing 10,000 training examples. The features include id, messages (a list of messages with content, role, etc.), source_dataset, and domain. These datasets are likely used for training or evaluating natural language processing models, particularly in multi-turn dialogue or question-answering tasks.



