遇见数据集

Harvard-DCML/tis-dolci-subset-datasets-gtr-t5-base

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于嵌入或检索重排任务的数据集集合,包含多个子数据集,每个子数据集基于不同的源数据集构建。具体包括embed_rr_bbh_10000、embed_rr_codex_10000、embed_rr_gsm8k_10000、embed_rr_mmlu_pro_10000和embed_rr_tydiqa_10000,每个子数据集包含10,000个训练示例。数据特征包括id、messages(消息列表,每个消息包含内容、角色等信息)、source_dataset(源数据集标识)和domain(领域)。这些数据集可能用于训练或评估自然语言处理模型,特别是在多轮对话或问答任务中。

This dataset is a collection for embedding or retrieval reranking tasks, consisting of multiple sub-datasets each built from different source datasets. It includes embed_rr_bbh_10000, embed_rr_codex_10000, embed_rr_gsm8k_10000, embed_rr_mmlu_pro_10000, and embed_rr_tydiqa_10000, with each sub-dataset containing 10,000 training examples. The features include id, messages (a list of messages with content, role, etc.), source_dataset, and domain. These datasets are likely used for training or evaluating natural language processing models, particularly in multi-turn dialogue or question-answering tasks.

提供机构:
Harvard-DCML
二维码
社区交流群
二维码
科研交流群
商业服务