difficult_retrieval
收藏资源简介:
该数据集用于论文《Hyper-multi-step: The Truth Behind Difficult Long-context Tasks》,包含了一系列长上下文检索任务。数据集分为简单任务和困难任务两类。简单任务包括直接的键值检索和多步键值检索,而困难任务则涉及基于逻辑的检索、多匹配检索等。每个任务都有特定的文件名格式,表示任务类型和上下文大小。数据集的列包括任务的完整提示、金键(即正确答案的键)和金值(即正确答案的值)。
This dataset is designed for the paper *Hyper-multi-step: The Truth Behind Difficult Long-context Tasks*, and includes a series of long-context retrieval tasks. The dataset is divided into two categories: simple tasks and difficult tasks. Simple tasks cover direct key-value retrieval and multi-step key-value retrieval, while difficult tasks involve logic-based retrieval, multi-match retrieval, and other similar task types. Each task follows a specific filename format that indicates the task type and context size. The columns of the dataset include the complete prompt of the task, the golden key (i.e., the key corresponding to the correct answer), and the golden value (i.e., the value corresponding to the correct answer).
Difficult Long-context Retrieval Tasks 数据集
数据集概述
该数据集用于论文 "Hyper-multi-step: The Truth Behind Difficult Long-context Tasks",包含了一系列长上下文检索任务。
任务类型
简单任务
- simple_k2v: 直接键到值的检索。给定键,模型需要检索对应的值。
- simple_v2k: 直接值到键的检索。给定值,模型需要检索对应的键。
- multi_step(kv): 多步(正式)KV检索。模型需要通过多个查询检索多个值,然后将这些值连接形成新键,最后检索对应的值。
困难任务
- logic(kv): 基于逻辑的KV检索。所有值的范围为0-9。给定值的范围,模型需要检索对应的键。
- logic(resume): 基于逻辑的学生简历检索。给定GPA范围,模型需要检索GPA在该范围内的学生。
- multi_match(kv): 多匹配KV检索。给定值,模型需要检索多个对应的键。
- multi_match(resume): 多匹配学生简历检索。给定大学名称,模型需要检索来自该大学的多个学生。
- multi_match_last(kv): 多匹配KV检索。给定值,模型需要检索多个对应的键。其他黄金键已在提示中给出,最后一个键除外。
文件命名含义
- logic_kv_10: 基于逻辑的KV检索任务,上下文包含10个KV项。
- 3_match_resume_100: 多匹配学生简历检索任务,上下文包含100个学生,模型需要检索3个学生。
- concat_3_kv_100_cot: 多步KV检索任务,上下文包含100个KV项,模型需要通过3个查询检索3个值并连接。提示风格为Chain-of-Thought (CoT)。
数据集列
- prompt: 任务的完整提示。
- gold_keys: KV检索任务的黄金键。如果只有一个黄金键,则为字符串;否则为字符串列表。在学生简历检索中,为学生姓名(或学生姓名列表)。
- gold_values: KV检索任务的黄金值。如果只有一个黄金值,则为字符串;否则为字符串列表。在学生简历检索中,为学生的GPA或大学(或它们的列表)。
注意:在基于逻辑的检索和多匹配检索任务中,gold_keys实际上是提示的答案。




