遇见数据集

eleusis-oracle-sft

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

本数据集专为训练或评估能够处理多轮交互、工具调用和基于规则决策的AI模型而设计。数据样本结构复杂,每个样本包含提示和完成两部分,其中提示和完成均具有角色和内容字段。完成部分进一步包含工具调用信息,如工具调用ID、类型和函数(包括函数名和参数)。此外,数据集提供丰富的元数据字段,包括工具列表、数据集版本、源模型、源策略、源规则数据集仓库ID、源规则数据集版本、数据分割、规则ID、规则族、规则代码、起始卡牌、初始手牌(字符串列表)、已使用回合数、是否解决、奖励、信息增益奖励、最终候选数量、最大回合数、消息数量、工具调用数量和布局尝试次数。这些字段共同指向一个基于特定规则集的任务环境,涉及多轮决策、工具使用和奖励反馈,适用于游戏AI、规划或复杂问题解决等场景。数据集总大小为13.3 MB,包含训练集(635个样本)和验证集(159个样本)两个分割。

This dataset comprises data for training or evaluating AI models capable of handling multi-turn interactions, tool calling, and rule-based decision-making. The data samples feature a complex structure, with each sample containing a prompt and a completion. Both the prompt and completion include the `role` and `content` fields. The completion section additionally incorporates tool_calls information, which elaborates on the ID, type, and function (including the function name and parameters) of the tool call, alongside the tool_call_id. Furthermore, the dataset provides a comprehensive set of metadata fields including tools, dataset_version, source_model, source_policy, source_rule_dataset_repo_id, source_rule_dataset_version, split, rule_id, rule_family, rule_code, starter_card, initial_hand (a list of strings), turns_used, solved, reward, information_gain_reward, final_candidate_count, max_turns, num_messages, num_tool_calls, and layout_attempt. Collectively, these fields define a task environment built on specific rule sets, involving multi-turn decision-making, tool utilization, and reward feedback, which can be applied to scenarios such as game AI, automated planning, and complex problem-solving. The total size of the dataset is 13.3 MB, and it includes two data splits: the training set (635 samples) and the validation set (159 samples).

创建时间:
2026-07-07
原始信息汇总

数据集概述:Eleusis Oracle SFT

数据集结构

  • 特征字段
    • prompt:对话提示,包含 role(角色)和 content(内容)
    • completion:模型完成输出,包含 rolecontenttool_calls(工具调用,含 idtypefunctionnamearguments)以及 tool_call_id
    • tools:工具定义(字符串)
    • dataset_version:数据集版本
    • source_model:生成数据的源模型
    • source_policy:生成策略
    • source_rule_dataset_repo_id:规则数据集仓库ID
    • source_rule_dataset_version:规则数据集版本
    • split:数据划分(如 train/validation)
    • rule_id:规则ID
    • rule_family:规则家族
    • rule_code:规则代码
    • starter_card:起始卡牌
    • initial_hand:初始手牌(字符串列表)
    • turns_used:使用回合数(浮点数)
    • solved:是否解决(浮点数)
    • reward:奖励(浮点数)
    • information_gain_reward:信息增益奖励(浮点数)
    • final_candidate_count:最终候选数量(浮点数)
    • max_turns:最大回合数(浮点数)
    • num_messages:消息数量(整数)
    • num_tool_calls:工具调用次数(整数)
    • layout_attempt:布局尝试次数(整数)

数据集规模

  • 总大小:12,686,507 字节(下载大小),13,314,670 字节(数据集大小)
  • 划分
    • 训练集:635 个样本,10,635,762 字节
    • 验证集:159 个样本,2,678,908 字节

数据文件

  • 默认配置(default)
    • 训练集:data/train-*
    • 验证集:data/validation-*
搜集汇总
数据集介绍
eleusis-oracle-sft 数据集图片
构建方式
在人工智能对齐与工具调用领域,监督微调(SFT)数据集的构建至关重要。eleusis-oracle-sft数据集通过模拟复杂的工具调用交互场景,利用大规模语言模型生成对话对。具体而言,系统基于一组预定义的规则和初始手牌状态,驱动模型作为“预言机”角色,在每轮对话中产生包含工具调用、参数查询或决策回复的完成序列。每条数据记录了完整的提示(prompt)和完成(completion),其中完成部分结构化存储了角色、内容、工具调用ID及其函数参数,从而构建出多样化的多轮交互样本。
特点
该数据集的核心特点在于其精细的结构化设计和丰富的元信息。每条样本包含多达二十余个字段,不仅记录了对话历史与工具调用细节,还涵盖了来源模型、策略、规则族、规则代码以及游戏状态(如初始手牌、迭代轮次)。特别地,数据提供了求解状态(solved)、奖励值(reward)和信息增益奖励(information_gain_reward)等评估指标,使得该数据集不仅适用于对话生成训练,还能用于评估模型在工具调用环境下的规划与推理能力。
使用方法
使用eleusis-oracle-sft数据集进行模型微调时,推荐采用其默认配置,加载训练集和验证集。每条样本的prompt字段可直接作为输入,completion字段作为目标输出,其中包含的工具调用信息可被用于训练模型调用外部函数的能力。由于数据已预先划分为标准化的JSON格式,通过HuggingFace的datasets库即可便捷加载。研究者可进一步利用规则代码(rule_code)和求解状态等元信息,设计课程学习策略或针对困难样例进行重点训练,以提升模型在工具使用场景下的泛化性能。
背景与挑战
背景概述
该数据集名为eleusis-oracle-sft,由研究机构于近期创建,专注于基于规则与对话的智能推理任务,核心研究问题在于探索如何通过监督微调(SFT)训练语言模型在复杂规则博弈(如Eleusis卡牌游戏)中进行逻辑推断与工具调用。数据集来源于模拟环境中的多轮交互,包含了提示、完成、工具调用以及丰富的元信息(如规则代码、初始手牌、奖励信号),旨在推动模型在结构化规则理解与动态策略规划方面的能力。其对相关领域的影响力体现在为评估和提升大语言模型在规则导向、多步推理与工具使用场景下的性能提供了标准化基准,有望促进人机协作与自动化决策系统的发展。
当前挑战
数据集所解决的领域问题挑战在于,传统语言模型在缺乏明确规则约束和工具交互的静态任务中表现良好,但在需要实时理解复杂规则、动态调整策略并调用外部工具的交互式环境中,容易陷入逻辑混乱或遗忘规则。具体构建过程中,挑战包括:其一,如何设计多样化的规则实例以确保覆盖广泛的推理模式,避免模型过拟合于特定规则结构;其二,在多轮对话中精确标注工具调用时机与参数,维护状态一致性以防止数据噪声;其三,平衡数据集规模与质量,仅635个训练样本和159个验证样本对模型泛化能力构成严峻考验,需通过规则抽象与数据增强来缓解稀疏性问题。
常用场景
经典使用场景
Eleusis-Oracle-SFT数据集专为训练大型语言模型在复杂推理与工具调用场景下的能力而构建。其核心应用在于教导模型理解并执行多轮交互中的函数调用逻辑,例如在Eleusis纸牌游戏这一抽象推理任务中,模型需根据规则动态调用工具以推断隐藏信息。该数据集通过结构化的对话样本——包含明确的角色轮换、工具调用标识与参数定义——使模型学会在有限回合内整合观察、执行工具并更新信念状态,从而提升其结构化推理与符号操作的能力。
解决学术问题
该数据集针对性解决了当前语言模型在规则约束下的多步推理与工具协同使用研究中的关键瓶颈。传统监督微调数据往往忽略了对函数调用连贯性与因果关系的建模,而Eleusis-Oracle-SFT通过记录完整的游戏轨迹(包括工具调用、奖励信号与信息增益),为探究模型如何从反馈中迭代优化策略提供了基准。它推动了关于语言模型能否通过示例学习隐式规则并泛化至未见情景的学术讨论,为研究结构化世界模拟中的推理与决策过程奠定了数据基础。
衍生相关工作
围绕Eleusis-Oracle-SFT已萌发出多个经典研究方向。其中,基于该数据集的工具增强型语言模型训练范式被广泛借鉴,衍生出诸如“规则发现与因果推理”工作量,用于探测模型在过程奖励信号下的内部表征迁移。此外,其结构化的对话格式启发了对“可解释工具调用路径”的分析研究,促使学者开发出从工具使用序列中提取决策理由的方法。更广泛地,该数据集作为Eleusis游戏环境的语言监督信号,推动了组合性泛化与假设验证等认知科学议题在NLP领域的实证检验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务