遇见数据集

laion/GLM-4.7-swesmith-oracle_verified-complete-lt32k

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: 'null' splits: - name: train num_bytes: 610168813 num_examples: 7318 download_size: 486538342 dataset_size: 610168813 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
laion
原始信息汇总

数据集概述

  • 数据集名称: GLM-4.7-swesmith-oracle_verified-complete-lt32k
  • 发布者: laion (LAION eV)
  • 模态: 文本 (Text)
  • 格式: parquet, optimized-parquet
  • 大小: 1K - 10K 行 (具体为 7,318 行)
  • 总文件大小: 487 MB
  • 支持的库: Datasets, Dask, Polars
  • 下载量 (上月): 无数据

数据集结构

  • 子集: 1 个默认子集 (default),包含 7.32k 行。
  • 划分: 1 个训练集 (train),包含 7.32k 行。
  • 列信息:
    • conversations: 对话内容(JSON 格式,包含系统提示和用户/助手消息)
    • listlengths: 列表长度
    • agent: 智能体类型 (string)
    • model: 使用的模型 (string)
    • model_provider: 模型提供者 (string)
    • date: 日期 (string)
    • task: 任务类型 (string)
    • episode: 剧集编号 (string)
    • run_id: 运行 ID (string)
    • trial_name: 试验名称 (string)
    • result: 结果 (string)
    • verifier_output: 验证器输出 (可能为空)

数据内容示例

  • 数据集中每条记录包含一个多轮对话 (conversations),对话内容为 AI 助手在 Linux 环境中执行命令行任务的过程。
  • 示例任务包括:swesmith-00003swesmith-00004 等,涉及不同剧集 (episode) 和试验。
  • 使用的模型为 terminus-2,模型提供者为 hosted_vllm/1770215343420958

其他信息

  • 数据集卡: README.md 文件存在但内容为空。
  • 可用功能: 支持 Auto-converted to Parquet API、Embed、Duplicate、Data Studio 等操作。
搜集汇总
数据集介绍
laion/GLM-4.7-swesmith-oracle_verified-complete-lt32k 数据集图片
构建方式
GLM-4.7-swesmith-oracle_verified-complete-lt32k数据集源于对话系统的真实应用场景,旨在为大规模语言模型的微调与评估提供高质量的多轮对话数据。其构建过程依托于Oracle验证框架,通过自动化流程与人工校验相结合的方式,确保每一条对话链的完整性与准确性。数据集中每个样本包含完整的对话历史(conversations),并附带模型信息(model、model_provider)、生成时间(date)、任务类型(task)及运行标识(run_id)等元数据,从而支持多维度的追溯与分析。特别地,verifier_output字段保留为null,暗示验证过程已嵌入数据筛选环节,而非直接暴露于最终数据集中。最终,数据集以7318条训练样本的形式呈现,总大小约610MB,所有样本长度均控制在32k tokens以内,兼顾了数据规模与计算效率。
特点
该数据集的核心特点在于其高度的结构化与验证可靠性。首先,每条数据均包含多轮对话的完整记录,角色(role)与内容(content)的字段设计清晰区分了用户与系统交互的边界,便于模型学习对话策略与上下文依赖。其次,丰富的元数据字段(如agent、episode、trial_name)使得研究者能够按需筛选特定来源或实验条件下的数据,从而支持细粒度的性能分析。此外,数据集特定了完整性与低长度(lt32k)的约束,确保样本在上下文窗口受限的环境中仍具实用性。通过Oracle验证机制,数据源的可信度得以增强,有效减少了噪声与不一致性,为语言模型的稳定训练提供了坚实的数据基础。
使用方法
使用本数据集时,推荐将其直接应用于监督式微调(SFT)或对话系统的上下文学习实验。用户可通过HuggingFace Datasets库加载数据,默认使用default配置下的训练集,该集共7318条样本,尺寸约610MB。在加载后,每条样本的conversations字段包含一个多轮对话列表,其中每个元素由role(如user或assistant)和content(文本内容)组成;结合agent与model字段可追溯数据生成源。对于需要长上下文推理的任务,可借助tokenizer将输入截断至32k tokens以内以适配模型限制。此外,为复现特定实验,建议依据task、episode或run_id等字段进行数据子集划分,从而在可控条件下评估模型的泛化能力与鲁棒性。
背景与挑战
背景概述
GLM-4.7-swesmith-oracle_verified-complete-lt32k数据集诞生于对大型语言模型(LLM)在复杂推理任务中可靠性的日益关注。该数据集由研究人员或机构(名称未明示)于近期创建,聚焦于利用GLM-4系列模型与Agent框架的协同作用,通过Oracle验证机制生成高质量的多轮对话数据。其核心研究问题在于如何借助结构化验证提升模型在长上下文(限制于32k令牌以内)任务中的事实正确性与指令遵循能力。该数据集为LLM的微调与评估提供了7318条精炼样本,涵盖多样化的任务类型,对推动Agent驱动的对话系统在可信赖性领域的研究具有重要影响力。
当前挑战
该数据集面临的挑战首先体现在领域问题上:大型语言模型在复杂多步骤推理中普遍存在幻觉与不一致性,尤其是在缺乏外部验证的自主Agent场景下。GLM-4.7-swesmith-oracle_verified-complete-lt32k通过引入Oracle验证器尝试缓解此问题,但构建过程中亦遭遇困境——如何设计涵盖广泛任务且无偏见的验证机制,并确保对话历史长度不超过32k令牌的有效性,同时防止模型对验证模式产生过拟合。此外,数据采集的规模(仅7318例)与来源多样性有限,可能制约模型在未知环境中的泛化能力,而验证器输出的缺失(verifier_output字段为null)又削弱了错误模式分析的深度。
常用场景
经典使用场景
该数据集围绕GLM-4.7模型在复杂推理任务中的对话与验证展开,经典使用场景聚焦于训练和评估大语言模型在长上下文、多轮交互下的逻辑一致性。数据中包含了模型生成的回答以及Oracle验证结果,为研究者提供了探究模型在受限长度(lt32k)内如何保持推理连贯性的宝贵资源。通过这一数据集,可以系统性地分析模型在处理长达32k token的对话时,其推理路径的可靠性与稳定性。
实际应用
在实际应用中,该数据集可用于提升智能客服、法律咨询或医疗问答等需要长期记忆与逻辑推理的行业场景。通过模拟复杂多轮对话,企业可以训练模型在有限上下文窗口内更精准地匹配用户历史需求,尤其适用于处理合同审查、病历分析等需要跨段落关联信息的任务。此外,Oracle验证结果可直接用于模型性能的自动标定,降低人工评估成本。
衍生相关工作
基于该数据集,衍生出多项关于长上下文推理与验证机制的经典工作,如基于Oracle-verified信号的强化学习微调策略、长文本对话中信息衰减的量化建模,以及面向多任务对话的跨场景泛化能力研究。这些工作不仅深化了对GLM系列模型内部推理机制的理解,还催生了新型验证数据集的设计范式,推动了如自我一致性约束训练、分层检索增强生成等方法的诞生,对后续长文本生成领域的研究产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务