遇见数据集

HRM-He-corpus-objective

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集名为“Hebrew reasoning traces”,用于生成希伯来语推理链(chain-of-thought),专为希伯来语/英语代码专用语言模型设计。它通过基于代码、网络安全、代理、数学和通用推理种子生成推理轨迹,填补了现成希伯来语推理数据几乎不存在的空白。数据集包含多个配置子集:all(默认)、agentic、code、cyber、evol、magpie、math、math_easy、reason 和 web。默认配置保留了所有训练数据,但排除了两种不合格情况:最终答案错误(answer_ok 为 False)和阿拉伯语漂移。每个样本包含以下字段:quality(质量标签,取值为 strict——干净、partial——有推理但无明确答案、direct——有答案但无推理块)、lang_tag(语言标签,若推理以希伯来语为主则为 he,否则为 en,希伯来语答案与英语推理的组合是支持的形态)、train_kind(构建器使用的具体标签,如 he_trace_cyber_partial)。验证集通过对提示进行哈希,保留1%的样本,确保同一种子在多次生成中保持在同一侧。数据由约34个不同的模型生成,model 列记录了每个样本的来源。数据集的语言为希伯来语和英语,许可证为 other,任务类别为文本生成(text-generation)。

The dataset is named Hebrew reasoning traces, designed to generate chain-of-thought reasoning in Hebrew, tailored for Hebrew/English code-specific language models. It fills the gap of almost nonexistent Hebrew reasoning data by generating reasoning traces based on seeds from code, cybersecurity, agent, math, and general reasoning. The dataset includes multiple configuration subsets: all (default), agentic, code, cyber, evol, magpie, math, math_easy, reason, and web. The default configuration retains all training data except for two disqualifying conditions: final answer incorrect (answer_ok is False) and Arabic drift. Each sample contains fields: quality (quality label with values strict for clean, partial for reasoning without explicit answer, direct for answer without reasoning block), lang_tag (language tag he if reasoning is predominantly Hebrew, otherwise en; Hebrew answer with English reasoning is supported), train_kind (specific builder label like he_trace_cyber_partial). The validation set is constructed by hashing prompts and retaining 1% of samples, ensuring the same seed stays on the same side across multiple generations. Data is generated by approximately 34 different models, with the model column recording the source for each sample. The dataset language is Hebrew and English, license is other, and the task category is text-generation.

创建时间:
2026-08-21
原始信息汇总

HRM-He-corpus-objective 数据集概述

基本信息

  • 语言:希伯来语(he)和英语(en)
  • 许可证:其他(other)
  • 任务类别:文本生成(text-generation)
  • 数据格式:Parquet 文件

数据集内容

该数据集包含生成的希伯来语**思维链(chain-of-thought)**数据,覆盖以下领域:

  • 代码(code)
  • 网络安全(cybersecurity)
  • 智能体(agentic)
  • 数学(math)
  • 一般推理(general-reasoning)

数据集专为希伯来语/英语代码专业语言模型构建,旨在弥补现成的希伯来语推理数据几乎不存在的问题。

数据配置

数据集提供默认配置 all 及 9 个特定子配置:

配置名 说明
all 全部数据(默认)
agentic 智能体相关数据
code 代码相关数据
cyber 网络安全相关数据
evol 演化数据
magpie Magpie 数据
math 数学数据
math_easy 简单数学数据
reason 推理数据
web 网络数据

每个配置均包含 trainvalidation 两个分割。

数据筛选标准

默认配置中保留所有训练语料行,但排除以下两类数据:

  1. 最终答案错误answer_ok 为 False)
  2. 阿拉伯语漂移(Arabic drift)

其余数据均保留并打上标签。

数据标签字段

  • quality:数据质量标签
    • strict:干净数据
    • partial:有推理但无明确答案
    • direct:有答案但无推理块
  • lang_tag:语言标签
    • he:希伯来语推理(希伯来语占比 ≥ 0.6)
    • en:英语推理(英语推理搭配希伯来语答案是受支持的形态)
  • train_kind:分片构建器使用的精确标签(如 he_trace_cyber_partial

可通过筛选 quality == strict 获取干净子集,但不同类别中严格数据的占比差异较大。

数据分割

  • 验证集:按提示词哈希保留 1% 数据,确保同一种子在多次重新生成时始终位于同一侧。

数据来源

  • 数据由约 34 种不同模型生成
  • model 列记录了每条数据由哪个模型产生
  • 下游使用需遵守相应模型的条款
搜集汇总
数据集介绍
HRM-He-corpus-objective 数据集图片
构建方式
面向希伯来语这一低资源语言在推理密集型任务中语料极度匮乏的现状,该数据集以代码、网络安全、智能体、数学及通用推理等领域的种子问题为起点,经由约34个不同模型生成希伯来语思维链轨迹,并依据最终答案正确性与语言漂移两项标准进行筛选:错误答案与阿拉伯语漂移样本被剔除,其余样本则保留并以质量等级与语言标签加以标注,从而在保证产出的同时维持语料的可追溯性。
使用方法
使用者可通过Hugging Face datasets库加载all或任一子配置,按需选取训练集与验证集;验证集以提示哈希方式划出1%的留出样本,确保同一问题在多次生成中稳定归属于同一划分。若需高质量子集,可依据quality == 'strict'进行过滤,但需注意严格样本在不同配置中的占比差异显著。使用时应遵循各生成模型的许可条款。
背景与挑战
背景概述
希伯来语作为低资源语言,其高质量推理语料长期匮乏。HRM-He-corpus-objective数据集由希伯来语/英语代码专用语言模型项目构建,旨在填补这一空白。该数据集汇集了覆盖代码、网络安全、智能体、数学及通用推理等领域的希伯来语思维链轨迹,包含strict、partial、direct三种质量标签,并按语言标签和训练类型细分。语料源自约34个模型的生成结果,为希伯来语推理研究提供了关键资源,推动了低资源语言环境下语言模型推理能力的发展。
当前挑战
本数据集所解决的领域问题是希伯来语思维链推理数据的稀缺性。构建过程中面临多重挑战:一是希伯来语推理数据几乎不存在,需依赖模型生成并严格筛选;二是需排除错误最终答案和阿拉伯语漂移,同时保留并标注其他样本,平衡数据质量与产出量;三是strict质量样本在不同配置间分布不均,影响下游使用的均匀性;四是语料源自多个模型,受制于各自使用条款,带来合规与溯源复杂性。
常用场景
经典使用场景
在希伯来语与英语混合的大语言模型研发中,HRM-He-corpus-objective通常被用于构建面向代码、网络安全、智能体、数学及通用推理任务的思维链监督数据。研究者依据quality字段筛选strict子集进行微调,或利用lang_tag区分希伯来语与英语推理轨迹,以训练模型在希伯来语提示下生成连贯的推理步骤。该数据集按prompt哈希划分验证集,确保同一语料在再生成时保持稳定的训练与验证边界。
解决学术问题
该数据集直面低资源语言链式思维数据匮乏这一难题,希伯来语推理语料在公开资源中几近空白。它通过多模型生成的推理轨迹,为希伯来语与英语代码专用语言模型提供了可监督的推理信号。同时,其质量标签与语言标签体系使研究者能够剖析推理缺失、答案缺失与阿拉伯语漂移等现象对模型性能的影响,为低资源语言推理数据构建方法论提供了实证基础。
实际应用
在工程实践中,该数据集支撑希伯来语与英语双语代码助手、数学解题引擎及网络安全分析工具的开发。开发者可载入agentic或agentic_traj配置训练智能体任务规划能力,使用code与cyber配置提升代码生成与威胁检测表现。由于验证集按prompt哈希固定划分,模型迭代与超参搜索可在一致基准上比较,降低了因数据泄漏或划分漂移带来的评估偏差。
数据集最近研究
最新研究方向
HRM-He-corpus-objective数据集的最新研究方向聚焦于希伯来语与英语代码专用语言模型的推理能力增强,通过生成希伯来语思维链覆盖代码、网络安全、代理任务、数学及通用推理领域。该数据集填补了希伯来语推理数据稀缺的空白,前沿研究探索了多语言推理轨迹的生成与质量分层,如严格、部分和直接类别,以及语言标签动态切换机制。热点事件涉及多模型生成数据的可追溯性与伦理合规,影响在于为低资源语言推理任务提供基准,推动跨语言代码生成和逻辑推理的鲁棒性研究,并促进代理任务和网络安全领域的应用创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务