遇见数据集

TR-HASH-Pretraining-125B-Agentic-32K

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

TR-HASH Pretraining 125B Agentic 32K 是一个私有、来源策划的预训练数据集,专为 TR-HASH Agentic 32K 模型系列设计。数据集包含总计 125B 个打包 token 曝光,其中 75B 来自 Foundation 桶(涵盖英语和法语知识、教育网页文本、数学以及合成教科书),50B 来自 Agentic 桶(涵盖教育代码、程序、调试、验证、规划、数学推理以及受限的工具使用轨迹)。数据集使用经过验证的 32,000-ID 版本的 AETHORIA-AI/TR-HASH-Tokenizer-32K-Agentic,与旧版 tokenizer 不兼容。该数据集采用高吞吐量直接构建方式,从策划的上游子集读取文档并直接 token 化,但未进行每文档质量过滤、代理信号过滤、基准去污染或全局精确文档去重。训练课程分为两个阶段:首先 foundation-first(60B foundation + 15B agentic),然后 agentic-intensification(15B foundation + 35B agentic)。数据集保持私有,直到源许可证、分片哈希、token 预算和此物化披露经过审计。所有源仓库、配置、修订、token 预算和许可证审计说明均固定在发布的 _metadata/config.json 中。

TR-HASH Pretraining 125B Agentic 32K is a private, source-curated pretraining dataset designed for the TR-HASH Agentic 32K model series. The dataset contains a total of 125B packed token exposures, with 75B from the Foundation bucket (covering English and French knowledge, educational web text, mathematics, and synthetic textbooks) and 50B from the Agentic bucket (covering educational code, programs, debugging, verification, planning, mathematical reasoning, and constrained tool use trajectories). The dataset uses a verified 32,000-ID version of AETHORIA-AI/TR-HASH-Tokenizer-32K-Agentic, which is incompatible with the older tokenizer. It is constructed through a high-throughput direct approach, reading documents from curated upstream subsets and directly tokenizing them, without per-document quality filtering, agent signal filtering, benchmark decontamination, or global exact document deduplication. The training curriculum consists of two stages: first foundation-first (60B foundation + 15B agentic), then agentic-intensification (15B foundation + 35B agentic). The dataset remains private until the source licenses, shard hashes, token budgets, and this materialization disclosure are audited. All source repositories, configurations, revisions, token budgets, and license audit notes are fixed in the published _metadata/config.json.

创建时间:
2026-08-30
原始信息汇总

TR-HASH Pretraining 125B Agentic 32K 数据集详情

概述

这是一个私有、来源精选的预训练数据集,专为 TR-HASH Agentic 32K 模型系列设计。数据集包含 1250亿个打包令牌暴露,其中基础内容 750亿,智能体/程序性内容 500亿。

主要特征

  • 语言:英语、法语
  • 任务类型:文本生成
  • 许可证:其他(专有许可)
  • 分词器:使用不可变的、经过验证的 32,000 词汇量修订版 AETHORIA-AI/TR-HASH-Tokenizer-32K-Agentic,与旧版 TR-HASH 32K 分词器不兼容

数据集构成

数据桶 令牌数 用途
基础 750亿 英语和法语知识、教育网页文本、数学和合成教科书
智能体 500亿 教育代码、程序、调试、验证、规划、数学推理和限额工具使用轨迹

所有源仓库、配置、修订版本、令牌预算和许可证审计说明均固定在发布的 _metadata/config.json 文件中。

构建方式说明

  • 采用来源精选直接构建的高吞吐量方式,从精选的上游子集中读取文本并直接进行分词
  • 明确不声称包含:逐文档质量过滤、智能体信号过滤、基准去污或全局精确文档去重
  • 每个10亿令牌的 uint16 分片在上传后,会校验远程大小和 SHA-256,提交到重启状态,然后才在本地删除
  • 数据集在源许可证、分片哈希、令牌预算和物化披露完成审计前保持私有状态

课程安排

运行时计划将每个打包行消费一次:

  1. 基础优先阶段:600亿基础 + 150亿智能体
  2. 智能体强化阶段:150亿基础 + 350亿智能体

分片边界与阶段划分对齐。unique_tokenstrained_tokens 描述打包令牌位置;由于直接构建中禁用了全局去重,源文档可能重复出现。

搜集汇总
数据集介绍
TR-HASH-Pretraining-125B-Agentic-32K 数据集图片
构建方式
在大规模语言模型预训练领域,语料库的构建策略直接决定了模型的基础能力与专业化倾向。本数据集采用源策展直接构建方式,从经过筛选的上游数据子集中直接读取文档并进行分词处理,使用不可变的32000词表版本的分词器完成编码。整个语料库包含1250亿个打包词元,其中基础语料750亿词元,涵盖英语和法语知识、教育网页文本、数学及合成教科书;智能体语料500亿词元,涵盖教育代码、程序性操作、调试、验证、规划、数学推理及有限制的工具使用轨迹。所有源仓库、配置、修订版本、词元预算及许可审计记录均固定于元数据配置文件中。
特点
该数据集的核心特征在于其双阶段课程设计所体现的智能体能力培养导向。基础语料与智能体语料按照60B对15B、15B对35B的比例分两阶段消费,分片边界与阶段划分对齐,确保训练过程的连贯性。数据集采用每十亿词元为一个uint16分片的存储格式,每个分片上传后经过远端大小与SHA-256校验,提交至重启状态后方可删除本地副本,保障数据完整性与可恢复性。值得注意的是,该直接构建版本明确不声称逐文档质量过滤、智能体信号过滤、基准去污染或全局精确文档去重,因此unique_tokens与trained_tokens描述的是打包词元位置,源文档可能存在重复。数据集在源许可、分片哈希、词元预算及物化披露经过审计前保持私有状态。
使用方法
该数据集适用于TR-HASH Agentic 32K模型系列的预训练任务,需配合不可变的32000词元分词器使用,与旧版TR-HASH 32K分词器不兼容。使用时应遵循运行时计划,每个打包行仅消费一次,按foundation-first阶段配置60B基础词元与15B智能体词元,随后进入agentic-intensification阶段配置15B基础词元与35B智能体词元。由于全局去重功能关闭,使用者需知悉源文档可能重复出现,在评估模型性能时应将这一特性纳入考量。数据以十亿词元分片形式提供,加载时需确保分片顺序与阶段划分一致,以复现预期的课程学习效果。
背景与挑战
背景概述
在大型语言模型预训练数据日益专业化的趋势下,TR-HASH Pretraining 125B Agentic 32K数据集由AETHORIA-AI构建,旨在为TR-HASH Agentic 32K模型系列提供私有的、来源精选的预训练语料。该数据集包含1250亿个打包词元,其中750亿为英语和法语基础知识、教育网页文本、数学及合成教材,500亿为教育代码、调试、验证、规划、数学推理及工具使用轨迹等智能体内容。其核心研究问题在于探索基础能力与智能体/程序性能力的课程化混合训练。数据集采用经过验证的不可变32000词元分词器,与旧版不兼容,并通过分片上传与哈希校验确保数据完整性。
当前挑战
该数据集所面临的挑战涵盖领域问题与构建过程两个层面。领域层面,智能体与程序性能力的预训练需在有限词元预算内平衡基础语言理解与复杂推理、规划及工具使用等多层次技能,同时避免灾难性遗忘。构建层面,直接源精选构建方式未实施逐文档质量过滤、智能体信号过滤、基准去污染及全局精确去重,导致源文档可能重复出现且质量参差不齐;此外,每十亿词元分片需逐一上传、校验大小与SHA-256哈希、提交重启状态后方可删除本地副本,且需在许可审计完成前保持私有,这对工程流程与合规管理提出了严格要求。
常用场景
经典使用场景
在大规模语言模型预训练领域,TR-HASH-Pretraining-125B-Agentic-32K数据集最为经典的应用场景在于支撑智能体(Agentic)能力与通用知识基座的协同构建。该数据集以1250亿词元的高吞吐量打包形式,精心配比750亿基础语料与500亿智能体/程序性内容,服务于具备工具调用、规划推理与代码验证能力的模型训练。其采用经校验的32000词元词表,并以分片化的uint16格式存储,使得研究者在课程式预训练中能够按基础优先与智能体强化两阶段有序消费全部打包行,从而在受控的资源条件下复现面向智能体任务的预训练流程。
解决学术问题
该数据集针对智能体模型预训练中普遍存在的语料割裂问题提供了系统化的解决方案。传统预训练语料多聚焦通用文本,难以兼顾程序性知识、调试验证、规划与工具使用轨迹等智能体核心能力的培养,导致模型在复杂任务中表现欠佳。本数据集通过将基础语料与智能体内容以明确词元预算整合于统一词表之下,并采用课程式消费策略,有效缓解了知识遗忘与能力失衡的矛盾。其透明化的元数据披露与分片校验机制,为预训练可复现性研究提供了工程范式,对智能体语言模型的训练方法论具有推动作用。
衍生相关工作
围绕TR-HASH-Pretraining-125B-Agentic-32K,衍生工作主要集中于智能体预训练方法、课程学习策略与分词器适配研究。基于该语料训练的TR-HASH Agentic 32K模型系列构成了直接的下游成果,推动了工具使用与规划能力的评估基准发展。同时,该数据集对词表兼容性的严格界定,促进了针对智能体场景的分词器定制与迁移研究。其分片校验与元数据固定机制亦被后续大规模预训练工程借鉴,形成了面向可复现性与许可合规的数据构建实践,为智能体语言模型的开放研究提供了参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务