遇见数据集

Haster1137/nora-g3-hei-reasoning-logic

收藏
Hugging Face2026-05-22 更新2026-05-31 收录
官方服务:

资源简介:

该数据集作为一个高密度、跨领域的知识矩阵和逻辑推理库,专门设计用于支持在消费级硬件环境中运行的小型敏捷参数模型(如7B参数本地架构)的本地高速检索增强生成(RAG)工作流。通过结合密集的数学、算法和学术令牌结构与多媒体语音文本对齐,它作为一个开放书库,旨在最大化本地智能,而无需扩展模型权重复杂度。数据集包含五个核心数据分支:核心资产库(超过4,200,000行聚合结构指令调优数据)、Google WaxalNLP子语料库(1.7TB的自动语音识别文本矩阵、上下文图像描述和覆盖24+撒哈拉以南非洲地区语言的对话语音脚本)、UIUC Magicoder进化矩阵(工业级软件工程数据集,包含110,000个合成进化指令树、代码优化提示和多轮调试数据)、学术链语料库(高级竞争性推理基准数据集,映射复杂的科学、数学和逻辑问题解决分支,结构在明确的<think>审议标签内)以及FineWeb-Edu过滤库(通过高级教育分类器提取的大规模高密度教科书和学术数据集,用于隔离纯学习序列、大学讲座和逻辑块)。数据集由独立AI研究开发工作空间(Aiden Wade / Haster1137)策划,由Haster1137共享,语言为多语言(包括英语、斯瓦希里语、卢干达语、绍纳语、阿坎语等20+地区语言),许可证为开放学术/研究使用许可(通过复合源分发条款继承)。

--- # 有关数据集卡片元数据的参考,请参阅规范:https://github.com/huggingface/hub-docs/blob/main/datasetcard.md?plain=1 # 文档/指南:https://huggingface.co/docs/hub/datasets-cards 语言: - 英语 标签: - 推理 - 逻辑 - 思维链 - 代码生成 - 指令微调 - 文本生成 - 语音识别 - 检索增强生成 规模类别: - 100万<样本数<1000万 --- # nora-g3-hei-reasoning-logic 数据集卡片 本数据集是高度密集的跨领域知识矩阵与逻辑推理知识库,专为运行在消费级硬件环境下的轻量化敏捷参数模型(如70亿参数的本地架构模型)设计,可支持本地高速检索增强生成(Retrieval-Augmented Generation, RAG)工作流。本数据集将密集的数学、算法与学术词元(Token)结构与多媒体语音文本对齐相结合,作为开源参考库,在不增加模型权重复杂度的前提下最大化本地智能能力。 ## 数据集详情 ### 数据集描述 本存储库为集中式聚合镜像库,包含五大核心数据分支: * **核心资产库**:主基础数据集,包含超过420万行聚合的结构化指令微调数据。 * **Google WaxalNLP 子语料库**:规模达1.7TB的大型数据集,涵盖24种以上撒哈拉以南非洲区域语言的自动语音识别(Automatic Speech Recognition, ASR)文本矩阵、上下文图像描述与会话语音脚本。 * **UIUC Magicoder 演化矩阵**:工业级软件工程数据集,包含11万个合成演化的指令树、代码优化提示与多轮调试数据。 * **学术链语料库**:高级别竞争性推理基准数据集,以显式的`<think>`思考标签封装了复杂的科学、数学与逻辑问题求解分支。 * **FineWeb-Edu 过滤存储库**:通过高级教育分类器提取的大规模高密度教科书与学术数据集,用于隔离纯学习序列、大学讲座与逻辑模块。 - **数据整理方**:独立人工智能研发工作区(Aiden Wade / Haster1137) - **共享方**:Haster1137 - **自然语言处理支持语言**:多语言(英语、斯瓦希里语、卢干达语、绍纳语、阿肯语以及20余种其他区域语言) - **许可证**:开放学术/研究使用许可(继承自复合源分发条款) ### 数据集来源 - **存储库地址**:https://huggingface.co/datasets/Haster1137/nora-g3-hei-reasoning-logic - **主要上游源**:* google/WaxalNLP * ise-uiuc/Magicoder-Evol-Instruct-110K * marcodsn/academic-chains * HuggingFaceFW/fineweb-edu ## 应用场景 ### 直接应用 本数据集专为以下场景设计: * 通过向量搜索与检索增强生成(RAG)管道实现本地上下文注入。 * 为轻量化本地7B模型提供即时访问高级编程故障排除指南、深度逻辑思考框架与教科书资源的能力。 * 跨语言语言建模与上下文自动语音转录解析。 ### 超出适用范围的应用 本存储库针对检索与参考查询进行了优化。尝试将1.7TB以上的原始多媒体与时序文件整体强制训练或微调至标准本地硬件的小型模型权重中,超出了本数据集的适用范围。此类做法违背了本数据集旨在维护高速、轻量化本地推理架构的设计初衷。 ## 数据集结构 本存储库采用模块化基于文件夹的存储结构,分为parquet数据层、序列化JSON指令对与历史模拟表: * `data/ASR/dag/`:包含密集的多分区parquet数据集,存储文本对齐与对应的音频资产链。 * `magicoder/`:包含逻辑编码指令、Python验证结构与软件工程指令图。 * `academic-chains/`:包含以推理标签封装的显式思维链(Chain-of-thought)科学问题解决方案。 * `fineweb-edu/`:包含过滤后的教科书词元(Token)、历史数据记录与学术分解内容。 所有主要子分区均采用统一且未损坏的顺序跟踪索引(如`index_level_0`),以确保在通过自动化内存中二进制网络流例程加载数据块时保持连续完整。 ## 数据集构建 ### 数据整理的核心逻辑 传统现代AI训练范式优先考虑大规模参数记忆,这需要严苛的企业级硬件集群资源与极高的电力消耗。本存储库基于经济与计算约束框架构建:将高智能逻辑链外部存储于结构化存储库中,使快速本地模型能够按需动态查询数据。 ### 源数据 #### 数据收集与处理 数据通过优化的零本地存储内存流式Python API进行聚合。流式连接器在源存储库与目标配置文件之间建立服务器到服务器的HTTP多部分传输通道。该方法通过瞬态RAM缓冲区(`io.BytesIO`)传输二进制块,无需触及本地硬盘分区或存储扇区。 #### 源数据生产者 * **谷歌工程团队**:WaxalNLP多语言音频-文本转录基础设施的创建者。 * **伊利诺伊大学厄巴纳-香槟分校iSE实验室**:Magicoder合成指令演化框架的开发者。 * **学术与社区开源机器学习实验室**:专业训练矩阵、教育网络过滤器与基准逻辑链的贡献者。 ## 偏差、风险与局限性 * **多媒体开销**:语音识别模块中包含大量原始音频流;文本解析器必须显式针对文本列变量进行定位,以维持搜索对齐效率。 * **合成对齐**:合成扩展的指令数据在用于安全关键型代码部署前,应针对标准执行运行时进行验证。 ### 建议 将此数据库集成到本地Flask支持的服务器界面的用户,应采用严格的嵌入模型对文本元素进行高效分块。这可确保提示查询返回高密度的逻辑结果,同时不会耗尽模型的活动注意力窗口。 ## 引用 若在学术研究中使用这些组成部分,请引用原始上游实验室: text @misc{google2024waxalnlp, title={WaxalNLP: A Multilingual Speech Corpus for Sub-Saharan African Languages}, author={Google Research}, year={2024} } @misc{wei2023magicoder, title={Magicoder: Source Code Is All You Need}, author={Yuyan Wei and Zhe Wang and Jiawei Liu and Yuxiang Gao and Tianqi Zhang and Shaohua Zhou}, journal={arXiv preprint arXiv:2312.02120}, year={2023} }

提供机构:
Haster1137
二维码
社区交流群
二维码
科研交流群
商业服务