遇见数据集

damru-knowledge

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

Damru Knowledge 是一个持续增长、自收集的问答知识库,旨在为 Damru AI 提供支持。Damru AI 是一个专为印度学生打造的自学助手,主要用于考试准备和通用问题解答。该数据集通过多工作者学习循环自动构建:系统按课程顺序学习不同学科,自动生成问答对,并进行严格的自我评估和质量过滤,仅保留高质量内容。数据验证包括使用符号计算验证数学解答,以及通过实际执行代码来验证编程问题的正确性。数据集每小时自动更新并追加新的数据分片。数据集包含六个核心字段:问题(question)、详细答案(answer)、主题类别(intent,如数学、编程、分析、通用)、语言代码(lang,如英语、印地语)、内部质量评分(upvotes)和生成时间戳(created_at)。数据来源多样,包括 Wikipedia、arXiv、StackExchange,以及专门构建的数学引擎、编程引擎和分析引擎。该数据集适用于小型开放模型的监督微调/指令微调、作为检索增强生成(RAG)的知识源,以及教育问答领域的研究。需要注意的是,其内容为机器生成和验证,可能存在偶然错误;其覆盖范围随时间增长,但早期在不同学科间可能不均衡;并且不能替代权威教科书或专业建议。数据集以 Apache-2.0 许可证发布。

Damru Knowledge is a continuously growing, self-collected question-answering knowledge base designed to support Damru AI. Damru AI is a self-study assistant specifically built for Indian students, primarily used for exam preparation and general problem-solving. The dataset is automatically constructed through a multi-worker learning loop: the system learns different subjects in course order, automatically generates question-answer pairs, and undergoes rigorous self-evaluation and quality filtering to retain only high-quality content. Data validation includes verifying mathematical solutions using symbolic computation and validating programming problems by actually executing code. The dataset is automatically updated hourly with new data shards appended. It contains six core fields: question, detailed answer, topic category (intent, such as mathematics, programming, analysis, general), language code (lang, e.g., English, Hindi), internal quality score (upvotes), and generation timestamp (created_at). Data sources are diverse, including Wikipedia, arXiv, StackExchange, as well as specially built mathematical engines, programming engines, and analytical engines. The dataset is suitable for supervised fine-tuning/instruction fine-tuning of small open models, as a knowledge source for retrieval-augmented generation (RAG), and for research in educational question-answering domains. It should be noted that the content is machine-generated and verified, and may contain occasional errors; its coverage grows over time but may be uneven across different subjects in the early stages; and it should not replace authoritative textbooks or professional advice. The dataset is released under the Apache-2.0 license.

创建时间:
2026-06-28
原始信息汇总

数据集概述:Damru Knowledge

数据集名称:Damru Knowledge
来源地址:https://huggingface.co/datasets/Damaru-ai/damru-knowledge
许可证:Apache-2.0
语言:英语(en)、印地语(hi)
任务类别:问答、文本生成
标签:教育、考试准备、知识库、推理、damru
数据集规模:1,000 至 10,000 条样本
数据集配置default,数据文件为 data/train-*.parquet

数据集内容

  • 由自动采集系统持续更新,每小时间隔追加新数据。
  • 数据列包括:
    • question:问题、题目或提示(字符串)
    • answer:详细且经过自检的答案或解答(字符串)
    • intent:主题或类别(例如:数学、编程、分析、通用)
    • lang:语言代码(en、hi等)
    • upvotes:内部质量评分(越高越好)
    • created_at:行生成时间戳

数据来源

  • Wikipedia:80多个学科的百科事实
  • arXiv:研究论文概念与摘要
  • StackExchange:各社区的问答
  • 数学引擎:使用SymPy进行符号验证,包含奥数、JEE、MIT级别题目
  • 编程引擎:生成并执行验证问题的代码(测试必须通过)
  • 分析引擎:深度推理与批判性分析问答

构建方式

  • 多工作线程学习循环,按照课程驱动依次掌握学科。
  • 生成问答后自我评估,仅保留高质量行。
  • 随时间提高质量门槛,数学问题符号验证,代码问题执行验证。
  • 去重存储后每小时间步同步。

预期用途

  • 监督微调/指令微调小型开源模型(如 Qwen2.5-3B)
  • 检索增强生成(RAG)知识源
  • 教育问答研究

局限性

  • 内容为机器生成与验证,偶尔可能存在错误
  • 覆盖范围随时间增长,早期学科分布可能不均衡
  • 不能替代权威教科书或专业建议
搜集汇总
数据集介绍
damru-knowledge 数据集图片
构建方式
该数据集源自于为印度学生打造的自我学习助手Damru AI,采用全天候自动采集与质量过滤机制,从维基百科、arXiv、StackExchange等开放资源以及符号数学引擎、代码执行引擎和分析推理引擎中持续生成并验证问答对。其构建流程遵循课程驱动的主干学习循环:系统依次选定学科领域,生成问题与答案后通过自我评估机制筛选高质量条目,同时逐步提升质量阈值以优化数据纯净度。数学问题借助SymPy进行符号验证,代码问题则通过实际运行测试用例确保解决方案可执行,最终经过去重处理并以Parquet格式按小时分片追加存储。
特点
该数据集具备持续增长与实时更新的显著特性,每小时新增数据分片,为模型训练提供动态扩增的知识源。每条记录包含问题、答案、主题意图、语言代码、内部质量评分及时间戳共六维字段,其中质量评分由系统自主评定,分值越高代表答案可靠性越强。数据涵盖数学、编程、分析推理等多领域,并特别针对印度竞赛与高等教育场景(如JEE、MIT级难题)进行了深度覆盖,形成兼具广度与专业深度的双语(英文与印地文)知识库。
使用方法
该数据集适用于小规模开放模型的监督微调与指令调优,例如可作为Qwen2.5-3B等模型的训练语料以提升其问答与推理能力。同时可作为检索增强生成(RAG)系统的知识索引,通过嵌入向量匹配实现教育领域的精准问答。研究用途方面,其时间戳与质量评分字段支持动态学习策略实验,例如根据数据时效性或质量权重进行批次采样。建议开发者在Apache-2.0许可下尊重上游数据源引用规范,并注意其机器生成内容可能存在的偶发性偏差。
背景与挑战
背景概述
在人工智能与教育科技深度融合的背景下,面向特定语言和文化的知识库构建成为提升智能辅导系统效能的关键。Damru Knowledge数据集由Damru AI团队于2024年创建,专注于服务印度学生的考试备考与通用学习需求。其核心研究问题在于如何通过自动化手段持续构建高质量、多领域、多语言的问答知识库,以支持小型开源模型(如Qwen2.5-3B)的指令微调与检索增强生成。该数据集以Apache-2.0许可发布,其创新性的自演进构建流程——包括课程驱动学习、自我评估质量过滤、符号数学验证及代码执行验证——为教育领域的数据集建设提供了新范式,对低资源语言智能辅导系统的研发具有重要推动价值。
当前挑战
Damru Knowledge数据集所解决的领域核心挑战是教育问答场景中高质量、多语言、多源知识的高效整合与自动验证问题。传统人工构建方式成本高昂且难以规模化,而现有自动生成方法常面临事实准确性不足、领域覆盖不均匀的困境。在构建过程中,团队需应对三重技术挑战:其一,设计混合数据源(Wikipedia、arXiv、StackExchange等)的异构信息融合机制,确保知识连贯性与课程一致性;其二,开发自评价推理引擎实现数学问题的符号验证与代码问题的运行时测试,但面对开放式推理题目仍存在验证盲区;其三,建立动态质量阈值自适应机制,在持续扩增(目标数百万条)过程中平衡新条目引入与整体质量维护,避免早期低质数据稀释后期高质样本的效应。
常用场景
经典使用场景
Damru Knowledge数据集专为教育领域的问答与文本生成任务而设计,其经典使用场景聚焦于考试备考与通用知识辅助。该数据集通过整合来自Wikipedia、arXiv、StackExchange等多源开放信息,并借助符号验证的数学引擎与可执行代码引擎,生成经过严格质检的问题-答案对。在监督微调与指令微调中,研究人员可将其用于训练小型开放语言模型,例如Qwen2.5-3B,从而构建专注于印度学生需求的智能助教。此外,作为检索增强生成(RAG)的知识源,它能够有效提升模型在复杂推理场景下的回答准确性与事实一致性。
衍生相关工作
基于Damru Knowledge数据集,学术界衍生出多项具有影响力的工作。研究者利用其符号验证的数学问题子集,开发了针对数学推理的专用微调方法,提升了模型在复杂证明与方程求解上的表现。同时,该数据集的自动质量过滤机制启发了多个关于自监督学习策略与课程学习路径优化的研究,例如通过动态阈值调整来提高训练数据的多样性。此外,结合其每日多源数据融合特性,部分工作探索了持续预训练中灾难性遗忘的缓解策略,以及多语言问答系统中的跨语言迁移学习。这些衍生工作共同拓展了教育知识库在人工智能领域的应用边界。
数据集最近研究
最新研究方向
围绕印度教育场景下的自主知识库构建与自我进化机制,Damru Knowledge数据集代表了面向考试准备和通用推理的新一代持续学习资源。该数据集通过自动化质量过滤与多源融合(维基百科、arXiv、StackExchange以及数学与代码验证引擎),实现每小时增量更新,显著区别于传统静态问答数据。其核心创新在于基于自评估的课程驱动学习环路,动态提升数据质量阈值,并利用符号数学验证与代码执行确保推理准确性。这一方向契合了教育AI领域对高时效性、跨学科、可信知识库的迫切需求,为研究者提供了一种可复现的、面向低资源环境的持续训练范式。当前研究热点聚焦于如何将此类自演化数据应用于小模型的指令微调与检索增强生成,以低计算成本提升复杂推理能力,对推动印度乃至全球非英语地区的教育智能辅导具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务