damru-knowledge
收藏资源简介:
Damru Knowledge 是一个持续增长、自收集的问答知识库,旨在为 Damru AI 提供支持。Damru AI 是一个专为印度学生打造的自学助手,主要用于考试准备和通用问题解答。该数据集通过多工作者学习循环自动构建:系统按课程顺序学习不同学科,自动生成问答对,并进行严格的自我评估和质量过滤,仅保留高质量内容。数据验证包括使用符号计算验证数学解答,以及通过实际执行代码来验证编程问题的正确性。数据集每小时自动更新并追加新的数据分片。数据集包含六个核心字段:问题(question)、详细答案(answer)、主题类别(intent,如数学、编程、分析、通用)、语言代码(lang,如英语、印地语)、内部质量评分(upvotes)和生成时间戳(created_at)。数据来源多样,包括 Wikipedia、arXiv、StackExchange,以及专门构建的数学引擎、编程引擎和分析引擎。该数据集适用于小型开放模型的监督微调/指令微调、作为检索增强生成(RAG)的知识源,以及教育问答领域的研究。需要注意的是,其内容为机器生成和验证,可能存在偶然错误;其覆盖范围随时间增长,但早期在不同学科间可能不均衡;并且不能替代权威教科书或专业建议。数据集以 Apache-2.0 许可证发布。
Damru Knowledge is a continuously growing, self-collected question-answering knowledge base designed to support Damru AI. Damru AI is a self-study assistant specifically built for Indian students, primarily used for exam preparation and general problem-solving. The dataset is automatically constructed through a multi-worker learning loop: the system learns different subjects in course order, automatically generates question-answer pairs, and undergoes rigorous self-evaluation and quality filtering to retain only high-quality content. Data validation includes verifying mathematical solutions using symbolic computation and validating programming problems by actually executing code. The dataset is automatically updated hourly with new data shards appended. It contains six core fields: question, detailed answer, topic category (intent, such as mathematics, programming, analysis, general), language code (lang, e.g., English, Hindi), internal quality score (upvotes), and generation timestamp (created_at). Data sources are diverse, including Wikipedia, arXiv, StackExchange, as well as specially built mathematical engines, programming engines, and analytical engines. The dataset is suitable for supervised fine-tuning/instruction fine-tuning of small open models, as a knowledge source for retrieval-augmented generation (RAG), and for research in educational question-answering domains. It should be noted that the content is machine-generated and verified, and may contain occasional errors; its coverage grows over time but may be uneven across different subjects in the early stages; and it should not replace authoritative textbooks or professional advice. The dataset is released under the Apache-2.0 license.
数据集概述:Damru Knowledge
数据集名称:Damru Knowledge
来源地址:https://huggingface.co/datasets/Damaru-ai/damru-knowledge
许可证:Apache-2.0
语言:英语(en)、印地语(hi)
任务类别:问答、文本生成
标签:教育、考试准备、知识库、推理、damru
数据集规模:1,000 至 10,000 条样本
数据集配置:default,数据文件为 data/train-*.parquet
数据集内容
- 由自动采集系统持续更新,每小时间隔追加新数据。
- 数据列包括:
question:问题、题目或提示(字符串)answer:详细且经过自检的答案或解答(字符串)intent:主题或类别(例如:数学、编程、分析、通用)lang:语言代码(en、hi等)upvotes:内部质量评分(越高越好)created_at:行生成时间戳
数据来源
- Wikipedia:80多个学科的百科事实
- arXiv:研究论文概念与摘要
- StackExchange:各社区的问答
- 数学引擎:使用SymPy进行符号验证,包含奥数、JEE、MIT级别题目
- 编程引擎:生成并执行验证问题的代码(测试必须通过)
- 分析引擎:深度推理与批判性分析问答
构建方式
- 多工作线程学习循环,按照课程驱动依次掌握学科。
- 生成问答后自我评估,仅保留高质量行。
- 随时间提高质量门槛,数学问题符号验证,代码问题执行验证。
- 去重存储后每小时间步同步。
预期用途
- 监督微调/指令微调小型开源模型(如 Qwen2.5-3B)
- 检索增强生成(RAG)知识源
- 教育问答研究
局限性
- 内容为机器生成与验证,偶尔可能存在错误
- 覆盖范围随时间增长,早期学科分布可能不均衡
- 不能替代权威教科书或专业建议




