遇见数据集

nuhmanpk/dev-knowledge-base

收藏
Hugging Face2026-03-23 更新2026-03-29 收录
官方服务:

资源简介:

--- license: mit dataset_info: features: - name: title dtype: string - name: source dtype: string - name: url dtype: string - name: category dtype: string - name: language dtype: string - name: content dtype: string - name: chunk_id dtype: int64 - name: chunk_length dtype: int64 - name: last_updated dtype: string splits: - name: train num_bytes: 401051216 num_examples: 426107 - name: test num_bytes: 941198 num_examples: 1000 download_size: 180107389 dataset_size: 401992414 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* task_categories: - question-answering - summarization - text-generation language: - en tags: - code pretty_name: 'DevBase ' size_categories: - 100K<n<1M --- # Dev Knowledge Base (Programming Documentation Dataset) A large-scale, structured dataset of programming documentation collected from official sources across languages, frameworks, tools, and AI ecosystems. Do Follow me on Github: https://github.com/nuhmanpk --- ## Overview This dataset contains cleaned and structured documentation content scraped from official developer docs across multiple domains such as: * Programming languages * Frameworks (frontend, backend) * DevOps & infrastructure tools * Databases * Machine learning & AI libraries All content is chunked (~800 characters) and optimized for: * Retrieval-Augmented Generation (RAG) * Developer copilots * Code assistants * Semantic search --- ## Dataset Structure Each row represents a chunk of documentation. | Column | Description | | ------------ | ------------------------------------------ | | title | Page title or endpoint | | source | Source name (e.g., react, python, fastapi) | | url | Original documentation URL | | category | Type (language, framework, database, etc.) | | language | Programming language | | content | Cleaned text chunk | | chunk_id | Chunk index within page | | chunk_length | Character length | | last_updated | Timestamp | --- ## Sources Included ### Languages python, javascript, typescript, go, rust, java, csharp, dart, swift, kotlin ### Frontend & Frameworks react, nextjs, vue, nuxt, svelte, sveltekit, angular, astro, qwik, solidjs ### Backend & APIs fastapi, django, flask, express, nestjs, hono, elysia ### Runtime & Tooling nodejs, deno, bun, vite, webpack, turborepo, nx, pnpm, biome ### UI Libraries tailwind, shadcn_ui, chakra_ui, mui ### Mobile & Desktop react_native, expo, flutter, tauri, electron ### Machine Learning & AI numpy, pandas, pytorch, tensorflow, scikit_learn, xgboost, lightgbm transformers, langchain, llamaindex, openai, vllm, ollama, haystack mastra, pydantic_ai, langfuse, mcp ### Databases postgresql, mysql, sqlite, mongodb, redis, supabase, firebase planetscale, neon, convex, drizzle_orm, qdrant, turso ### DevOps & Infrastructure docker, kubernetes, terraform, ansible github_actions, gitlab_ci, git, opentelemetry, inngest, temporal ### Other claude_agent_sdk Full crawl configuration available here: --- ## Chunk Distribution Example distribution after cleaning and removing Zig: | Source | Chunks | | ------------ | -------- | | python | ~15,000 | | javascript | ~4,000 | | go | ~8,000 | | react | ~3,000 | | nextjs | ~4,000 | | docker | ~4,000 | | kubernetes | ~14,000 | | transformers | ~14,000 | | firebase | ~300,000 | | redis | ~17,000 | | git | ~14,000 | | flutter | ~14,000 | | supabase | ~10,000 | Total: **millions of chunks across 80+ sources** --- ## How to Use (Hugging Face) ### Install ```bash pip install datasets ``` ### Load Dataset ```python from datasets import load_dataset dataset = load_dataset("nuhmanpk/dev-knowledge-base") print(dataset["train"][0]) ``` --- ## Example Use Cases ### 1. Semantic Search ```python from sentence_transformers import SentenceTransformer import numpy as np model = SentenceTransformer("all-MiniLM-L6-v2") docs = [x["content"] for x in dataset["train"][:1000]] embeddings = model.encode(docs) query = "how to build api with fastapi" q_emb = model.encode([query]) scores = np.dot(embeddings, q_emb.T).squeeze() print(docs[scores.argmax()]) ``` --- ### 2. RAG Pipeline ```text User Query → Embed → Vector DB → Retrieve → LLM → Answer ``` Use with: * FAISS * Qdrant * Pinecone --- ### 3. Fine-tuning Convert to instruction format: ```json { "instruction": "Explain JWT authentication", "input": "", "output": "<documentation chunk>" } ``` --- ### 4. Developer Chatbot Build: * AI coding assistant * StackOverflow-style search * Internal dev knowledge system --- ## Data Processing Pipeline * Async crawling with rate limiting * HTML parsing (BeautifulSoup) * Navigation/content filtering * Chunking (~800 chars) * Cleaning & binary removal Crawler implementation: --- ## Limitations * Some duplicate content may exist * Chunk-level context only (not full pages) * No semantic labeling yet * Some sources larger than others --- ## Future Improvements * Deduplication * Better chunking (semantic splitting) * Q/A generation * Code extraction * Metadata enrichment --- ## License This dataset is built from publicly available documentation. Refer to individual sources for licensing. --- ## Author https://github.com/nuhmanpk --- ## Quick Example ```python from datasets import load_dataset ds = load_dataset("nuhmanpk/dev-knowledge-base") for row in ds["train"].select(range(3)): print(row["source"], "→", row["content"][:150]) ``` --- ## Summary A large, structured, and practical dataset for building developer-focused AI systems from code assistants to full RAG pipelines. ---

许可证:MIT 数据集信息: 特征字段: - 字段名:标题(title),数据类型:字符串 - 字段名:来源(source),数据类型:字符串 - 字段名:原始URL(url),数据类型:字符串 - 字段名:分类(category),数据类型:字符串 - 字段名:语言(language),数据类型:字符串 - 字段名:内容(content),数据类型:字符串 - 字段名:分块ID(chunk_id),数据类型:64位整数(int64) - 字段名:分块长度(chunk_length),数据类型:64位整数(int64) - 字段名:最后更新时间(last_updated),数据类型:字符串 划分集: - 名称:训练集(train),字节大小:401051216,样本数量:426107 - 名称:测试集(test),字节大小:941198,样本数量:1000 下载总大小:180107389 数据集总大小:401992414 配置项: - 配置名称:默认配置(default),数据文件路径: - 训练集:data/train-* - 测试集:data/test-* 任务类别: - 问答(question-answering) - 摘要生成(summarization) - 文本生成(text-generation) 支持语言: - 英语(en) 标签: - 代码(code) 展示名称:DevBase 规模区间:10万<n<100万 ## 开发者知识库(编程文档数据集) 本数据集为大规模结构化编程文档数据集,采集自多语言、框架、工具及AI生态的官方公开来源。 欢迎在GitHub关注作者:https://github.com/nuhmanpk ## 数据集概览 本数据集包含经清洗与结构化处理的官方开发者文档内容,覆盖领域包括: * 编程语言 * 前后端框架 * DevOps与基础设施工具 * 数据库 * 机器学习与AI库 所有内容均已按单块约800字符的规则进行分块,并针对以下场景优化: * 检索增强生成(Retrieval-Augmented Generation,RAG) * 开发者智能副驾 * 代码助手 * 语义搜索 ## 数据集结构 数据集每一行对应一篇文档的单个分块。 | 字段名 | 描述 | | ------------ | ------------------------------------------ | | title | 页面标题或接口端点 | | source | 来源名称(如react、python、fastapi等) | | url | 原始文档的官方URL | | category | 内容分类(编程语言、框架、数据库等) | | language | 关联的编程语言 | | content | 清洗后的文本分块内容 | | chunk_id | 该分块在原页面中的分块索引 | | chunk_length | 分块的字符长度 | | last_updated | 文档最后更新的时间戳 | ## 包含的数据源 ### 编程语言领域 python、javascript、typescript、go、rust、java、csharp、dart、swift、kotlin ### 前端与框架领域 react、nextjs、vue、nuxt、svelte、sveltekit、angular、astro、qwik、solidjs ### 后端与API领域 fastapi、django、flask、express、nestjs、hono、elysia ### 运行时与工具链领域 nodejs、deno、bun、vite、webpack、turborepo、nx、pnpm、biome ### UI组件库领域 tailwind、shadcn_ui、chakra_ui、mui ### 移动端与桌面端领域 react_native、expo、flutter、tauri、electron ### 机器学习与AI领域 numpy、pandas、pytorch、tensorflow、scikit_learn、xgboost、lightgbm、transformers、langchain、llamaindex、openai、vllm、ollama、haystack、mastra、pydantic_ai、langfuse、mcp ### 数据库领域 postgresql、mysql、sqlite、mongodb、redis、supabase、firebase、planetscale、neon、convex、drizzle_orm、qdrant、turso ### DevOps与基础设施领域 docker、kubernetes、terraform、ansible、github_actions、gitlab_ci、git、opentelemetry、inngest、temporal ### 其他领域 claude_agent_sdk 完整爬取配置可在此处获取: ## 分块分布 以下为清洗并移除Zig语言后的示例分块统计: | 数据源 | 分块数量 | | ------------ | -------- | | python | 约15,000 | | javascript | 约4,000 | | go | 约8,000 | | react | 约3,000 | | nextjs | 约4,000 | | docker | 约4,000 | | kubernetes | 约14,000 | | transformers | 约14,000 | | firebase | 约300,000 | | redis | 约17,000 | | git | 约14,000 | | flutter | 约14,000 | | supabase | 约10,000 | 总计:**覆盖80+数据源,分块总量达数百万级** ## Hugging Face使用指南 ### 安装依赖 bash pip install datasets ### 加载数据集 python # 从datasets库导入加载数据集的工具 from datasets import load_dataset # 加载nuhmanpk/dev-knowledge-base数据集 dataset = load_dataset("nuhmanpk/dev-knowledge-base") # 打印训练集的第一条样本 print(dataset["train"][0]) ## 典型应用场景 ### 1. 语义搜索 python from sentence_transformers import SentenceTransformer import numpy as np # 加载预训练嵌入模型 model = SentenceTransformer("all-MiniLM-L6-v2") # 提取训练集前1000条样本的内容 docs = [x["content"] for x in dataset["train"][:1000]] embeddings = model.encode(docs) # 定义查询语句并生成查询向量 query = "how to build api with fastapi" q_emb = model.encode([query]) # 计算相似度并获取最匹配的文档 scores = np.dot(embeddings, q_emb.T).squeeze() print(docs[scores.argmax()]) ### 2. 检索增强生成(RAG)流程 text 用户查询 → 向量嵌入 → 向量数据库 → 文档检索 → 大语言模型 → 生成回答 可搭配以下向量数据库工具使用: * FAISS * Qdrant * Pinecone ### 3. 模型微调 可将数据转换为指令微调格式: json { "instruction": "请解释JWT身份认证机制", "input": "", "output": "<文档分块内容>" } ### 4. 开发者聊天机器人 可基于本数据集构建以下应用: * AI代码助手 * StackOverflow风格的技术问答搜索系统 * 企业内部开发者知识管理系统 ## 数据处理流程 * 带速率限制的异步爬取 * HTML页面解析(基于BeautifulSoup) * 页面导航与内容过滤 * 文本分块(单块约800字符) * 文本清洗与二进制内容移除 爬虫实现代码可参考: ## 数据集局限性 * 可能存在少量重复内容 * 仅提供分块级上下文,未保留完整页面信息 * 暂未实现语义标注 * 不同数据源的分块数量存在不均衡情况 ## 未来改进方向 * 去重处理 * 优化分块策略(基于语义的分段) * 自动生成问答对 * 提取代码片段内容 * 丰富元数据信息 ## 许可证 本数据集基于公开可用的官方文档构建,具体使用许可请参考各原始数据源的声明。 ## 作者 https://github.com/nuhmanpk ## 快速示例 python from datasets import load_dataset # 加载数据集 ds = load_dataset("nuhmanpk/dev-knowledge-base") # 遍历训练集前3条样本并打印 for row in ds["train"].select(range(3)): print(row["source"], "→", row["content"][:150]) ## 数据集总结 本数据集为大规模、结构化且实用的开发者导向AI系统构建工具,可用于开发代码助手、全流程检索增强生成系统等各类开发者AI应用。

提供机构:
nuhmanpk
二维码
社区交流群
二维码
科研交流群
商业服务