Machine Learning Library
收藏资源简介:
一个手工整理、机器可读的机器学习教育资源库(精选的机器学习语料库/数据集),包含互联网上最优质的机器学习教育内容——顶尖大学课程、经典研究论文和被引用最多的解释性博客——全部统一转换为一致的Markdown格式,并附有完整的来源信息。包含923个文档,约1100万个标记,涵盖从入门到前沿(2026年)的研究,每个来源均有署名。
A manually curated, machine-readable educational resource repository for machine learning (curated machine learning corpus/dataset). It contains the highest-quality machine learning educational content from the internet, including top university courses, classic research papers, and most-cited explanatory blogs. All content has been uniformly converted to a consistent Markdown format with complete source attribution. The repository includes 923 documents totaling approximately 11 million tokens, covering materials from introductory levels to cutting-edge research up to 2026, with full attribution for every source.
数据集概述:Machine Learning Library
这是一个精选的、机器可读的机器学习教育资源库,旨在将分散在网络上的高质量学习材料(顶尖大学课程、经典研究论文、高引用博客)整合为统一的 Markdown 格式,并附带完整的出处信息。
核心数据规模
- 文档总数:923 篇
- 总容量:约 1100 万 tokens(约 4200 万字符)
- ArXiv 论文:391 篇(78 篇全文 + 313 篇摘要+元数据)
- 讲座文稿:474 篇(来自 14 个课程/频道)
- 网络文章:58 篇
- 主题标签:17 个主题的分类体系,并包含级别、媒介、任务、技术等维度标签
- 覆盖范围:从基础入门到 2025-2026 前沿研究
内容构成
- 研究论文(
corpus/papers/):包含 Dropout、Transformer、ResNet、LLaMA 等 78 篇经典论文全文,以及 2024 年第三季度至 2026 年的 313 篇最新论文摘要与元数据,涵盖基础、视觉、Transformer 时代、高效注意力、生成模型、LLM 与对齐、推理与智能体等多个领域。 - 讲座文稿(
corpus/youtube/):包含 MIT 6.S191、Stanford CS224n、Andrej Karpathy 频道、3Blue1Brown 系列等 14 个知名课程/频道的 474 篇完整文字稿。 - 网络文章(
corpus/web/):收录了 Jay Alammar 的“图解”系列、Lilian Weng 的深度文章、Stanford CS231n 笔记等 58 篇被广泛引用的解释性博客。
数据结构与格式
- 格式:Markdown 文本,每份文档开头均包含结构化的 YAML 前言(frontmatter),包含标题、来源、URL、作者、日期、主题、受控标签(tags)和别名(aliases)。
- 受控标签:文档使用
topic/(主题)、level/(级别)、medium/(媒介)、task/(任务)、technique/(技术)等前缀的标签,便于过滤和查询。完整的标签体系在atlas/TAGS.md。
仓库结构
machine-learning-library/ ├── README.md ├── SOURCES.md (完整出处清单) ├── NOTICE.md (许可与使用说明) ├── AGENTS.md / CLAUDE.md (AI 代理导航与引用指南) ├── corpus/ (核心语料) │ ├── INDEX.md (全部 923 个文件的机器生成索引) │ ├── papers/ (论文) │ ├── youtube/ (讲座文稿,按频道分组) │ └── web/ (文章,按域名分组) ├── atlas/ (主题导航层,包含内容地图与学习路径) │ ├── Home.md │ ├── TAGS.md │ ├── topics/ (每个主题一个中心页面) │ └── paths/ (精选阅读路径) ├── .obsidian/ (预配置的 Obsidian 库设置) ├── tools/ (用于清洗、标记、索引的脚本) └── examples/ (使用示例,如检索增强生成的脚本)
主要用途
该语料库可用于多种场景:
- 构建检索增强型 ML 导师:将语料嵌入向量数据库,构建能引用真实来源的问答系统。
- 微调领域模型:约 1100 万 tokens 的干净文本可用于对小型 ML 解释器模型进行持续预训练或指令微调。
- 嵌入/检索基准测试:作为单一领域的连贯语料库,可用于评估嵌入模型和检索流水线。
- 生成综合学习笔记:通过 LLM 将多个相关源压缩成一篇带引用的笔记。
- 概念/引用图谱分析:利用前言和交叉引用提取论文与讲座的概念关系图。
- 个性化阅读路径规划:按主题和来源过滤,生成有序的学习计划。
- 离线参考库:纯 Markdown 格式,便于使用 grep 等工具搜索或在 Obsidian 中阅读。
使用方式
- 人类阅读:可直接在 GitHub 上浏览,或作为 Obsidian 库 使用(仓库内置
.obsidian/配置,打开即用)。推荐从atlas/Home.md开始,并可选安装 Dataview 和 Front Matter Title 插件增强体验。 - AI 代理使用:可通过 Cursor、Claude Code 等直接打开文件夹,代理会自动读取
AGENTS.md或CLAUDE.md来获取导航和引用指导。也可通过examples/rag_quickstart.py脚本快速实现语义搜索。
归属与许可
- 内容归属:所有文档均保留原始来源的 URL 和作者信息,
SOURCES.md列出了所有包含的课程、频道、出版物和论文。所有功劳归原始创作者所有。 - 许可:仓库的结构、索引、脚本和组织架构采用 MIT 许可。每份文档的内容版权归其原始作者/出版商所有,此处仅用于研究和教育目的。详见
NOTICE.md。




