倪海厦《人纪》结构化语料库
收藏官方服务:
资源简介:
把倪海厦先生《人纪》全部课程做成每一句都可回放验证的结构化知识库。每条判语 = 倪师原话引文 + 经典条文/药名/穴位归属 + 精确到秒的视频出处。
A structured knowledge base has been constructed for the complete course series of Mr. Ni Haixia's *Ren Ji*, allowing replay and verification of every single sentence contained within. Each entry within this knowledge base comprises three parts: the direct quotation of Mr. Ni's original remarks, the relevant classic medical texts, drug names, or acupoint attributions, and the video source with timestamps precise to the second.
创建时间:
2026-08-26
原始信息汇总
数据集概述
倪海厦《人纪》结构化语料库(nihai-renji-corpus)是一个将倪海厦先生《人纪》全部课程整理为每句可回放验证的结构化知识库。每条判语包含倪师原话引文、经典条文/药名/穴位归属,以及精确到秒的视频出处,可直达B站原视频对应时间点。
核心数据
| 指标 | 数值 |
|---|---|
| 判语条目 | 19,294 条,引文净字数 257,093 字 |
| 覆盖课程 | 人纪全部 117 集,约 178 小时讲课 |
| 知识体系 | 六部(伤寒论、金匮要略、神农本草经、黄帝内经、仲景心法、针灸大成) |
| 溯源精度 | 每条带 [部NN §段 @时:分:秒],可拼 B 站 ?t=秒 一键回放 |
| 质检 | 七道自动门禁(G1–G7),逐集独立重算 |
| 双源交叉 | 117 集中 90 集双 ASR 探针(whisper + FunASR)、27 集单探针 |
| 抽取粒度 | 逐行字幕级引文,平均 13 字/条 |
六部详情
| 部 | 条数 | 集数 | 内容 |
|---|---|---|---|
| 伤寒论 | 2,928 | 15 | 六经辨证,以宋本 398 条为锚 |
| 金匮要略 | 3,143 | 21 | 脏腑经络至妇人杂病二十二篇,含临床病例 |
| 神农本草经 | 2,807 | 14 | 序例/玉石/草部上中下品/增补,按药名立目 |
| 黄帝内经 | 4,529 | 19 | 素问 1–81 篇(含遗篇),按篇立目 |
| 仲景心法 | 1,062 | 4 | 复讲与临证心法 |
| 针灸大成 | 4,825 | 44 | 十二正经/奇经八脉/针法/治症/子午流注/临床实操 |
数据保真机制
- 双源交叉:烧录字幕 OCR 为主源,whisper / FunASR 独立转写作探针,逐集一致率脚本自算
- 七道门禁:含去重、主源正确性、一致率≥60%、术语白名单、出处可回溯≥95%、逐字命中≥90%、漏字率≤12%
- 源缺陷豁免:两集经抽帧目视实证确认原片本身缺字幕,走豁免流程
- 只登记不改:OCR/ASR 错型记入账本,不改动主源
- 出处落点核验:时间码须落在 OCR 行上,全库 19,294 条 100% 通过
- 分刀零重叠:54 个抽取篇目之间出处零重复、段号零交叉
数据格式
- 人读形式:
docs/六部 Markdown 文件 - 机读形式:
data/entries.jsonl(JSON 行格式,含 book、part_name、h2、h3、quote、bvid、ep、part、section、t_hms、note 字段) - RAG 推荐:
data/corpus-rag.md(约 25.7 万字),因逐句粒度偏碎,RAG 检索建议按语义段聚合
版权与使用
- 课程内容著作权归倪海厦先生及其权利继承人所有
- 仅收录短引文 + 出处,不含可还原完整课程的逐字稿
- 语料采用 CC BY-NC-SA 4.0 协议,代码采用 MIT 协议
- 内容涉及中医学说,属文化研究与学习资料,不构成医疗建议
搜集汇总
数据集介绍

构建方式
倪海厦《人纪》结构化语料库的构建依托双源交叉验证与七道质检门禁,确保每一判语可溯源至原视频特定秒数。主源采用烧录字幕OCR,辅以Whisper与FunASR双ASR引擎独立转写作为探针,对117集课程逐集核验一致率,不采信任何自报数字。历经G1至G7七道自动门禁,覆盖去重、主源正确性、探针覆盖率、术语白名单、出处可回溯性、逐字命中率及漏字率等维度,并对源缺陷实行豁免机制,最终形成涵盖伤寒论、金匮要略、神农本草经、黄帝内经、仲景心法与针灸大成六部的19,294条判语,平均每条引文13字,逐句落实出处,实现精确到秒的回放定位。
特点
本语料库以逐行字幕级引文为核心,平均13字/条,专为逐句回放设计,支持点击直达B站原视频对应秒数。其结构化层级分明,按六部经典分篇立目,以经典条文、药名、穴位为锚点,便于系统检索与研读。数据保真机制严密,包括双源交叉、出处落点核验及分刀零重叠,确保每一条判语的准确性与独特性。此外,库内配备RAG优化版本文档(corpus-rag.md),便于大型语言模型高效获取知识,兼顾人读与机读双重视角,开源协议明确,为中医文化传承与智能应用提供坚实基础。
使用方法
使用者可直接阅读docs/目录下的六部分卷,或通过data/entries.jsonl以编程方式访问结构化数据,支持按部、章目、引文等字段进行精细筛选。每条判语附带精确的B站视频链接,可通过拼接URL实现一键回放,便于比对原声与文本。对于RAG应用,建议采用data/corpus-rag.md聚合文档或将条目按书部、段落合并以优化检索效果。质量保障方面,提供tools/下的门禁脚本,可复跑G2/G3/G5/G6/G7等质检流程,确保数据可靠性。整个使用流程清晰直观,既满足学术研究的严谨性,也兼顾智能应用的高效性。
背景与挑战
背景概述
倪海厦《人纪》结构化语料库于2026年8月发布,由Renhuai123等研究者基于倪海厦先生在中医学领域的系列课程构建,旨在将散落于视频中的口述知识转化为可检索、可回放的结构化文本。该语料库覆盖《伤寒论》《金匮要略》《神农本草经》《黄帝内经》《仲景心法》及《针灸大成》六部经典,共19,294条判语,每条均附原文引文、经典条文归属及精确到秒的视频定位,实现了对178小时授课内容的逐句溯源。其双源交叉验证与七道质量门禁机制,为中医经典传承提供了高保真的数据基础,对中医数字化研究与自然语言处理,尤其是中医知识图谱构建及智能问答系统开发,具有重要的参考价值与推动作用。
当前挑战
该数据集的构建面临多重挑战。在领域层面,中医经典晦涩难懂,术语繁多且存在版本差异,如何精准锚定条文归属并确保语义准确是一大难点;同时,口述课程语速不一、方言口音及环境噪声干扰严重,对语音转写准确性构成挑战。在构建过程中,需应对OCR识别错漏、同音异形词干扰及双ASR引擎在专业术语上的一致率低于阈值等问题,且在117集中有27集采用单探针,缺乏交叉验证,增加了质量风险。此外,维护数据溯源的可回溯性(每条判语的出处精确到秒)及实现跨部类别的分刀零重叠,要求耗费大量人工核对,并需持续迭代以修正转录误差,确保语料的高保真度与完整性。
常用场景
经典使用场景
倪海厦《人纪》结构化语料库作为中医经典教育数字化的重要基础设施,其经典使用场景聚焦于构建高精度的中医知识检索与回放系统。该语料库将《人纪》六部课程(伤寒论、金匮要略、神农本草经、黄帝内经、仲景心法、针灸大成)的117集、178小时讲课内容细化为19,294条判语,每条判语均包含倪师原话引文、经典条文归属及精确到秒的视频出处。研究者可利用此语料库进行逐句回放验证,实现经典条文与临床讲解的即时对照,为中医教学、自学及学术引用提供了前所未有的精准溯源工具,显著提升了传统医学知识获取的效率和准确性。
解决学术问题
该语料库解决了中医口传心授知识体系中长期存在的‘文本-讲解-出处’三者割裂的学术痛点。通过引入双源ASR探针(whisper与FunASR)与七道自动化质检门禁(G1-G7),确保了转录文本的高保真度(一致率≥60%,漏字率≤12%)与出处可回溯性(100%落点OCR行),为中医文献学、语言学研究提供了可量化、可复现的高质量语料。在学术意义上,它首次实现了对倪海厦先生临床思维大规模、细粒度的结构化编码,使得‘六经辨证’‘本草药性’等抽象理论可以基于实证数据进行统计分析,促进了中医知识的数字化传承与循证研究方法的融合,也为其他古典医学口述资料的整理树立了方法论典范。
衍生相关工作
该数据集的发布催生了若干引人注目的衍生工作。首先,姊妹库nihai-tianji-corpus已上线,承接同一套方法论,完成了《天纪》领域4886条判语的整理,并配以紫微斗数开源排盘引擎ziwei-doushu,形成了从中医到命理的跨学科知识矩阵,展示出该方法在传统术数典籍数字化中的普适性。其次,基于该语料库的RAG实践催生了专门针对短引文聚合的技术探讨,研究者正尝试优化文本分块策略,以解决13字级chunk在语义检索中的碎片化问题,相关工作经验有望反哺通用中文知识抽取领域。此外,开源的门禁脚本(tools/)也被外部项目借鉴,用于其音频转录质量评估,间接推动了语音数据清洗标准的共建。这些衍生工作共同验证了此语料库作为高质量数据基座的长远影响力。
以上内容由遇见数据集搜集并总结生成



