遇见数据集

nihai-tianji-corpus

收藏
github2026-08-16 更新2026-08-18 收录
官方服务:

资源简介:

倪海厦《天纪》结构化语料库,包含紫微斗数、易经、堪舆、铁板神数四学科,共4886条判语,每条判语包含倪师原话短引文、十一册体系归属和精确到秒的视频出处,可回放溯源。

Structured Corpus of Ni Haixia's *Tian Ji*: This corpus encompasses four traditional Chinese divination disciplines: Ziwei Doushu, *I Ching* (Book of Changes), Fengshui (Kan Yu, traditional Chinese geomancy), and Tieban Shenshu. It comprises a total of 4,886 divination judgments. Each entry features a short direct quote from Master Ni's original statements, attribution to the 11-volume framework of *Tian Ji*, and a video source timestamped down to the exact second, enabling playback and accurate source tracing.

创建时间:
2026-08-16
原始信息汇总

倪海厦《天纪》结构化语料库 · nihai-tianji-corpus

数据集概览

本数据集是将倪海厦先生《天纪》全部课程(共112个单元、约61小时讲课)整理成的结构化知识库,每条判语包含倪师原话短引文、知识体系归属以及精确到秒的视频出处,支持一键跳转B站原视频对应时间点回放验证。当前版本为 v2.0 · 天纪全量,覆盖紫微斗数、易经(序卦+六十四卦)、堪舆、铁板神数四大学科。

核心数据指标

指标 数值
判语条目 4886 条(引文净字数 690,289 字,平均 141 字/条)
覆盖课程 天纪全部 112 个单元、约 61 小时讲课
知识体系 十一册,倪师授课原生分类
溯源精度 每条带 [讲 §段 @时:分:秒],可拼 B 站 ?p=N&t=秒 一键回放
质检 七道自动门禁 + 全库 5142 条逐条语义清扫 + 三轮独立抽样审查
封库终裁 162 条随机样本,问题率 0.0%
人工勘误 171 对字幕错字逐条人工裁决,账本全量公开

知识体系(十一册分类)

条数 内容
01 主星 378 十四主星与辅煞星的定性、性情、格局
02 十二宫 366 命宫至父母宫、三方四正、借星
03 格局 127 吉格 / 凶格 / 结构性警示
04 四化 174 化科 / 化权 / 化禄 / 化忌
05 疾厄 80 十二地支宫配脏腑、病灾判断
07 方法论 751 天纪总纲、批命顺序、学习法、面相手相、阳宅化命
08 易理总纲 400 象 / 序卦通义 / 三道 / 卦爻通论
09 六十四卦 2139 六十四卦逐卦:卦象 / 序卦 / 爻辞 / 卜筮 / 人间道
10 占断 100 金钱卦 / 测字 / 六神 / 小六壬
11 堪舆 257 峦头理气 / 罗经坐山来龙 / 宅法
12 铁板神数 114 铁板神数 / 皇极经世 / 卦数批命

(06 为历史保留编号,无该册。)另有课程轴索引,逐讲语义段大纲 + 段级回放直链。

数据形态与使用

  • 人读docs/ 册内每条判语呈现为倪师原话引文 + 出处时间码,例如:「比如说,你是一子送终,你是半空折翅,通通从福德宫里面批出来的。」 [p03 §10 @00:40:09]
  • 机读data/entries.jsonl 每条包含 book / h2 / h3 / quote / bvid / part / section / t_hms / note 字段,可直接作为 RAG 的 chunk,无需再切。
  • 回放:每条判语可按 https://www.bilibili.com/video/{bvid}?p={part}&t={秒数} 直达原视频对应秒。
  • 整包投喂data/corpus-rag.md 约 69 万字 / 100 万+ token 可直接用于大模型。

数据保真机制

机制 说明
双源交叉 人工校正字幕(OCR)× whisper / FunASR 双引擎独立转写,逐讲一致率 60–91%
七道门禁 空批次防线 / 秒级去重 / 探针覆盖≥95% / 一致率≥60% / 术语白名单 / 出处可回溯≥95% / 逐字命中≥90%
全库语义清扫 5142 条逐条 AI 判读,清洗 1872 条 OCR 噪声、移出 256 条、重挂 95 条
只删不改 清洗文本经程序逐字符验证为原文子序列;49 条 AI 越界改字的一律作废转人工
人工勘误 字幕错字须人工逐条裁决,改动留痕 〔已按裁决改正:X→Y〕,账本 171 对全量公开
三轮抽查 归类抽查 121 条 → 清扫后复审 150 条 → 封库终裁 162 条,问题率 0.0%

附带资源

  • 格局重绘图(14 张):依判语数据用 SVG 重新绘制倪师板书盘面,不复制原视频任何像素,每张图标注成格条件与判语出处(20 个格局中绘出 14 张,另 6 个判语只讲现象未言盘面结构,据实不画)。
  • 学习网站(124 页,零依赖静态):支持十一册 × 112 单元双轴导航、判语卡一键回放、全库 4886 条前端检索与关键词高亮、深浅色自适应。
  • 中间层复现管线:本库不分发帧/音频/转写等中间层,但 tools/REPRODUCE.md 提供完整开源管线,可从公开视频复现每一个中间层,文内写清音轨选择、whisper 参数陷阱、水印位置过滤、繁简归一等踩坑点。

相关项目与协议

  • 关联项目:ziwei-doushu(紫微斗数开源排盘引擎),本库作为其知识层。
  • 语料协议:data/docs/CC BY-NC-SA 4.0tools/ 代码为 MIT。
  • 版权声明:《天纪》课程内容著作权归倪海厦先生及其权利继承人所有;本库仅收录短引文 + 出处的结构化条目,不含可还原完整课程的逐字稿,不搬运任何视听内容;权利方提出异议将立即下架相应部分。
  • 免责声明:内容涉及传统命理学说,属文化研究与学习资料,不构成任何医疗、投资或人生决策建议。
搜集汇总
数据集介绍
nihai-tianji-corpus 数据集图片
构建方式
本数据集以倪海厦先生《天纪》全部课程为蓝本,通过人工校正字幕与双引擎(whisper/FunASR)独立转写的交叉验证,构建了涵盖紫微斗数、易经、堪舆、铁板神数四大学科的结构化语料库。每条判语包含倪师原话短引文、十一册体系归属及精确到秒的视频出处,并经过七道自动门禁与全库语义清扫,确保文本为原文子序列,最终经三轮独立抽样审查,封库终裁问题率为0.0%。
特点
数据集共收录4886条判语,引文净字数达69万字,平均每条141字,覆盖112个课程单元,约61小时讲课内容。其显著特点在于每条判语均可回放验证,出处链接直达B站原视频秒级位置;知识体系按倪师授课原生分类为十一册,另附课程索引提供双轴导航。此外,还包含14张基于判语数据用SVG重绘的格局图,忠实呈现原板书结构,不复制任何视频像素,确保学术严谨性与可追溯性。
使用方法
使用者可直接阅读docs/目录下十一册文档或从课程索引跟学;技术用户可通过Python加载data/entries.jsonl文件,每条判语作为一个独立chunk,利用book/h2/h3等字段进行过滤检索,并生成一键回放链接。另提供data/corpus-rag.md整包文件,约69万字,便于大规模语言模型训练或检索增强生成(RAG)应用。所有清洗与构建管线完全开源,可依据tools/REPRODUCE.md从公开视频完整复现中间层,确保数据可复验性与透明性。
背景与挑战
背景概述
倪海厦《天纪》结构化语料库(nihai-tianji-corpus)由开源社区于2026年构建,旨在将中医名家倪海厦先生《天纪》系列课程转化为可回放验证的结构化知识库。该语料库覆盖紫微斗数、易经、堪舆、铁板神数四大学科,共计4886条判语,约69万字,每条判语均附精确到秒的视频出处,支持一键回放至B站原视频。项目由Renhuai123等研究者主导,采用双引擎语音识别与人工校正相结合的数据保真机制,经过七道自动门禁与三轮独立抽样审查,最终封库终裁问题率为0.0%。该语料库为传统命理学说的数字化研究提供了高质量、可追溯的语料基础,推动了该领域在自然语言处理与知识图谱构建方面的应用,成为连接古典智慧与现代AI技术的桥梁。
当前挑战
该数据集构建面临多重挑战。领域层面,传统命理学说术语晦涩、体系复杂,且口语化授课内容存在大量模糊表达与语境依赖,使得语义结构化与知识抽取难度极高。构建过程中,需处理原始视频字幕的OCR噪声与语音识别误差,项目通过双源交叉验证(人工字幕与双引擎转写)将一致率提升至60-91%,但部分课程一致率仍偏低。此外,需严格防范AI改字破坏原文,项目采用程序逐字符验证,确保清洗文本为原文子序列,并辅以人工勘误171处。版权与伦理问题亦构成挑战,项目仅收录短引文,避免再分发完整课程内容,需在知识开放与版权保护间取得平衡。最终,通过全库语义清扫与终裁审查,实现了0.0%的问题率,但这一过程耗时耗力,凸显了高质量古籍数字化语料构建的长期性与复杂性。
常用场景
经典使用场景
该语料库作为传统命理学领域首个结构化知识库,其经典使用场景在于为研究者提供可精确回溯的原文片段检索平台。通过将倪海厦先生《天纪》课程中4886条判语按十一册体系分类,并附加视频时间戳,学者能够迅速定位至特定主题的原始论述,如紫微斗数主星性质、六十四卦哲理或堪舆理论,从而开展逐句对照的文本分析。这种设计极大便利了传统术数文献的定性研究,使深度挖掘倪师授课精髓成为可能。
衍生相关工作
围绕此语料库已衍生出多项重要工作。最显著的是与其关联的“ziwei-doushu”开源排盘引擎,该引擎提供紫微斗数盘面计算,而此语料库则充当其知识层,使引擎能结合倪师判语解释盘面格局,形成从排盘到解盘的完整链路。此外,基于判语数据绘制的14张SVG格局重绘图,以可视化形式再现了倪师的板书精髓,为格局研究提供了直观的参考资源。这些衍生成果共同构建了一个从数据整理、语义分析到交互呈现的生态,拓展了原始课程的学术与应用价值。
数据集最近研究
最新研究方向
该数据集的问世,标志着传统命理学知识体系在数字化与结构化整理上迈出了具有范式意义的一步。研究前沿聚焦于将倪海厦先生《天纪》中涵盖紫微斗数、易经、堪舆与铁板神数等庞杂的口传心授内容,通过双引擎交叉验证、逐句时间码溯源及语义清扫等严苛流程,转化为可供机器精确检索与回放验证的高保真语料库。此工作不仅为命理学爱好者和研究者提供了前所未有的便捷学习与研究工具,更在古籍与口述知识的数字化保存、知识图谱构建及RAG(检索增强生成)等人工智能应用领域开辟了新的可能。其零问题率的封库终裁与全链路开源复现的实践,为该领域的知识工程树立了质量与透明度的新标杆,预示着以数据为驱动的传统文化遗产传承与研究的新时代已然来临。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务