Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing Benchmark Q&A Dataset
收藏资源简介:
这是一个针对单细胞长读RNA测序领域的基准问答数据集,用于评估大型语言模型和AI代理在回答相关问题的准确性。数据集包含34个经过整理的问答对,涵盖基准测试、工具、方法、概念和平台等类别,并按难度分级。
This is a benchmark question-answering dataset focused on the field of single-cell long-read RNA sequencing, designed to evaluate the accuracy of Large Language Models (LLMs) and AI Agents when answering domain-related questions. The dataset comprises 34 curated question-answer pairs, spanning categories including benchmarking, tools, methodologies, concepts, and platforms, and is stratified by difficulty level.
数据集概览
Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing 是一个面向单细胞长读长RNA测序(scLR-seq)领域的交互式知识探索平台与基准评测问答数据集(版本0.1.0,最后更新于2026-06-09)。该资源将七篇同行评审论文及预印本中的知识组织成结构化知识图谱,提供交互式浏览与可下载的基准数据集,适用于自学、研究生教学、实验室成员入职培训以及领域特定大语言模型(LLM)和AI代理的评估。
核心功能
- 探索(Explore):四种互补视图用于理解平台、方案、方法、软件和应用之间的关联。
- 思维树(Mind tree):基于Markmap构建的可缩放概念层级图。
- 知识图谱(Knowledge graph):基于Cytoscape.js构建的交互式网络图,包含46个概念、72个工具和7篇源论文,支持按节点类型、标签和年份进行搜索与过滤。
- 引导式学习路径(Guided learning path):包含21个步骤的交互式学习路径,带有解说、进度追踪和节点高亮功能。
- 桑基图(Sankey diagram):五层生态系统流程图(测序 → 方案 → 方法 → 软件 → 应用),支持点击过滤并导航至知识图谱。
- 基准评测(Benchmark):一个可用于评估LLM和AI代理回答问题准确性的领域特定问答数据集。
- 浏览34个经人工整理的问-答对,包含类别、难度和关联的源论文链接。
- 支持按类别(基准评测、工具、方法、概念、平台)、难度(初级、中级、高级)和关键词进行筛选。
- 查看类别与难度的分布统计图。
- 将筛选后的数据子集导出为JSON或CSV格式。
- 可复制一份用于LLM评估的提示词模板(仅包含问题)。
- 测验(Quiz,计划中):自评测验(单选题、多选题、判断题)的功能已规划,但尚未包含在当前版本中。
数据模型
所有内容存储于 data/knowledge.json 文件中,并在运行时通过 fetch() 加载。
| 数据部分 | 描述 |
|---|---|
meta |
标题、描述、版本、最后更新日期、论文数量 |
papers[] |
ID、标题、作者、年份、DOI、摘要、标签、关键词 |
concepts[] |
ID、标签、父节点、描述、关联论文引用 |
tools[] |
ID、名称、类型、描述、URL、关联论文引用 |
relationships[] |
源节点、目标节点、关系类型(使用、引用、性能优于、生成、依赖) |
mindmap_md |
用于思维树的Markdown格式字符串 |
learning_path[] |
有序的学习节点ID及其解说文本 |
quiz[] |
预留用于未来的自评测验 |
benchmark[] |
ID、问题、正确答案、类别、难度、源论文ID |
当前数据集统计:
- 论文:7篇
- 概念:46个
- 工具:72个
- 关系:143条
- 学习路径步骤:21步
- 基准问题:34个
基准数据集详情
该基准问答子集旨在评估LLM、AI代理或检索系统在单细胞长读长RNA测序领域的知识水平。
-
目的:衡量在平台(PacBio, Oxford Nanopore)、方案(MAS-ISO-seq, Kinnex, 10x cDNA)、生物信息学流程及基准研究方法方面的领域知识。
-
字段定义:
question:领域特定的问题文本。ground_truth_answer:基于源文献的整理答案。category:类别(Benchmarking,Tools,Methods,Concepts,Platforms)。difficulty:难度(beginner,intermediate,advanced)。source_paper_id:答案所依据论文的DOI。
-
数据集统计(共34个问题):
类别 数量 基准评测 7 工具 7 方法 6 概念 7 平台 7 难度 数量 初级 12 中级 13 高级 9 -
导出格式:JSON和CSV。
-
典型应用:检索增强生成(RAG)评估、AI代理基准测试流水线、微调数据探索、课堂评估设计。
常见用例
- 平台选择:根据研究目标(如新型异构体验证、等位基因特异性表达、细胞图谱构建或预算限制)比较PacBio HiFi与Oxford Nanopore的性能。
- 流程决策:识别在Nanopore单细胞数据上用于条形码检测、UMI聚类、基因定量和异构体发现的最佳生物信息学工具。
- 实验室入门培训:为新入实验室的博士后或轮转学生提供一个结构化的长读长单细胞RNA测序入门点。
- 课程材料:在关于转录组学或单细胞分析的研究生研讨会上,使用引导式学习路径和知识图谱。
- LLM基准测试:下载基准数据子集,用于在平台、工具和方法等特定领域问题上评估模型准确性。
- RAG评估:构建带真实答案的检索增强生成测试集,并与特定的源论文关联。
源论文
- Deng E et al. (2025) - J Adv Res.
doi:10.1016/j.jare.2024.05.020 - You Y et al. (2025) - bioRxiv.
doi:10.1101/2025.09.11.675724 - Zajac N et al. (2025) - NAR Genom Bioinform.
doi:10.1093/nargab/lqaf089 - Hamraoui A et al. (2025) - bioRxiv.
doi:10.1101/2025.07.21.665920 - Dong X et al. (2023) - Nat Methods.
doi:10.1038/s41592-023-02026-3 - Chen Y et al. (2025) - Nat Methods.
doi:10.1038/s41592-025-02623-4 - Bhatia S et al. (2025) - Brief Bioinform.
doi:10.1093/bib/bbaf655
环境部署
系统为静态站点,无后端,无需构建步骤。所有相关库(Alpine.js, Cytoscape.js, Markmap, ECharts)均通过CDN加载。
- GitHub Pages (推荐):访问 https://pepkio.github.io/kg-single-cell-long-read-rna-sequencing/
- 本地运行:
git clone https://github.com/pepkio/kg-single-cell-long-read-rna-sequencing.gitcd kg-single-cell-long-read-rna-sequencingpython3 scripts/serve.py- 在浏览器中打开
http://localhost:8766/
引用
若在科研、教学或评估工作中使用此知识探索器或其基准数据集,请引用:
Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing (2026). Interactive knowledge graph and benchmark Q&A dataset. GitHub repository: https://github.com/pepkio/kg-single-cell-long-read-rna-sequencing
针对基准问答数据子集:
Pepkio Benchmark Dataset — Single-Cell Long-Read RNA Sequencing (2026). 34 curated question–answer pairs for LLM and agent evaluation. Version 0.1.0. Included in https://github.com/pepkio/kg-single-cell-long-read-rna-sequencing (file:
data/benchmark.json).
许可
本项目使用 MIT License。





