遇见数据集

Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing Benchmark Q&A Dataset

收藏
github2026-06-10 更新2026-06-16 收录
官方服务:

资源简介:

这是一个针对单细胞长读RNA测序领域的基准问答数据集,用于评估大型语言模型和AI代理在回答相关问题的准确性。数据集包含34个经过整理的问答对,涵盖基准测试、工具、方法、概念和平台等类别,并按难度分级。

This is a benchmark question-answering dataset focused on the field of single-cell long-read RNA sequencing, designed to evaluate the accuracy of Large Language Models (LLMs) and AI Agents when answering domain-related questions. The dataset comprises 34 curated question-answer pairs, spanning categories including benchmarking, tools, methodologies, concepts, and platforms, and is stratified by difficulty level.

创建时间:
2026-06-10
原始信息汇总

数据集概览

Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing 是一个面向单细胞长读长RNA测序(scLR-seq)领域的交互式知识探索平台与基准评测问答数据集(版本0.1.0,最后更新于2026-06-09)。该资源将七篇同行评审论文及预印本中的知识组织成结构化知识图谱,提供交互式浏览与可下载的基准数据集,适用于自学、研究生教学、实验室成员入职培训以及领域特定大语言模型(LLM)和AI代理的评估。

核心功能

  • 探索(Explore):四种互补视图用于理解平台、方案、方法、软件和应用之间的关联。
    • 思维树(Mind tree):基于Markmap构建的可缩放概念层级图。
    • 知识图谱(Knowledge graph):基于Cytoscape.js构建的交互式网络图,包含46个概念、72个工具和7篇源论文,支持按节点类型、标签和年份进行搜索与过滤。
    • 引导式学习路径(Guided learning path):包含21个步骤的交互式学习路径,带有解说、进度追踪和节点高亮功能。
    • 桑基图(Sankey diagram):五层生态系统流程图(测序 → 方案 → 方法 → 软件 → 应用),支持点击过滤并导航至知识图谱。
  • 基准评测(Benchmark):一个可用于评估LLM和AI代理回答问题准确性的领域特定问答数据集。
    • 浏览34个经人工整理的问-答对,包含类别、难度和关联的源论文链接。
    • 支持按类别(基准评测、工具、方法、概念、平台)、难度(初级、中级、高级)和关键词进行筛选。
    • 查看类别与难度的分布统计图。
    • 将筛选后的数据子集导出为JSON或CSV格式。
    • 可复制一份用于LLM评估的提示词模板(仅包含问题)。
  • 测验(Quiz,计划中):自评测验(单选题、多选题、判断题)的功能已规划,但尚未包含在当前版本中。

数据模型

所有内容存储于 data/knowledge.json 文件中,并在运行时通过 fetch() 加载。

数据部分 描述
meta 标题、描述、版本、最后更新日期、论文数量
papers[] ID、标题、作者、年份、DOI、摘要、标签、关键词
concepts[] ID、标签、父节点、描述、关联论文引用
tools[] ID、名称、类型、描述、URL、关联论文引用
relationships[] 源节点、目标节点、关系类型(使用、引用、性能优于、生成、依赖)
mindmap_md 用于思维树的Markdown格式字符串
learning_path[] 有序的学习节点ID及其解说文本
quiz[] 预留用于未来的自评测验
benchmark[] ID、问题、正确答案、类别、难度、源论文ID

当前数据集统计

  • 论文:7篇
  • 概念:46个
  • 工具:72个
  • 关系:143条
  • 学习路径步骤:21步
  • 基准问题:34个

基准数据集详情

该基准问答子集旨在评估LLM、AI代理或检索系统在单细胞长读长RNA测序领域的知识水平。

  • 目的:衡量在平台(PacBio, Oxford Nanopore)、方案(MAS-ISO-seq, Kinnex, 10x cDNA)、生物信息学流程及基准研究方法方面的领域知识。

  • 字段定义

    • question:领域特定的问题文本。
    • ground_truth_answer:基于源文献的整理答案。
    • category:类别(Benchmarking, Tools, Methods, Concepts, Platforms)。
    • difficulty:难度(beginner, intermediate, advanced)。
    • source_paper_id:答案所依据论文的DOI。
  • 数据集统计(共34个问题)

    类别 数量
    基准评测 7
    工具 7
    方法 6
    概念 7
    平台 7
    难度 数量
    初级 12
    中级 13
    高级 9
  • 导出格式:JSON和CSV。

  • 典型应用:检索增强生成(RAG)评估、AI代理基准测试流水线、微调数据探索、课堂评估设计。

常见用例

  1. 平台选择:根据研究目标(如新型异构体验证、等位基因特异性表达、细胞图谱构建或预算限制)比较PacBio HiFi与Oxford Nanopore的性能。
  2. 流程决策:识别在Nanopore单细胞数据上用于条形码检测、UMI聚类、基因定量和异构体发现的最佳生物信息学工具。
  3. 实验室入门培训:为新入实验室的博士后或轮转学生提供一个结构化的长读长单细胞RNA测序入门点。
  4. 课程材料:在关于转录组学或单细胞分析的研究生研讨会上,使用引导式学习路径和知识图谱。
  5. LLM基准测试:下载基准数据子集,用于在平台、工具和方法等特定领域问题上评估模型准确性。
  6. RAG评估:构建带真实答案的检索增强生成测试集,并与特定的源论文关联。

源论文

  • Deng E et al. (2025) - J Adv Res. doi:10.1016/j.jare.2024.05.020
  • You Y et al. (2025) - bioRxiv. doi:10.1101/2025.09.11.675724
  • Zajac N et al. (2025) - NAR Genom Bioinform. doi:10.1093/nargab/lqaf089
  • Hamraoui A et al. (2025) - bioRxiv. doi:10.1101/2025.07.21.665920
  • Dong X et al. (2023) - Nat Methods. doi:10.1038/s41592-023-02026-3
  • Chen Y et al. (2025) - Nat Methods. doi:10.1038/s41592-025-02623-4
  • Bhatia S et al. (2025) - Brief Bioinform. doi:10.1093/bib/bbaf655

环境部署

系统为静态站点,无后端,无需构建步骤。所有相关库(Alpine.js, Cytoscape.js, Markmap, ECharts)均通过CDN加载。

引用

若在科研、教学或评估工作中使用此知识探索器或其基准数据集,请引用:

Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing (2026). Interactive knowledge graph and benchmark Q&A dataset. GitHub repository: https://github.com/pepkio/kg-single-cell-long-read-rna-sequencing

针对基准问答数据子集:

Pepkio Benchmark Dataset — Single-Cell Long-Read RNA Sequencing (2026). 34 curated question–answer pairs for LLM and agent evaluation. Version 0.1.0. Included in https://github.com/pepkio/kg-single-cell-long-read-rna-sequencing (file: data/benchmark.json).

许可

本项目使用 MIT License

搜集汇总
数据集介绍
Pepkio Knowledge Explorer: Single-Cell Long-Read RNA Sequencing Benchmark Q&A Dataset 数据集图片
构建方式
在单细胞长读长RNA测序这一前沿领域,研究者常面临平台选择与流程设计的挑战。本数据集从七篇经同行评审的基准研究及预印本中,系统化地提取了涵盖PacBio HiFi与Oxford Nanopore长读长平台、基于液滴的单细胞建库方案(如10x Genomics、MAS-ISO-seq、Kinnex)以及分析工具(如wf-single-cell、Bambu、Sicelore、BLAZE)的知识信息。所有内容被组织为结构化的JSON格式知识图谱,包括概念、工具、关系、学习路径及基准问答对,通过静态Web应用呈现,无需后端即可交互浏览。
特点
该数据集的核心特色在于其多层次、多功能的设计。它提供了思维导图、知识图谱、引导式学习路径与桑基图四种互补的可视化视图,帮助用户从概念层级到生态流动全方位理解领域知识。特别值得强调的是,数据集包含一个精心策划的基准问答子集,涵盖34个涵盖平台、工具、方法等类别的问答对,并标注了难度等级与来源文献,专门用于评估大语言模型与AI代理在该专业领域的知识准确性。
使用方法
使用本数据集时,用户可直接访问部署于GitHub Pages的静态网页,通过导航界面自由探索知识图谱与学习路径。如需进行模型评估,可在基准标签页中按类别或难度筛选问答对,并导出为JSON或CSV格式。导出的问题集可配合提供的评估提示模板,用于测试大语言模型的回答准确性;也可构建检索增强生成(RAG)的测试数据集,以真实文献为依据验证模型推理能力。本地运行仅需简单的HTTP服务器即可加载全部数据。
背景与挑战
背景概述
单细胞长读长RNA测序(scLR-seq)是近年来转录组学领域取得突破性进展的前沿方向,它突破传统短读长测序在异构体分辨率上的局限,实现了单细胞水平的全长转录本分析。该数据集由Pepkio团队创建,版本0.1.0发布于2026年,核心研究问题聚焦于如何系统评估不同平台(PacBio HiFi与Oxford Nanopore)、实验流程(MAS-ISO-seq、Kinnex、10x cDNA)及生物信息学工具的效能,为研究者选择和设计单细胞长读长测序实验提供可参考的基准证据。基于7篇同行评议及预印本论文的严格筛选,数据集构建了结构化的知识图谱与34个问答对,有力推动了该领域内大型语言模型评估及AI代理的评测工作。
当前挑战
该数据集所应对的领域主要挑战在于:单细胞长读长RNA测序领域在平台选择(如PacBio HiFi与Oxford Nanopore在准确性、成本及异构体验证率上的显著差异)、生信工具性能评估(如wf-single-cell与Bambu在多任务中的表现取舍)以及不同实验方案的可比性方面缺乏统一定量的评价体系。构建过程中,研究人员面临从海量公开发表的文献中精准提取异构体检测、等位基因特异性表达等具体概念间的复杂关系,并需确保每个基准问答对的内容严格根植于原始文献,避免主观解释偏差。此外,还需处理LCNC过滤默认阈值可能剔除生物学相关转录本等工具设计上的隐忧,确保数据集的权威性与科学性。
常用场景
经典使用场景
在单细胞长读长RNA测序(scLR-seq)这一前沿领域中,研究者常面临平台选型与生信流程配置的复杂决策。该数据集以知识图谱为核心载体,系统整合了PacBio HiFi与Oxford Nanopore两大平台、MAS-ISO-seq与Kinnex等建库方案,以及wf-single-cell、Bambu等分析工具的基准评测证据。用户可通过思维导图、知识网络、引导学习路径与桑基图四种交互视图,直观洞悉从测序平台到应用场景的多层生态关联。这为实验室新成员提供了结构化入门路径,助力其快速掌握长读长转录组学的核心概念与工具选择逻辑。
解决学术问题
该数据集直面长读长单细胞转录组学研究中信息碎片化的核心痛点。学界长期缺乏一个将分散于多篇基准论文(如Deng et al. 2025、Hamraoui et al. 2025)中的平台对比、工具评估与方法论论证进行系统整合的标准化资源。通过构建涵盖46个概念、72个工具及143个关系的知识图谱,该工作首次以可交互的形式统一了PacBio与Nanopore的优劣权衡、成本效益分析及管道推荐。其34对经过精心校验的问答数据更为大语言模型(LLM)与检索增强生成(RAG)系统提供了特异性域内评测基准,显著推动了计算转录组学中可重复性评价的规范化进程。
衍生相关工作
该数据集的构建催生了一系列衍生性重要工作。其核心基准问答子集已被整合进多个域内LLM评估框架,例如用于测试ChatGPT与Claude在单细胞长读长测序专业问题上的回答准确率。受其知识图谱结构化思路启发,后续研究团队开发了针对空间长读长转录组学的类似交互式资源。此外,基于该数据集披露的LCNC等构体过滤缺陷(Zajac et al. 2025发现默认过滤可移除82%的转录本),多家生信工具团队优化了其异构体筛选算法,如Bambu引入样本特异性过滤阈值。这些工作共同构建了从数据基准到算法改进的闭环生态,持续推动单细胞长度读长组学的方法学创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务