遇见数据集

history-of-life

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

History of Life数据集是一个专门的问题回答数据集,包含55,000个高质量的问题-答案对,专注于生命历史和生物进化领域。该数据集来源于英文维基百科中History of life相关文章的精选子集,爬取深度为2。数据集采用Parquet文件格式,每个条目包含系统消息和多样化的用户-助手问答对。该数据集旨在支持领域特定的检索增强生成(RAG)和问答系统的训练与评估,特别适用于微调模型以进行关于进化、早期地球、生物和地质演化等方面的对话。数据集的策划遵循严格的标准,接受提供全面信息内容或概念背景的文章,包括行星与地质背景、生化起源与细胞进化、宏观进化分类辐射、进化机制与适应动力学、大规模灭绝与生物圈重置事件、系统发育轨迹与古人类学等类别,同时拒绝纯技术数据表、代码块、无关主题的简要提及以及元数据和布局噪声等内容。数据收集和处理使用Python和本地大语言模型完成。

The History of Life Dataset is a specialized question-answering dataset containing 55,000 high-quality question-answer pairs focused on the domains of life history and biological evolution. This dataset is derived from a curated subset of English Wikipedia articles related to the History of Life, with a crawling depth of 2. The dataset is stored in Parquet file format, and each entry includes system messages and diverse user-assistant question-answer pairs. This dataset aims to support the training and evaluation of domain-specific Retrieval-Augmented Generation (RAG) and question-answering systems, and is particularly well-suited for fine-tuning models to power conversations regarding evolution, early Earth, biological and geological evolution, and other related topics. The curation of the dataset follows strict standards: articles providing comprehensive informational content or conceptual backgrounds are accepted, covering categories such as planetary and geological contexts, biochemical origins and cellular evolution, macroevolutionary adaptive radiations, evolutionary mechanisms and adaptive dynamics, mass extinction and biosphere reset events, phylogenetic trajectories and paleoanthropology, among others. Conversely, pure technical data tables, code blocks, brief mentions of off-topic content, metadata, layout noise, and other similar irrelevant content are excluded. Data collection and processing were performed using Python and local Large Language Models (LLMs).

创建时间:
2026-06-16
原始信息汇总

数据集概述

数据集名称: History of Life
许可证: Apache-2.0
语言: 英语
标签: 进化、生命起源、生命历史
整理方: proximableu

数据集描述

History of Life 是一个专注于生命历史与生物进化的专用问答数据集,包含 55,000 个高质量的问答对。该数据集基于从英语维基百科文章中精选的子集构建,旨在支持领域特定的检索增强生成(RAG)和问答系统的训练与评估。

数据集用途

用于微调模型,使其能够围绕进化、早期地球、生物与地质进化等主题进行对话。

数据集结构

  • 格式: Parquet 文件
  • 条目数量: 55,000 条
  • 内容: 每条记录包含系统消息以及多样化的问答对(用户-助手)

数据来源

原始数据来自维基百科,从“生命历史”相关文章出发,并向下抓取两层深度。

数据收集与处理

  • 方法: 使用 Python 和本地大型语言模型(LLM)进行数据处理
  • 筛选标准: 通过自定义提示词进行内容审查,仅接受包含对早期地球条件、生化起源、宏观进化、进化机制、大灭绝事件及系统发育轨迹等主题的清晰、描述性、概念丰富的说明性文本的文章。拒绝包含过度技术性数据表、代码块、纯元数据或与主题无关的简短提及的内容。

数据集卡片联系方式

proximableu

搜集汇总
数据集介绍
history-of-life 数据集图片
构建方式
该数据集基于英语维基百科中与生命历史和生物进化相关的文章构建,通过‘生命历史’主题页面及其两层链接深度进行爬取,获取了丰富的原始文本资料。随后,利用本地大型语言模型依据精心设计的策展提示(包含接受与拒绝的详细标准)对文章进行筛选与清洗,最终生成了55,000个高质量、多样化且聚焦于该领域问答对的专门数据集,并以Parquet文件格式存储。
使用方法
该数据集以Parquet格式文件提供,可直接用于监督微调实验,适用于专门针对地球生命演化史进行对话与问答的语言模型开发。使用时,研究人员可将系统消息作为上下文,结合用户问题与助手答案开展段落级或细粒度问答能力的训练与评估。此外,由于内容源自维基百科且经过严格策展,该数据集也适合作为检索增强生成系统中知识库质量评估或者领域内回答基准测试的参考资源。
背景与挑战
背景概述
生命起源与演化是自然科学的终极命题之一,跨越地质学、生物学与古生物学等多学科疆域。History of Life数据集由研究者proximableu于近期构建,源自英文维基百科中关于生命历史与生物演化的精选子集,经严格筛选与结构化处理,最终形成包含55,000个高质量问答对的专业语料库。该数据集聚焦于从早期地球环境、化学起源、细胞演化、宏进化辐射到物种大灭绝及古人类学等深层时叙事,旨在为检索增强生成与领域特定问答系统提供训练与评估基础。其精细的分类学界定与接纳准则,标志着在复杂科学知识工程化方面迈出了坚实一步,对推动演化生物学领域的人工智能应用具有重要示范意义。
当前挑战
构建History of Life数据集面临多重挑战。领域层面,生命演化知识体系庞大且高度交叉,涉及地质年代、生化机制与系统发生等复杂概念,现有通用问答系统难以精准检索与生成权威回答,亟需高质量、结构化的领域数据支撑。构建过程中,需从海量维基百科条目中区分出富含叙事性解释的学术文本,避免纯技术数据表、机器日志或无关元数据;同时妥善处理分类学命名、时间尺度等必要基线指标与嵌入性辅助表格,确保不因格式问题而错误拒收。此外,语义边界模糊的临界案例需优先保障文本连贯性,在海量数据中平衡覆盖广度与专业深度,对数据清洗的判定逻辑与效率构成严峻考验。
常用场景
经典使用场景
该数据集聚焦于生命演化与地球生物史的问答任务,涵盖从早期地球化学环境、生物起源假说,到宏演化分类辐射、灭绝事件等核心主题。经典使用场景包括微调对话式AI模型,使其能够围绕生物演化、古生物学和地质年代学等深时领域展开连贯对话。研究人员可利用55000组高质量问答对训练模型,使其具备从细胞起源到灵长类进化的跨尺度知识理解能力。该数据集尤其适用于检索增强生成(RAG)系统的构建,通过将结构化知识嵌入大语言模型,提升对专业概念和时空线索的精准回答表现。
解决学术问题
该数据集解决了学术研究中长期存在的领域知识与通用语言模型结合不足的问题,特别是在地球历史与演化生物学的交叉领域。传统问答数据集多聚焦于日常生活或通用百科,而缺乏对复杂科学叙事和时序因果关系的深度学习支持。该数据集通过严格的策展标准,筛选出纯净、描述性强的百科文本,构建起从微生物到宏生物的完整知识图谱,推动了模型在生物地层学时序推理、灭绝模式识别、适应性辐射机制解释等方面的表现。它为演化生物学的数字化教学和自动化知识服务提供了坚实的基准资源。
实际应用
在实际应用层面,该数据集可被集成到科学教育平台的智能助手中,帮助学生或研究者通过自然语言交互深入了解地球生命的宏大叙事。例如,构建面向博物馆、科研机构或在线课程的问答系统,用户可询问‘寒武纪生命大爆发的驱动因素’或‘鸟类与恐龙的关系’等问题,模型能基于数据集的系统化知识生成准确回答。此外,该数据集也可赋能科普内容的自动生成,帮助媒体或教育工作者快速获取结构化的演化史要点,从而提升科学传播的效率和深度。
数据集最近研究
最新研究方向
该数据集聚焦于生命演化与生物地质历史这一前沿交叉领域,通过构建包含五万五千条高质量问答对的专门语料库,为检索增强生成与领域问答系统提供了稀缺的评估与训练资源。当前,生命起源与演化机制的研究正处于多学科融合的爆发期,从早期地球化学环境重塑到真核细胞起源的分子证据,从寒武纪大爆发到五次生物大灭绝的生态重建,均亟需结构化、专家筛选的领域知识注入。该数据集严格基于维基百科中经人工判定的深度节点文章,通过精细化的质量控制流程剔除非叙事性技术文档与偶然提及的噪音,确保了语料的学术严谨性和主题连贯性。这一资源的发布将有力推动预训练语言模型在古生物学、进化生物学和地质年代学领域的语义理解与推理能力,为理解生命长河中的关键转折事件提供了可复现、可扩展的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务