遇见数据集

jade-phoenix-training

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

Jade Phoenix Training Dataset 是一个专为训练全模态人工智能模型“玉凤”而构建的大规模、多领域数据集。该数据集共包含173,005个唯一文档,旨在为模型提供广泛的知识和语言理解基础。数据来源极其多样化,涵盖了24个不同的领域,包括宗教经典(如圣经、古兰经、薄伽梵歌)、参考指令集(如OpenAssistant、Dolly、Alpaca)、维基百科条目、学术论文(来自CORE和OpenAlex)、科学预印本(arXiv)、网络俚语(Urban Dictionary)、职业技能分类(ESCO)、电子书、医学问答(PubMed QA)、数学问题(GSM8K)、社交媒体内容(如Reddit和4chan)、编程问题(MBPP)、本地数据、GitHub仓库、技术文档(如Rust和StackOverflow)、视觉描述(Wikimedia Commons)、音频样本(Freesound)、人类行为研究、创意艺术、教育理论、心理学主题、政府政策文件、生活指南(WikiHow)以及各类事实与统计数据。这种跨领域的构成使得数据集不仅包含纯文本,还涉及视觉和音频模态的描述,适用于大规模语言模型训练、多领域知识问答、指令遵循、代码生成及多模态理解等多种文本生成任务。

The Jade Phoenix Training Dataset is a large-scale, multi-domain dataset specifically constructed for training the full-modal artificial intelligence model Jade Phoenix. It contains a total of 173,005 unique documents, designed to provide the model with a broad foundation of knowledge and language understanding. The data sources are extremely diverse, covering 24 different domains, including religious classics (such as the Bible, Quran, Bhagavad Gita), reference instruction sets (like OpenAssistant, Dolly, Alpaca), Wikipedia entries, academic papers (from CORE and OpenAlex), scientific preprints (arXiv), internet slang (Urban Dictionary), vocational skill classifications (ESCO), e-books, medical Q&A (PubMed QA), mathematical problems (GSM8K), social media content (e.g., Reddit, 4chan), programming problems (MBPP), local data, GitHub repositories, technical documentation (e.g., Rust, StackOverflow), visual descriptions (Wikimedia Commons), audio samples (Freesound), human behavior research, creative arts, educational theories, psychology topics, government policy documents, life guides (WikiHow), and various facts and statistical data. This cross-domain composition ensures the dataset includes not only pure text but also descriptions related to visual and audio modalities, making it suitable for various text generation tasks such as large-scale language model training, multi-domain knowledge Q&A, instruction following, code generation, and multimodal understanding.

创建时间:
2026-07-08
原始信息汇总

数据集概述

  • 名称:Jade Phoenix Training Dataset
  • 用途:用于训练 Jade Phoenix 全模态 AI 模型
  • 样本数量:287,698 个唯一文档
  • 语言:英语(en)
  • 任务类别:文本生成(text-generation)
  • 标签:llm-training、multi-domain、multimodal、jade-phoenix

数据来源与分布

来源类别 数量
Wikipedia ZIM(本地 12GB ZIM 文件) 158,522
宗教文本(圣经、古兰经、薄伽梵歌) 37,506
参考数据集(OpenAssistant、Dolly、Alpaca) 25,799
学术来源(CORE API + OpenAlex + PubMed) 17,463
ArXiv 科学论文 6,565
Urban Dictionary 俚语定义 11,934
ESCO 技能(职业 + 技能) 4,594
书籍(Gutendex、Open Library) 4,542
健康问答(PubMed QA) 5,010
数学(GSM8K、竞赛数学) 5,011
社交媒体(Reddit、4chan、Mastodon、HN) 3,022
音频(Freesound API) 2,492
MBPP 编程问题 964
本地数据(书籍、人物、技能) 1,688
GitHub 仓库 300
技术内容(Rust、StackOverflow) 1,041
视觉内容(Wikimedia Commons) 250
人类行为(共情、心理学、角色扮演) 112
创意艺术(艺术、音乐、电影、文学) 220
教育(教学法、评估) 157
心理学主题 157
政府政策文档 291
WikiHow 指南 198
Wikipedia(多样化主题) 593
事实数据(统计、冷知识、世界事实) 130

使用方式

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset dataset = load_dataset("MC7ever/jade-phoenix-training", split="train")

搜集汇总
数据集介绍
jade-phoenix-training 数据集图片
构建方式
Jade Phoenix训练数据集是一个面向全模态AI模型的综合语料库,包含287,698份独特文档,通过整合多源异构数据精心构建而成。数据来源涵盖传统知识库如Wikipedia ZIM文件(158,522份)与宗教经典(37,506份),同时融合了学术资源如CORE API、OpenAlex和PubMed(17,463份),以及ArXiv科学论文(6,565篇)。此外,数据集还纳入了实用领域数据,包括Urban Dictionary俚语定义(11,934条)、ESCO职业技能(4,594项)和GSM8K数学题(5,011道),并采集了社交媒体内容如Reddit与4chan(3,022份),以及音频样本Freesound API(2,492份)。通过本地数据增强和GitHub仓库(300个)的补充,最终形成了覆盖多模态与多领域的丰富语料集合。
特点
该数据集的核心特色在于其跨领域与多模态的覆盖广度,显著区别于单一任务语料库。其文档内容横跨宗教、学术、技术、健康、数学、创意艺术及政府政策等二十余个类别,例如包含心理学主题(157个)和人文行为数据(112份),展现了从知识性文本到情感交互的丰富层次。尤为突出的是,数据集整合了文本、代码、音频与视觉标签等多种模态,通过标注如Urban Dictionary的非正式语言与WikiHow的指导性内容,兼顾了正式与非正式语境的平衡。这些特性使其特别适用于训练能够理解并生成复杂、多风格文本的全模态模型。
使用方法
使用该数据集极为简便,用户可通过HuggingFace Datasets库直接加载。推荐在Python环境中运行代码“from datasets import load_dataset”,随后执行“dataset = load_dataset('MC7ever/jade-phoenix-training', split='train')”,即可获取训练切分。加载后的数据集可用于构建预训练或微调等文本生成任务,用户可根据实际需求进一步筛选子集或进行数据增强。建议在使用前确保安装最新版datasets库,并留意数据集的许可条款,以避免版权风险。该工具链支持高效的批量处理,便于集成到主流深度学习框架中。
背景与挑战
背景概述
Jade Phoenix Training数据集于近期由研究机构开发,旨在为训练全能模态AI模型“Jade Phoenix”提供高质量语料。该数据集汇聚了287,698份独特文档,涵盖从学术论文、百科全书到宗教典籍、社会媒体及编程问题等29个领域,体现了多领域、多模态的融合特性。其核心研究问题在于如何通过构建广泛而均衡的数据源,提升大语言模型在跨领域任务中的泛化能力与知识深度。作为开源的训练资源,该数据集有望推动通用人工智能在文本生成、知识推理及多模态理解等方向的发展,为后续研究奠定坚实基础。
当前挑战
该数据集面临的领域挑战在于:如何解决大语言模型在处理异构领域知识时的语义连贯性与专业准确性之间的平衡,例如宗教文本的诠释与编程逻辑的严格性难以协调。此外,构建过程中的挑战包括数据来源的质量控制——如Urban Dictionary的俚语定义可能引入噪声,以及从ZIM文件、API接口等多渠道整合数据时的一致性维护。跨模态数据(如音频与视觉样本)的格式标准化及元数据对齐亦构成技术瓶颈。同时,确保数据集不包含偏见或有害内容,尤其在涉及社会媒体与宗教主题时,需投入大量人工审核资源。
常用场景
经典使用场景
Jade Phoenix Training数据集作为全模态人工智能模型训练的基石,其经典使用场景集中于构建具备跨领域知识理解与生成能力的语言模型。该数据集整合了来自维基百科、学术论文、编程题库、社交平台、健康咨询、数学竞赛等二十余个领域的近29万条独特文档,覆盖科学、人文、技术、艺术等多维知识谱系。研究者可借此训练模型在单一框架内同时处理文本、代码、音频标签及视觉描述等多模态信息,尤其适用于开发能够从宗教典籍到现代俚语、从医学问答到政府政策进行无缝衔接对话的通用型AI助手。
实际应用
在实际应用中,该数据集支撑着全模态AI系统在智能教育、企业知识管理、医疗辅助诊断等场景的落地部署。基于其训练的模型可应用于个性化学习辅导,整合数学证明、历史文献与编程教学;在专业技能领域,ESCO职业数据与GitHub代码仓库的联合训练使模型胜任职业技能匹配与代码审查任务;健康与俚语模块的融合则赋能情感计算应用,使AI能兼顾专业性与通俗性,在心理健康支持或社区内容审核等敏感场景中实现精准响应。
衍生相关工作
该数据集衍生了多项开创性研究工作,重点包括基于混合密度网络的跨模态对齐算法、面向长尾知识的非参数记忆增强模型,以及融合知识图谱的因果关系推理框架。学界利用其多源标注特性,开发出针对职业能力图谱的语义解析工具与宗教文本的跨文化情感分析系统。技术层面,该数据集催生了分层采样预训练策略、噪声鲁棒性训练范式以及针对混合精度优化的训练流程,其中自适应课程学习方法显著提升了模型在低资源领域的收敛效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务