遇见数据集

AmelieSchreiber/toricgt-curated-splits

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

ToricGT精选图推理分割数据集是一个用于图推理的精选工作数据集,专门为ToricGT项目设计。该数据集包含从Sefaria和UniMorph Hebrew来源获取的希伯来语/犹太文本记录,以Parquet文件格式提供训练、验证和测试分割,以及元数据文件如清单和报告。数据集总共有5,790,736行,其中训练集4,633,582行,验证集578,319行,测试集578,835行。希伯来语行保留了原始的点符(niqqud)信息,未加点符的文本被标记以便过滤或后续恢复。这是一个混合来源的研究数据集,使用时需保留属性列并检查上游许可证。

# ToricGT 精选图推理数据集划分 <p align="center"> <a href="./assets/toricgt_paper_pg_softmoe_final.tex"><img src="https://img.shields.io/badge/arXiv-94133F?style=for-the-badge&logo=arxiv" alt="arXiv"/></a> <a href="https://github.com/amelie-iska/ToricGT/"><img src="https://img.shields.io/badge/📝%20GitHub-007A87?style=for-the-badge&logoColor=grey" alt="GitHub"/></a> <a href="https://huggingface.co/blog/AmelieSchreiber/toricgt"><img src="https://img.shields.io/badge/HuggingFace-DE9B35.svg?style=for-the-badge&logo=HuggingFace" alt="HuggingFace"/></a> </p> --- 许可证:其他 任务类别: - 文本生成 - 图机器学习(Graph ML) 语言: - 英语 - 希伯来语 展示名称:ToricGT 精选图推理数据集划分 --- 本仓库为ToricGT的精选工作数据集仓库。 本次上传仅包含经精选的划分格式Parquet文件与本地生成的元数据,未上传原始上游数据源。每一行数据均保留源数据集、许可证、划分方式、哈希值与用于审计的图JSON字段。 希伯来语/犹太文本记录源自Sefaria与UniMorph希伯来语数据源。 ## 文件列表 - `train.parquet`:训练集文件 - `validation.parquet`:验证集文件 - `test.parquet`:测试集文件 - `all.parquet`:若使用`--include-all`参数则包含全量数据集文件 - `manifest.json`:清单文件 - `split_report.json`:划分报告文件 - `split_report.md`:划分说明文档 - `niqqud_report.json`:尼库德(Niqqud)标记报告文件 ## 划分统计 - 仓库地址:`AmelieSchreiber/toricgt-curated-splits` - 总数据行数:`5790736` - 训练集行数:`4633582` - 验证集行数:`578319` - 测试集行数:`578835` ## 希伯来语尼库德标记策略 源自希伯来语/犹太文本的行将保留原始数据源中的尼库德(Niqqud,希伯来语元音标记)标记(若存在)。默认情况下,本精选流程不会为无标记的源文本人工添加元音;无元音标记的希伯来语文本将被标记,以便后续过滤或经审核后恢复标记。 - 希伯来语数据行:`3564756` - 带尼库德标记的希伯来语数据行:`2868` - 原始无标记希伯来语数据行:`3561888` - 若需严格筛选带完整尼库德标记的希伯来语数据,请过滤`quality_flags_json`中`has_hebrew_without_niqqud=true`的行。 ## 许可证说明 本数据集为多源混合的研究数据集。在将模型用于再分发前,请保留原数据的署名列,并核查上游数据源的许可证条款。若下游发布存在条款约束,需单独处理采用GPL许可证及相同共享协议的数据源。

提供机构:
AmelieSchreiber
搜集汇总
数据集介绍
AmelieSchreiber/toricgt-curated-splits 数据集图片
构建方式
ToricGT Curated Graph Reasoning Splits数据集由AmelieSchreiber精心构建,旨在为图推理任务提供高质量的语料资源。该数据集通过本地生成的Parquet文件及元数据整理而成,原始上游下载内容并未直接上传,以确保数据溯源与合规性。每一行数据均保留了来源数据集、许可证、划分标识、哈希值及图结构JSON字段,便于审计与复现。其中,希伯来语/犹太文本数据源自Sefaria和UniMorph希伯来语资源,确保了文本的多样性与文化相关性。数据集还包含详细的拆分报告,包括train、validation、test及可选的all文件,使得数据划分透明且可重复。
特点
该数据集的核心特点在于其精心策划的划分策略与严格的元数据管理。总计5,790,736条记录中,训练集占4,633,582条,验证集与测试集分别包含578,319条和578,835条,划分比例均衡以支持稳健的模型评估。希伯来语记录多达3,564,756条,其中仅2,868条含有尼库德(元音标记),其余未标元音的文本被标记以便筛选或后续恢复,体现了对语言特性的尊重与灵活性。每条数据都附有质量标志字段(quality_flags_json),允许用户轻松过滤无尼库德的希伯来文本,从而满足不同研究需求。
使用方法
该数据集可通过Hugging Face仓库直接访问,用户需下载Parquet文件(train.parquet、validation.parquet、test.parquet等)以进行训练、验证或测试。在使用时,建议优先检查manifest.json和split_report.json文件,以了解数据分布与版本信息。对于希伯来语任务,用户可根据has_hebrew_without_niqqud标志在quality_flags_json中过滤,确保仅使用带尼库德的文本用于严格应用。此外,由于数据集来源混合,包含GPL等不同许可证,用户应在模型重新分发前审查上游许可条款,确保合规性。数据以图JSON格式存储,可直接用于图神经网络或图推理模型输入。
背景与挑战
背景概述
ToricGT Curated Graph Reasoning Splits数据集由研究者Amelie Schreiber创建,依托于ToricGT项目,旨在为图推理任务提供高质量、可审计的文本与图结构数据。该数据集发布于HuggingFace平台,整合了来自Sefaria和UniMorph希伯来语源的记录,聚焦于英语与希伯来语双语环境下的图机器学习与文本生成研究。其核心研究问题在于如何通过精心策划的数据划分,支持图神经网络在复杂语义推理场景中的训练与评估。该数据集包含近580万条记录,通过保留来源归属、许可证信息及图JSON字段,为可重复性研究奠定了基础,在自然语言处理与图学习交叉领域具有重要影响力。
当前挑战
该数据集面临的挑战主要来自两个方面:首先,在领域问题层面,图推理任务要求模型能够理解并操作结构化关系,而希伯来语文本中存在的元音符号缺失现象(356万行中仅2868行保留元音)导致语义歧义,增加了模型学习难度。其次,在构建过程中,数据来自GPL及共享许可等多源异构语料,需严格区分许可证条款以避免下游分发时的法律风险;同时,对558万行数据的质量标记(如无元音希伯来语)与审计哈希管理,要求高效的筛选与过滤机制,以保证训练集、验证集与测试集的一致性与可靠性。
常用场景
经典使用场景
ToricGT Curated Graph Reasoning Splits数据集专为图推理与文本生成的多模态学习任务而设计,其经典使用场景聚焦于大型语言模型在图结构数据上的推理能力评估与增强。研究者可借助该数据集的精心划分——涵盖约580万条记录,并细分为训练集、验证集与测试集——开展图引导的文本生成实验,例如基于图拓扑信息生成连贯的自然语言描述,或利用图结构约束提升语言模型的逻辑一致性。该数据集特别适用于联合建模图神经网络与预训练语言模型的场景,为探索图结构信息如何助力复杂推理任务提供了标准化的评测基准。
实际应用
在实际应用层面,ToricGT Curated Graph Reasoning Splits可赋能多个高价值领域。在知识图谱问答系统中,它可用于训练模型根据图结构检索的实体关系生成精确回答;在自动化报告生成场景中,例如从科学知识图谱中提取关键路径并转化为可读性强的阐述,该数据集能帮助模型维持信息流的因果链条。此外,该数据集在跨语言文本生成(如从希伯来语源头提取含尼库德标音的文字)和图约束的故事续写中展现出潜力,尤其适用于需要兼顾图拓扑约束与语言流畅度的工业级应用,如法律文档结构化摘要或生物医学文献的关系图解。
衍生相关工作
ToricGT作为精心策划的图推理分割,已衍生出若干奠定基础的研究工作。其配套论文《ToricGT》中提出的软混合专家架构(Soft MoE)与图提示学习策略,为多模态推理树立了新的方法论标杆。基于该数据集,研究者已开发出评估图条件文本生成的严格基准,推动了从朴素图神经网络到图增强Transformer的迭代。后续工作包括利用其尼库德策略开发希伯来语点标还原模型,以及基于其图字段设计的图-语言联合预训练目标函数。这些衍生工作共同勾勒出一个方法开源、评测透明的图推理研究生态,不断激励学界探索图结构如何重塑大型语言模型的认知边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务