遇见数据集

toricgt-curated-splits

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

ToricGT Curated Graph Reasoning Splits 是一个为 ToricGT 项目精选的数据集,专门设计用于图推理任务。该数据集包含从 Sefaria 和 UniMorph 来源收集的希伯来语/犹太文本记录以及英语文本,以 Parquet 文件格式提供,包括训练集、验证集和测试集的分割文件,以及元数据文件如 manifest.json 和 split_report.json。数据集总规模为 5,790,736 行,其中训练集 4,633,582 行、验证集 578,319 行、测试集 578,835 行。希伯来语文本部分保留了上游的元音点标注(niqqud),其中带点希伯来语行 2,868 行,无点上游希伯来语行 3,561,888 行;用户可通过 quality_flags_json 中的 has_hebrew_without_niqqud 标志过滤无点文本。该数据集适用于文本生成和图机器学习任务,但需注意其为混合来源的研究数据集,使用时需保留归属列并审查上游许可证,特别是 GPL 许可和共享类似条款的源应在下游发布时单独处理。

ToricGT Curated Graph Reasoning Splits is a curated dataset for the ToricGT project, specifically designed for graph reasoning tasks. It includes Hebrew/Jewish text records collected from Sefaria and UniMorph sources, along with English text, provided in Parquet file format with splits for training, validation, and test sets, as well as metadata files such as manifest.json and split_report.json. The total dataset size is 5,790,736 rows, comprising 4,633,582 rows for training, 578,319 rows for validation, and 578,835 rows for testing. The Hebrew text portion retains upstream vowel point annotations (niqqud), with 2,886 rows of pointed Hebrew and 3,561,888 rows of unpointed upstream Hebrew; users can filter unpointed text via the has_hebrew_without_niqqud flag in quality_flags_json. This dataset is suitable for text generation and graph machine learning tasks, but note that it is a mixed-source research dataset, requiring attribution columns to be retained and upstream licenses reviewed, particularly for GPL-licensed or similarly shared sources that should be handled separately in downstream releases.

创建时间:
2026-05-26
原始信息汇总

数据集概述:ToricGT Curated Graph Reasoning Splits

数据集名称:ToricGT Curated Graph Reasoning Splits
来源仓库:AmelieSchreiber/toricgt-curated-splits

任务类型

  • 文本生成(text-generation)
  • 图机器学习(graph-ml)

语言

  • 英语(en)
  • 希伯来语(he)

数据集构成与规模

  • 总行数:5,790,736
  • 训练集:4,633,582 行
  • 验证集:578,319 行
  • 测试集:578,835 行

文件内容

包含以下文件(均为本地生成的 Parquet 文件和元数据):

  • train.parquet
  • validation.parquet
  • test.parquet
  • all.parquet(若使用了 --include-all 参数)
  • manifest.json
  • split_report.json
  • split_report.md
  • niqqud_report.json

每条记录保留来源数据集、许可信息、数据划分、哈希值及图 JSON 字段,以便审计。

希伯来语元音点(Niqqud)处理策略

  • 希伯来语/犹太教文本来源:Sefaria 和 UniMorph Hebrew 源。
  • 上游数据中已有的元音点被保留,但默认不会为未加元音点的文本合成元音。
  • 希伯来语行数:3,564,756
    • 带元音点的希伯来语行:2,868
    • 不带元音点的上游希伯来语行:3,561,888
  • 严格需要带元音点的任务,应在 quality_flags_json 中过滤掉 has_hebrew_without_niqqud=true 的行。

许可说明

  • 许可证类型:其他(other)
  • 本数据集为多源研究数据集,使用时应保留归因列,并在模型分发前审阅上游许可证。
  • GPL 许可证或类似“相同方式共享”许可的来源数据,在涉及下游分发条款时应单独处理。
搜集汇总
数据集介绍
toricgt-curated-splits 数据集图片
构建方式
ToricGT Curated Graph Reasoning Splits数据集基于对上游多源数据的精细化筛选与重组而构建。其原始数据涵盖来自Sefaria与UniMorph的希伯来语及犹太文本语料,以及英文通用语料。通过系统化的数据清洗与分割策略,研究者将原始记录按预设比例划分为训练集(463万条)、验证集(57.8万条)与测试集(57.8万条),并以Parquet格式存储。每条记录均保留来源数据集、许可证信息、分割标签、哈希值及图结构JSON字段,形成可审计的数据链条。构建过程不合成或改变原始文本中的元音标注(如希伯来语的尼库德符号),仅对未标注文本进行标记以供后续过滤或验证性恢复。
特点
该数据集的核心特色在于其对多语言与多源数据的混合性支持,以及高度透明的质量标注体系。除英文数据外,涵盖超过356万条希伯来语记录,其中仅2868条包含尼库德符号,其余未标注文本通过布尔型字段“has_hebrew_without_niqqud”加以标识,便于下游任务按需筛选。数据集附带详尽的分割报告、清单文件及质量标注JSON,确保每一行的来源与合规性可追溯。这种设计尤其适用于专注于图结构推理、跨语言语义理解及信源溯源的机器学习研究场景。
使用方法
使用者可通过Hugging Face Datasets库或直接读取Parquet文件加载数据。典型流程包括:下载train/validation/test分片文件,利用pandas或Dask解析图结构JSON字段以构建图神经网络输入,并根据“quality_flags_json”中的标志位(如尼库德缺失标记)执行条件过滤。对于涉及GPL或共享许可证的源数据,需在模型发布前单独审核上游许可条款。推荐使用分布式处理框架以高效处理近580万条数据记录,并可通过复现本地生成脚本验证分割的一致性。
背景与挑战
背景概述
图结构数据在自然语言处理与图机器学习交叉领域的重要性日益凸显,促使研究者致力于构建兼顾语义丰富性与结构化推理能力的基准数据集。ToricGT Curated Graph Reasoning Splits数据集由AmelieSchreiber等研究者创建,旨在为图推理任务提供经过精细清洗与分割的多源文本-图对齐资源。该数据集整合了来自Sefaria和UniMorph希伯来语源的语料,总计超过579万条记录,其中训练集、验证集与测试集分别包含463万、57.8万与57.8万条数据。通过保留源数据集的许可信息、哈希值与图JSON字段,该数据集为审计与可复现研究奠定了坚实基础,尤其适用于涉及希伯来语文本与图结构协同推理的跨语言任务,推动了对语义标注与图结构对齐难题的深入探索。
当前挑战
当前数据集面临的核心挑战包括:1) 领域问题层面,图推理任务要求模型在理解文本语义的同时捕捉实体间的复杂连接关系,而现有模型在处理希伯来语等形态丰富语言时易因元音缺失或拼写变体导致推理偏差,数据集需通过希伯来语元音标记策略(如区分有点文本与无点文本)来缓解这一瓶颈。2) 构建过程中,多源数据整合面临许可兼容性难题(如GPL及类似共享许可的单独处理)、大规模数据清洗中需平衡元音保留与过滤策略,以及确保图结构字段的准确性与一致性。此外,无点希伯来语文本占希伯来语总量的99.9%,如何在不引入虚假语言特征的前提下进行可靠标注,仍是制约数据集质量提升的关键技术挑战。
常用场景
经典使用场景
ToricGT Curated Graph Reasoning Splits 数据集是专为图推理与文本生成联合任务设计的高质量语料库,融合了结构化图数据与自然语言文本。其经典使用场景在于评估和训练模型在异构数据上的推理能力,特别是需要同时理解图拓扑结构与语义信息的任务,例如基于图结构的问答、关系推理以及多模态知识图谱补全。通过提供精心划分的训练、验证和测试集,该数据集为图神经网络与语言模型的联合学习提供了可靠基准,成为研究图文本跨模态推理的首选资源。
实际应用
在实际应用中,ToricGT Curated Graph Reasoning Splits 可用于构建智能问答系统、知识图谱驱动的对话代理以及结构化文档理解工具。例如,在法律文书分析中,模型可借助图结构识别条款间的逻辑关系;在医疗领域,可结合患者病历图与临床文本辅助诊断推理。该数据集支持的图文本联合推理能力,还可应用于金融风控中的关系网络挖掘与供应链知识图谱分析,显著提升复杂场景下的信息抽取与决策支持效率。
衍生相关工作
该数据集衍生了一系列经典工作,包括图增强的语言模型微调框架、图文本联合预训练方法以及基于图结构的多任务学习范式。研究者利用其分割版本提出了图-文本注意力融合机制、图神经符号推理系统以及跨语言图推理适应算法。此外,该数据集启发了对希伯来语尼库德标注与图结构结合的研究,催生了低资源语言图推理基准和去偏图文本生成模型。这些工作共同推动了图机器学习与自然语言处理的交叉领域发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务