遇见数据集

Pravallika6/hit_dataset_grouped

收藏
Hugging Face2026-03-24 更新2026-03-29 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: train.parquet - split: validation path: val.parquet - split: test path: test.parquet --- # HiT Grouped Dataset Grouped (child, parents, negatives) training data for cone-loss HiT training. ## Columns - `child` — question or trigger observation text - `parent_1 parent_2 parent_3` — all true parent texts (padded by repeating last if fewer than 3) - `negative_1 negative_2 negative_3 negative_4 negative_5 negative_6 negative_7 negative_8` — sampled negative texts from same-depth pool ## Structure Built from the full alternating hierarchy: ``` depth 0 explanations depth 0.5 questions depth 1 explanations (trigger observations for depth-0.5 questions) depth 1.5 questions depth 2 explanations depth 2.5 questions depth 3 explanations ``` Two edge types per row: - **answer edges**: child=question, parents=explanations at depth n - **trigger edges**: child=explanation, parents=questions at depth n ## Usage ```python HierarchyTransformerLoss(n_parents=3, n_negatives=8) ```

配置项: - 配置名称:default 数据文件: - 划分集:训练集,路径:train.parquet - 划分集:验证集,路径:val.parquet - 划分集:测试集,路径:test.parquet # HiT 分组数据集 本数据集为用于锥损失HiT训练的(子项、父项、负样本)分组训练数据。 ## 字段说明 - `child`:问题或触发观测文本 - `parent_1`、`parent_2`、`parent_3`:所有真实父文本(若不足3项,则重复最后一项补齐至3项) - `negative_1`至`negative_8`:从同深度样本池采样得到的负样本文本 ## 数据集结构 本数据集基于完整交替层级构建,层级结构如下: 深度0 解释文本 深度0.5 问题文本 深度1 解释文本(作为深度0.5问题的触发观测文本) 深度1.5 问题文本 深度2 解释文本 深度2.5 问题文本 深度3 解释文本 每行包含两种边类型: - **回答边**:子项为问题,父项为深度n处的解释文本 - **触发边**:子项为解释文本,父项为深度n处的问题文本 ## 使用示例 python HierarchyTransformerLoss(n_parents=3, n_negatives=8)

提供机构:
Pravallika6
二维码
社区交流群
二维码
科研交流群
商业服务