five

FanChen0116/bus_few4_40x_empty

收藏
Hugging Face2023-09-26 更新2024-03-04 收录
下载链接:
https://hf-mirror.com/datasets/FanChen0116/bus_few4_40x_empty
下载链接
链接失效反馈
官方服务:
资源简介:
--- dataset_info: features: - name: id dtype: int64 - name: tokens sequence: string - name: labels sequence: class_label: names: '0': O '1': I-from_location '2': B-from_location '3': B-leaving_date '4': I-leaving_date '5': I-to_location '6': B-to_location - name: request_slot sequence: string splits: - name: train num_bytes: 485547 num_examples: 2800 - name: validation num_bytes: 6128 num_examples: 35 - name: test num_bytes: 70618 num_examples: 377 download_size: 0 dataset_size: 562293 --- # Dataset Card for "bus_few4_40x_empty" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征: - 名称:id,数据类型:int64(64位整数) - 名称:tokens,类型:字符串序列 - 名称:labels,类型为序列,其类别标签(class_label)的名称映射如下: '0':O '1':I-from_location '2':B-from_location '3':B-leaving_date '4':I-leaving_date '5':I-to_location '6':B-to_location - 名称:request_slot,类型:字符串序列 数据集划分: - 训练集(train):字节数485547,样本数量2800 - 验证集(validation):字节数6128,样本数量35 - 测试集(test):字节数70618,样本数量377 下载大小:0 数据集总大小:562293 # “bus_few4_40x_empty”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
提供机构:
FanChen0116
原始信息汇总

数据集概述

数据集信息

  • 特征列表:
    • id: 数据类型为 int64
    • tokens: 序列类型,数据类型为 string
    • labels: 序列类型,包含以下类别标签:
      • 0: O
      • 1: I-from_location
      • 2: B-from_location
      • 3: B-leaving_date
      • 4: I-leaving_date
      • 5: I-to_location
      • 6: B-to_location
    • request_slot: 序列类型,数据类型为 string

数据集划分

  • 训练集:
    • 字节数: 485547
    • 样本数: 2800
  • 验证集:
    • 字节数: 6128
    • 样本数: 35
  • 测试集:
    • 字节数: 70618
    • 样本数: 377

数据集大小

  • 下载大小: 0
  • 数据集大小: 562293
搜集汇总
数据集介绍
main_image_url
构建方式
在自然语言处理与信息抽取领域,面向特定领域的命名实体识别任务常受限于标注数据的稀缺性。该数据集基于少样本学习范式构建,聚焦于公交出行场景下的槽位填充任务。其标注体系涵盖了出发地、目的地及出发日期三类关键实体,采用BIO标注策略对实体边界进行精细界定。数据划分上,训练集包含2800条样本,验证集与测试集分别配置35条和377条样本,形成了标准的少样本学习数据分布格局。
特点
该数据集最显著的特征在于其针对公交领域特定场景的深度适配。通过引入'request_slot'字段记录用户查询中的完整槽位序列,实现了对多轮对话中信息缺口的系统性标注。标签体系采用六类细粒度实体标签,包括出发地(B/I-from_location)、目的地(B/I-to_location)和出发日期(B/I-leaving_date)的起止位置标注,为复杂嵌套实体的识别提供了精准的标注粒度。
使用方法
数据集以HuggingFace Datasets库的标准格式存储,可直接通过load_dataset接口加载使用。推荐采用基于Transformer的预训练语言模型进行微调,在训练过程中需重点关注少样本场景下的过拟合问题。评估阶段可结合精确率、召回率与F1值对模型在公交领域槽位填充任务上的表现进行综合度量,特别应关注稀有实体的识别效果。
背景与挑战
背景概述
在自然语言处理与信息抽取领域,针对特定垂直场景的命名实体识别(NER)任务一直是研究热点,尤其在城市公共交通调度与出行规划等实际应用中,精准提取出发地、目的地及出发时间等关键信息对智能系统构建至关重要。FanChen0116/bus_few4_40x_empty 数据集由相关研究团队创建,聚焦于公交出行场景下的实体抽取任务,其核心研究问题在于如何在小样本与数据稀疏条件下,实现从非结构化文本中高效识别诸如from_location、to_location和leaving_date等实体的能力。该数据集包含约3200条样本,划分为训练集、验证集和测试集,为少样本学习与实体识别技术的交叉研究提供了标准化基准,对推动领域内模型在资源受限环境下的泛化性能评估具有显著影响力。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:公交出行文本中的实体边界模糊且依赖上下文,例如地点名称常包含缩写或口语化表达,而日期格式多样,使得传统序列标注模型难以精准捕捉。构建过程中,数据稀疏性成为主要障碍,少样本场景下(训练集仅2800条)导致模型容易过拟合或偏向高频模式,同时空实体(empty)样本的存在加剧了类别不平衡问题。此外,实体标签结构包含BIO标注体系,且需区分出发地与目的地的对称关系,这要求模型具备更强的语义理解能力,而现有预训练语言模型在公共交通领域词汇上的领域适应性不足,进一步提升了特征提取的难度。
常用场景
经典使用场景
在自然语言处理领域,命名实体识别与槽位填充是构建任务型对话系统的核心任务。bus_few4_40x_empty数据集专为少样本学习场景设计,聚焦于公交出行领域的实体抽取,涵盖出发地、目的地和出发日期等关键信息。其经典使用场景是训练模型在仅有少量标注样本的情况下,准确识别文本中的实体边界与类别,尤其适用于资源受限的垂直领域,为少样本NER研究提供了标准化的评测基准。
解决学术问题
该数据集有效解决了少样本命名实体识别中常见的数据稀疏与领域迁移难题。在学术研究中,它支持探索基于预训练语言模型的微调策略、原型网络或提示学习等方法,以提升模型在低资源条件下的泛化能力。其意义在于推动了面向特定领域(如公共交通)的实体抽取研究,为跨领域迁移学习和零样本学习提供了可复现的评估平台,促进了学术社区对少样本NER理论与算法的深入验证。
衍生相关工作
基于该数据集,衍生出多项经典研究工作,包括少样本NER中基于对比学习的表示增强方法、融合外部知识图谱的实体边界检测模型,以及面向跨领域迁移的元学习框架。这些工作通常以bus_few4_40x_empty作为基准数据集,验证其提出的算法在低资源设定下的有效性,进而推动了少样本NER领域从通用领域向垂直行业的应用拓展,并为后续研究提供了可比较的基线结果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务