遇见数据集

WenyangHui/Conic10K

收藏
Hugging Face2023-10-24 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是一个中文问答数据集,包含训练、验证和测试三个分割。数据集的特征包括文本、答案表达式、事实表达式、查询表达式、事实跨度、查询跨度和过程等字段。数据集的任务类别是问答,标签包括数学和语义解析,数据集规模在10K到100K之间。

This is a Chinese question answering dataset that contains three splits: training, validation, and test. The dataset comprises multiple fields including text, answer expression, fact expression, query expression, fact span, query span, and process. The task category of this dataset is question answering, with its labels covering mathematics and semantic parsing, and the scale of the dataset ranges from 10K to 100K samples.

提供机构:
WenyangHui
原始信息汇总

数据集概述

许可证

  • MIT许可证

配置

  • 默认配置
    • 数据文件路径
      • 训练集: data/train-*
      • 验证集: data/validation-*
      • 测试集: data/test-*

数据集信息

特征

  • 文本: string
  • 答案表达式: string
  • 事实表达式: string
  • 查询表达式: string
  • 事实跨度: string
  • 查询跨度: string
  • 处理过程: string

分割

  • 训练集
    • 字节数: 6012696
    • 样本数: 7757
  • 验证集
    • 字节数: 796897
    • 样本数: 1035
  • 测试集
    • 字节数: 1630198
    • 样本数: 2069

大小

  • 下载大小: 3563693 字节
  • 数据集大小: 8439791 字节

任务类别

  • 问答

语言

  • 中文

标签

  • 数学
  • 语义解析

大小类别

  • 10K<n<100K
搜集汇总
数据集介绍
WenyangHui/Conic10K 数据集图片
构建方式
Conic10K数据集由WenyangHui团队精心构建,专为中文数学语义解析与问答任务设计。其构建过程基于对圆锥曲线领域知识的深度挖掘,通过系统化采集数学问题、答案表达式以及相关事实与查询语句,形成多维度结构化数据。数据集包含7757条训练样本、1035条验证样本和2069条测试样本,总计超过一万条实例,覆盖从基础到复杂的问题类型。每个样本均包含文本描述、答案表达式、事实表达式、查询表达式及其对应的跨度信息,并附有完整的推导过程,确保了数据在语义解析任务中的全面性与可复用性。
特点
该数据集的核心特色在于其中文数学语义解析的专精性与结构化表达。每条数据不仅包含自然语言问题,还提供了形式化的答案表达式、事实表达式和查询表达式,以及对应的跨度标注,这使得模型能够学习从文本到符号表示的映射关系。此外,数据集中整合了推导过程字段,为可解释性研究提供了宝贵资源。其规模适中(10K至100K),兼顾了训练效率与多样性,特别适合作为中文数学问答与语义解析领域的基准数据集。
使用方法
使用Conic10K数据集时,研究者可借助HuggingFace Datasets库便捷加载,通过指定配置名称'default'及所需数据划分(train、validation或test)即可获取相应子集。数据以标准格式存储,支持直接用于序列到序列模型或语义解析框架的训练与评估。建议将文本字段作为输入,答案表达式或查询表达式作为目标输出,以开展数学问题理解与形式化推理任务。同时,跨度信息和推导过程可用于增强模型的注意力机制或中间推理步骤的学习。
背景与挑战
背景概述
在自然语言处理与数学推理交叉领域,语义解析技术致力于将自然语言问题转化为可执行的逻辑表达式,而数学应用题自动求解的复杂性长期困扰着研究者。WenyangHui/Conic10K数据集由研究团队于近年发布,聚焦于中文圆锥曲线几何问题的语义解析与推理,旨在推动数学问题理解与自动解答的发展。该数据集包含约1万条样本,涵盖圆锥曲线相关的几何描述、事实表达式、查询表达式及推理过程,为评估模型在数学语义解析和结构化推理方面的能力提供了标准化基准。其发布填补了中文数学几何领域语义解析数据集的空白,对教育智能化、自动解题系统及数学知识图谱构建具有重要推动意义。
当前挑战
当前数据集面临的核心挑战涵盖领域问题解决与构建过程两大层面。在领域层面,数学应用题尤其是圆锥曲线问题涉及空间几何关系建模、数值计算与逻辑推理的深度融合,模型需同时理解自然语言描述中的几何概念、符号化表达式及变量约束,这对语义解析器的泛化能力和符号推理精度提出极高要求。在构建过程中,如何确保数据标注的语义一致性(如事实表达式与查询表达式的对齐)以及推理路径的完备性是一大难题,同时需要平衡样本多样性(如不同圆锥曲线类型、问题复杂度)与标注成本,避免因数据偏差导致模型过拟合特定模式。此外,中文数学表达中术语歧义、省略结构及隐含条件的存在,进一步增加了数据清洗与标准化处理的复杂度。
常用场景
经典使用场景
Conic10K数据集专为中文数学语义解析与问答任务而构建,其核心价值在于将自然语言描述的数学问题转化为结构化的逻辑表达式。该数据集包含超过一万条样本,每条样本涵盖文本、答案表达式、事实表达式及查询表达式等丰富字段,支持从简单算术到复杂几何推理的多种数学场景。研究者可借助该数据集训练模型,实现从自然语言到形式化数学语言的精准映射,为智能教育系统中的自动解题与知识推理奠定基础。
解决学术问题
该数据集有效解决了中文数学问答领域缺乏大规模、高质量标注数据的难题,特别是针对语义解析中的多步推理与表达式生成挑战。通过提供事实跨度与查询跨度标注,它促进了模型对数学问题中关键实体与逻辑关系的理解,推动了可解释性问答系统的发展。其公开的标准化划分(训练、验证、测试集)为学术研究提供了可靠的基准,助力对比不同方法在数学语义解析任务上的性能,显著提升了该领域的可复现性与研究效率。
衍生相关工作
基于Conic10K,研究者已衍生出多项经典工作,包括面向中文数学问题的语义解析器设计、基于预训练语言模型的数学推理增强方法,以及结合图神经网络的表达式生成框架。这些工作不仅验证了数据集在提升模型数学理解能力方面的有效性,还拓展了其在跨语言迁移学习中的应用。此外,该数据集促进了中文数学语料库的构建标准制定,为后续开发更大规模、更多元化的数学问答数据集提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务