遇见数据集

Vrushali/MH

收藏
Hugging Face2023-08-13 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: 'Unnamed: 0' dtype: int64 - name: BlockName dtype: string - name: Category dtype: string - name: Year dtype: int64 - name: Month dtype: int64 - name: Day dtype: int64 - name: Crop dtype: string - name: DistrictName dtype: string - name: QueryType dtype: string - name: Season dtype: string - name: Sector dtype: string - name: StateName dtype: string - name: QueryText dtype: string - name: KccAns dtype: string splits: - name: train num_bytes: 744052465 num_examples: 3301127 download_size: 134594763 dataset_size: 744052465 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "MH" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 名称:未命名列(Unnamed: 0),数据类型:int64 - 名称:地块名称(BlockName),数据类型:字符串 - 名称:类别(Category),数据类型:字符串 - 名称:年份(Year),数据类型:int64 - 名称:月份(Month),数据类型:int64 - 名称:日期(Day),数据类型:int64 - 名称:作物(Crop),数据类型:字符串 - 名称:区县名称(DistrictName),数据类型:字符串 - 名称:查询类型(QueryType),数据类型:字符串 - 名称:种植季(Season),数据类型:字符串 - 名称:部门(Sector),数据类型:字符串 - 名称:省份名称(StateName),数据类型:字符串 - 名称:查询文本(QueryText),数据类型:字符串 - 名称:农业咨询回复(KccAns),数据类型:字符串 数据集划分: - 名称:训练集(train),字节占用量:744052465,样本数量:3301127 下载大小:134594763 数据集存储大小:744052465 配置项: - 配置名称:默认配置(default),数据文件: - 划分:训练集,路径:data/train-* # 「MH」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
Vrushali
原始信息汇总

数据集概述

数据特征

  • Unnamed: 0: 数据类型为 int64
  • BlockName: 数据类型为 string
  • Category: 数据类型为 string
  • Year: 数据类型为 int64
  • Month: 数据类型为 int64
  • Day: 数据类型为 int64
  • Crop: 数据类型为 string
  • DistrictName: 数据类型为 string
  • QueryType: 数据类型为 string
  • Season: 数据类型为 string
  • Sector: 数据类型为 string
  • StateName: 数据类型为 string
  • QueryText: 数据类型为 string
  • KccAns: 数据类型为 string

数据分割

  • train: 包含 3301127 条数据,占用 744052465 字节

数据集大小

  • 下载大小: 134594763 字节
  • 数据集大小: 744052465 字节

配置

  • config_name: default
  • data_files:
    • split: train
    • path: data/train-*
搜集汇总
数据集介绍
Vrushali/MH 数据集图片
构建方式
在农业信息化与智能问答系统快速发展的背景下,Vrushali/MH数据集应运而生。该数据集通过采集印度马哈拉施特拉邦农业领域的真实用户查询与专家应答记录构建而成,涵盖了BlockName、DistrictName、StateName等地理层级信息,以及Crop、Season、Sector、QueryType等农业核心要素。每条数据包含完整的QueryText(用户提问)与KccAns(专家回答)字段,时间戳信息精确至年月日,确保了数据的时间维度完整性。数据集以train单一分割形式提供,包含超过330万条样本,存储于Parquet格式文件中,便于高效加载与处理。
特点
Vrushali/MH数据集的核心特色在于其大规模、多维度与领域专精性。超过330万条问答对构成了农业知识图谱的坚实基础,覆盖了作物、季节、行业类别等多重标签体系,使得数据可支撑细粒度的分类与检索任务。地理信息的层级化设计(从State到Block)为区域适应性分析提供了可能。此外,每个问答对均附有明确的QueryType(查询类型),有助于理解用户意图的分布规律。数据集的规模与结构化程度,使其成为训练农业领域对话系统与信息抽取模型的理想资源。
使用方法
该数据集适用于多种自然语言处理与农业信息学任务。研究者可直接加载train分割数据,利用QueryText与KccAns字段构建序列到序列的问答模型,或基于Category、Crop等标签开展多标签分类实验。对于地理信息建模,可结合BlockName与DistrictName进行区域级别的内容分析。数据加载建议使用HuggingFace Datasets库,通过指定配置名default并读取data/train-*路径下的文件即可完成。鉴于数据规模较大,推荐采用流式加载或分批次处理策略,以优化内存使用与训练效率。
背景与挑战
背景概述
在农业信息化与智能问答系统快速发展的背景下,Vrushali/MH数据集应运而生,旨在为印度马哈拉施特拉邦的农业领域提供结构化的问答数据支持。该数据集由研究者Vrushali等人于近期创建,聚焦于农民通过Kisan Call Center(KCC)平台提出的农业相关查询及其官方回答。核心研究问题在于如何利用大规模、多维度标注的农业对话数据,推动面向印度本土农业的智能问答模型与知识图谱构建。数据集包含超过330万条训练样本,涵盖作物、地区、季节、查询类型等丰富字段,为农业自然语言处理研究提供了宝贵的基准资源,有望显著提升该领域在低资源语言环境下的模型泛化能力与实用性。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,农业问答系统需应对多方言混合、专业术语歧义及地域性农事差异带来的语义理解困难,同时QueryText与KccAns之间的语义对齐也因口语化表达而充满不确定性。在构建过程中,数据清洗与标注一致性是核心难题,原始KCC记录可能存在噪声、缺失值或非结构化表述,需在保持领域知识完整性的前提下进行标准化处理;此外,超过330万条样本的规模对存储与处理效率提出了较高要求,如何平衡数据质量与可用性成为持续挑战。
常用场景
经典使用场景
在农业信息化与智能问答系统交叉研究的广阔天地中,Vrushali/MH数据集以其丰富的农业领域对话数据,成为训练和评估面向印度马哈拉施特拉邦农民的多语言问答模型的核心资源。该数据集汇聚了超过330万条真实农户查询与专家解答记录,覆盖作物种类、种植季节、病虫害防治、政府补贴政策等多元维度,为构建能够理解地方性农业术语、适应区域方言特征的智能客服系统提供了坚实的训练基础。研究者常利用此数据集微调基于Transformer的预训练语言模型,以提升模型在低资源农业场景下的语义理解与生成能力。
解决学术问题
该数据集精准回应了农业知识服务中因信息不对称导致的资源错配这一核心学术难题。传统上,印度农村地区农民获取专业农技指导的渠道有限,且知识传递存在严重的语言与地域壁垒。Vrushali/MH通过系统化整理长达数年的电话咨询记录,首次提供了大规模、结构化、多标签的农业问答语料,使学者得以深入探究农民信息需求的时空分布规律、查询意图的分类体系以及专家回答的知识框架。它推动了信息检索、自然语言处理与农业科学的交叉研究,为开发可泛化的农业知识图谱构建方法、跨语言迁移学习策略以及因果推理在问答系统中的应用奠定了数据基石。
衍生相关工作
围绕Vrushali/MH数据集,学术界已衍生出多项具有里程碑意义的研究工作。例如,有学者基于该数据提出了一种融合作物周期知识的图神经网络模型,显著提升了长尾查询的答案召回率;另有工作探索了利用对比学习框架对齐印地语与马拉地语查询的语义表征,实现了跨语言的零样本迁移。在经典文献中,该数据集常被用作农业领域命名实体识别任务的基准,催生了专门针对印度作物名称、病害术语的标注规范与评估指标。此外,基于该数据的对话状态追踪研究为构建多轮农业咨询系统提供了新范式,推动了从单轮问答向上下文感知对话的学术演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务