遇见数据集

agri-slm-india-v1

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Agri-SLM India v1 是一个面向印度农业领域的英文预训练语料库,专为训练约3亿参数的小型语言模型(SLM)而设计。该数据集包含约556,765个文档,总计约3.45B个token(使用GPT-2分词器)。数据来源涵盖印度农业相关的多个渠道,包括ICAR国家论文库(krishikosh)约20.1万篇硕博论文、Kisan呼叫中心问答记录(kcc_kaggle)约14.5万条、PubMed Central印度农业论文全文(pubmed_pmc)约3.9万篇、OpenAlex研究论文摘要(openalex)约11万篇、Down To Earth调查报道(downtoearth)约1.9万篇、Krishijagran农业媒体(krishijagran)约1.6万篇、维基百科农业文章(wikipedia_agri)约1.7万篇、开放获取期刊全文(doaj)约886篇,以及来自ICAR、邦立大学、政府门户网站和新闻来源的更多数据。每个文档被标注为29个精细农业子类别中的一个或多个,并指定一个主要类别。这些类别包括:作物农艺学、土壤科学、水分与灌溉、肥料与作物营养、病虫害管理、作物病害与病理学、种子与作物育种、园艺学、畜牧与乳业、渔业与水产养殖、采后与储存、农业经济学与市场、政府计划与政策、气候与天气、有机与可持续农业、小米与粗粮、种植园与经济作物、林业与农林业、农业机械化与技术、农村生计与推广、杂草科学、蚕桑与养蜂、植物生理与生物化学、农业统计与生物计量、农业工程、食品科学与技术、微生物学与生物肥料、农业纳米技术、性别与农业/女性农民。数据集以Parquet格式存储,共124个分片,包含字段:文本(text)、来源(source)、领域(domain,固定为agriculture)、子领域(subdomain,即来源名称)、语言(language,固定为en)、词数(word_count)、类别列表(categories)、主要类别(primary_category)。该数据集适用于文本生成、语言建模等任务,尤其是针对印度农业领域的知识增强预训练。

Agri-SLM India v1 is an English pre-training corpus tailored for the Indian agricultural domain, specifically designed for training small language models (SLM) with approximately 300 million parameters. This dataset contains roughly 556,765 documents, totaling approximately 3.45 billion tokens when using the GPT-2 tokenizer. The data sources cover multiple channels related to Indian agriculture, including around 201,000 master's and doctoral dissertations from the ICAR National Repository (krishikosh), approximately 145,000 question-and-answer records from the Kisan Call Center (kcc_kaggle), roughly 39,000 full-text agricultural research papers from PubMed Central India (pubmed_pmc), about 110,000 research paper abstracts from OpenAlex (openalex), approximately 19,000 investigative reports from Down To Earth (downtoearth), around 16,000 agricultural media articles from Krishijagran (krishijagran), roughly 17,000 agricultural articles from Wikipedia (wikipedia_agri), approximately 886 full-text articles from open access journals (doaj), as well as additional data sourced from ICAR, state universities, government portals, and news outlets. Each document is annotated with one or more of the 29 fine-grained agricultural subcategories, with a designated primary category. The full list of categories includes: Crop Agronomy, Soil Science, Water and Irrigation, Fertilizers and Crop Nutrition, Pest and Disease Management, Crop Diseases and Pathology, Seeds and Crop Breeding, Horticulture, Animal Husbandry and Dairy Science, Fisheries and Aquaculture, Post-harvest Handling and Storage, Agricultural Economics and Markets, Government Programs and Policies, Climate and Weather, Organic and Sustainable Agriculture, Millets and Coarse Grains, Plantations and Cash Crops, Forestry and Agroforestry, Agricultural Mechanization and Technology, Rural Livelihoods and Extension, Weed Science, Sericulture and Beekeeping, Plant Physiology and Biochemistry, Agricultural Statistics and Biometrics, Agricultural Engineering, Food Science and Technology, Microbiology and Biofertilizers, Agricultural Nanotechnology, Gender and Agriculture/Female Farmers. The dataset is stored in Parquet format, split into 124 shards, and includes the following fields: text, source, domain (fixed as "agriculture"), subdomain (i.e., source name), language (fixed as "en"), word_count, categories, primary_category. This dataset is applicable to tasks such as text generation and language modeling, particularly for knowledge-enhanced pre-training focused on the Indian agricultural domain.

创建时间:
2026-07-21
原始信息汇总

数据集概述:Agri-SLM India v1

Agri-SLM India v1 是一个面向印度农业领域、用于预训练300M参数小型语言模型(SLM)的英文语料库,包含约556,765篇文档,总词元数约34.5亿(基于GPT-2分词器),数据规模在10万至100万条之间,采用CC-BY-4.0许可。

数据规模与格式

  • 文档数量:556,765条训练样本
  • 数据文件:124个parquet文件(路径为data/train-*.parquet
  • 分词规模:约34.5亿词元(GPT-2分词器)
  • 语言:仅英语

数据集字段

每条记录包含以下字段:

  • text:完整文档文本
  • source:来源URL或来源标识符
  • domain:农业领域
  • subdomain:来源名称
  • language:语言标识
  • word_count:词数
  • categories:类别列表(可包含多个类别)
  • primary_category:主要类别

类别体系

数据集包含29个细粒度农业子类别,每个文档标记一个或多个类别,并指定一个主要类别。类别涵盖作物农艺学、土壤科学、水利与灌溉、肥料与作物营养、病虫害管理、作物疾病与病理学、种子与作物育种、园艺学、畜牧与乳业、渔业与水产养殖、收获后与储藏、农业经济与市场、政府计划与政策、气候与天气、有机与可持续农业、小米与粗粮、种植园与经济作物、林业与农林业、农业机械化与技术、农村生计与推广、杂草科学、蚕桑与养蜂、植物生理与生物化学、农业统计与生物统计、农业工程、食品科学与技术、微生物与生物肥料、农业纳米技术、性别与农业/农村妇女等。

数据来源

主要来源包括8个高占比来源和26个以上其他来源:

来源 文档数 描述
krishikosh 约201K ICAR国家论文库(硕博论文)
kcc_kaggle 约145K 农民呼叫中心问答记录
pubmed_pmc 约39K PubMed Central印度农业论文全文
openalex 约110K 研究论文摘要
downtoearth 约19K 印度农业调查新闻
krishijagran 约16K 印度最大农业媒体
wikipedia_agri 约17K 精选农业维基百科文章
doaj 约886 开放获取期刊全文

其余来源包括ICAR、邦立大学、政府门户网站和新闻源等。

搜集汇总
数据集介绍
agri-slm-india-v1 数据集图片
构建方式
面向印度农业领域的小规模语言模型预训练需求,该数据集通过多源异构语料汇聚与精细化标注构建而成。语料采集自ICAR国家学位论文库、Kisan呼叫中心农户问答记录、PubMed Central印度农业全文论文、OpenAlex摘要、记者调查报道、农业媒体文章及维基百科农业条目等三十余个权威渠道,覆盖学术文献、政策文本、田野实践与新闻资讯等多元体裁。原始文档经过去重、清洗与格式规范化处理,统一以英文呈现,逐篇标注来源、领域、子领域、词数、多标签农业类别及主类别,最终形成包含五十五万余篇文档、约三十四点五亿GPT-2词元的大规模预训练语料,并按训练集与测试集进行划分。
特点
该数据集以英文单语形式聚焦印度农业全产业链,涵盖作物农学、土壤科学、水资源与灌溉、肥料与作物营养、有害生物综合治理、畜牧与乳业、渔业与水产养殖、农业经济与市场、政府计划与政策、气候与天气、有机与可持续农业、小米与粗粮、种植园与经济作物、林业与农林业、农业机械化与技术、农村生计与推广、杂草科学、蚕桑与养蜂、植物生理与生物化学、农业统计与生物计量、农业工程、食品科学与技术、微生物与生物肥料、农业纳米技术以及性别与农业等二十九个细分领域。每篇文档均提供多类别标签与主类别标注,并附带来源标识、子领域名称及词数统计,为细粒度领域适配与类别感知建模提供了结构化支撑。
使用方法
该数据集主要服务于印度农业领域三亿参数级小规模语言模型的预训练任务,可直接加载HuggingFace datasets库中的默认配置,按需读取训练集或测试集的Parquet分片文件。使用时可依据text字段进行因果语言建模训练,借助categories与primary_category字段实施领域自适应采样或类别平衡策略,利用source与subdomain字段开展来源消融分析。word_count字段有助于长度过滤与课程学习设计。鉴于数据仅含英文且面向农业领域,建议在通用语料预训练基础上进行继续预训练,或与指令微调数据配合构建面向农业问答、文本摘要与知识抽取的下游应用。
背景与挑战
背景概述
在印度农业信息化进程加速与小型语言模型兴起的双重背景下,agri-slm-india-v1数据集于近年构建,旨在为3亿参数级别的印度农业领域小语言模型提供预训练语料。该数据集由研究团队整合ICAR国家学位论文库、Kisan Call Centre农民问答记录、PubMed Central及OpenAlex学术文献、Down To Earth调查报道等三十余个权威来源,汇聚逾55万份文档、约34.5亿tokens,覆盖29个农业子领域。其核心研究问题在于如何以领域适配的小规模模型缓解通用大模型在印度农业专业语境下的知识匮乏与部署成本难题,为农业问答、政策解读与农技推广提供高效能语言基座,对南亚农业NLP发展具有奠基性意义。
当前挑战
该数据集所应对的领域问题在于印度农业知识高度碎片化、多源异构且长期缺乏结构化预训练资源,通用语言模型难以精准捕捉本土作物管理、政策与市场等细分语义。构建过程中的挑战尤为突出:其一,跨源数据采集需兼顾学位论文、问答转录、学术摘要与新闻报道等迥异文体,质量参差且格式不一;其二,多来源内容存在噪声、重复与领域漂移,需精细清洗与去重以保障语料纯度;其三,29类子领域标签体系需兼顾粒度与一致性,人工标注与自动归类之间难以完全调和;其四,英语单语设定虽降低多语处理复杂度,却可能遗漏印度农业实践中的本土术语与方言表达,影响模型对真实场景的覆盖能力。
常用场景
经典使用场景
在农业垂直领域语言模型的构建中,agri-slm-india-v1凭借其约34.5亿token的印度农业专属语料,成为预训练3亿参数小规模语言模型的核心资源。该数据集汇聚了ICAR学位论文、Kisan Call Centre农民问答、PubMed Central全文论文等多元文本,覆盖29个精细农业子领域,经典用法是作为基础语料进行领域自适应预训练,使通用模型习得印度农业术语、作物管理知识及政策语境,进而支撑下游文本生成、问答与信息抽取任务。
解决学术问题
该数据集缓解了农业自然语言处理中印度特色语料稀缺、领域知识碎片化的困境。既有农业语料多聚焦欧美语境,缺乏对印度小农经济、季风农业及政府计划的覆盖,导致模型在本地化问答与建议生成上表现欠佳。该数据集通过整合学位论文、推广问答与科研摘要,为研究农业知识表示、领域迁移学习及低资源专业文本生成提供了标准化基准,推动了面向小农的智能决策系统研究。
衍生相关工作
围绕agri-slm-india-v1,衍生出多项经典工作:基于该语料训练的Agri-SLM系列模型在农业问答与文本生成任务上取得显著提升;研究者利用其29类标签体系开展农业文本分类与主题建模;部分工作将其与通用指令数据混合,探索领域持续预训练策略;还有研究以其为基准,评估不同规模模型在印度农业语境下的知识保留与幻觉抑制能力,推动了农业专用语言模型的迭代发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务