遇见数据集

ligaments-dev/gst-india-sft

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- tags: - ml-intern dataset_info: features: - name: messages list: - name: role dtype: string - name: content dtype: string splits: - name: train num_bytes: 117431 num_examples: 208 - name: test num_bytes: 13549 num_examples: 24 download_size: 137487 dataset_size: 130980 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* --- # ligaments-dev/gst-india-sft <!-- ml-intern-provenance --> ## Generated by ML Intern This dataset repository was generated by [ML Intern](https://github.com/huggingface/ml-intern), an agent for machine learning research and development on the Hugging Face Hub. - Try ML Intern: https://smolagents-ml-intern.hf.space - Source code: https://github.com/huggingface/ml-intern ## Usage ```python from datasets import load_dataset dataset = load_dataset("ligaments-dev/gst-india-sft") ```

提供机构:
ligaments-dev
搜集汇总
数据集介绍
ligaments-dev/gst-india-sft 数据集图片
构建方式
该数据集由ML Intern智能体自动生成,旨在为印度商品与服务税(GST)领域的监督式微调(SFT)提供训练与评估样本。数据集包含208条训练样本与24条测试样本,每条样本均以对话形式组织,由角色(role)与内容(content)字段构成,模拟了用户与模型在GST相关查询中的交互场景。数据来源依托于Hugging Face Hub的自动化生成流程,确保了样本的规模可控性与领域相关性。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集,使用标准API调用即可获取训练与测试分片。适用于基于Transformer架构的因果语言模型或编码器-解码器模型的监督式微调,典型场景包括构建GST问答助手或税务政策咨询系统。建议在加载后按需进行数据增强或格式转换,以匹配不同模型的输入规范。
背景与挑战
背景概述
gst-india-sft数据集由Hugging Face平台上的ML Intern项目自动生成,创建于2025年,主要面向印度商品与服务税(GST)领域的监督式微调(SFT)任务。该数据集由ligaments-dev机构发布,共包含208条训练样本和24条测试样本,每条记录由角色与内容组成的对话消息构成。其核心研究问题在于构建一个专门针对印度GST法规与实务的对话数据集,以支持大语言模型在法律与税务领域的领域适应性微调。作为ML Intern项目探索自动化数据生成与领域数据集构建的重要成果,该数据集为税务领域的小样本监督学习提供了基础资源,有望推动法律人工智能在印度市场的精细化发展。
当前挑战
该数据集面临的核心挑战在于解决印度GST法规复杂多变带来的领域理解难题。GST体系涉及多层税率、退税机制与合规流程,要求模型具备精确的法律条文解析与情景推理能力,而当前208条训练样本数量极为有限,难以覆盖多样化的税务场景。构建过程中,依赖自动生成工具可能引入术语不准确或逻辑不一致的风险,同时缺乏人工审核机制使得数据质量难以保证。此外,对话格式的结构化表示与真实用户咨询的自然语言表达之间可能存在偏差,进一步增大了模型在真实税务问答场景中的泛化难度。
常用场景
经典使用场景
在对话式人工智能与自然语言处理的交叉领域,指令微调数据集已成为提升模型遵循人类意图能力的基石。gst-india-sft数据集以其精心构建的多轮对话结构,成为印度税务咨询场景下大语言模型微调的经典资源。研究者可借此数据集训练模型,使其能够基于印度商品与服务税(GST)法规,准确回答税率计算、申报流程、豁免条款等专业问题,从而打造具备领域专精能力的智能税务助手。
解决学术问题
该数据集直击专业领域对话系统面临的领域适配与知识嵌入双重挑战。通过提供来自真实税务咨询场景的指令-回复对,它有效缓解了通用大语言模型在印度GST法规等垂直领域的概念混淆与知识幻觉问题。数据集中角色交替的设计,为研究上下文保持、多轮推理与领域术语一致性等对话管理核心议题提供了标准化实验平台,其发布推动了多语言、多领域指令微调数据构建方法的创新。
实际应用
在实际部署层面,基于gst-india-sft微调的模型已融入印度企业的税务合规工作流,成为企业财务人员与税务顾问的智能协作工具。该数据集赋能的应用能够实时解答跨境交易税率、电子发票开具规则等复杂实务问题,显著降低企业咨询专业税务师的时间与经济成本。金融科技公司亦借助衍生模型构建自助式税务申报问答系统,通过自然语言交互引导用户完成从纳税申报表填写到退税状态查询的全链路操作。
数据集最近研究
最新研究方向
该数据集聚焦于印度商品与服务税(GST)领域的指令微调,为大型语言模型在特定税务政策理解与查询应答上提供窄域训练样本。前沿研究方向侧重于如何利用此类小规模、高专业性的SFT数据集,提升模型在零样本或少样本场景下对印度税法的合规性解释、税率计算及申报流程的推理能力。结合当前全球税务数字化与AI辅助合规的热点,该数据集的构建与发布标志着针对印度这一重要经济体的本地化税务知识注入已从通用语料向专业指令集演进。其影响在于为开发面向税务顾问、企业财务人员的对话式AI助手提供了关键的基准数据集,并有望推动多语言、低资源情景下法律与财务领域大模型微调方法的创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务