遇见数据集

pashto-food-safety-cls

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Pashto Food Safety CLS 是一个以普什图语(Pashto)编写的食品安全数据集,专注于食品卫生、污染预防、安全食品处理等主题。该数据集包含用户与助手之间的对话对,采用标准的 messages 结构(JSON/JSONL 格式),适用于文本分类、对话微调、指令微调以及大语言模型(LLM)的训练。数据规模较小(少于1K样本),当前处于早期实验阶段,并计划在未来扩展更多场景、分类标签、HACCP相关类别、食物污染案例等。数据集可用于构建普什图语食品安全聊天机器人、食品卫生助手、安全导向的LLM微调、普什图语指令微调、食品安全问答系统、分类实验以及教育AI系统。该数据集仅供教育和AI研究使用,不能替代专业的食品安全法规、检查程序或医疗建议。许可证为 Apache-2.0。

Pashto Food Safety CLS is a food safety dataset written in Pashto, focusing on topics such as food hygiene, contamination prevention, and safe food handling. The dataset contains conversation pairs between users and assistants, using the standard messages structure (JSON/JSONL format). It is suitable for text classification, dialogue fine-tuning, instruction fine-tuning, and training large language models (LLMs). The dataset is small (fewer than 1K samples), currently in the early experimental stage, and plans to expand more scenarios, classification labels, HACCP-related categories, food contamination cases, etc. in the future. It can be used to build Pashto food safety chatbots, food hygiene assistants, safety-oriented LLM fine-tuning, Pashto instruction fine-tuning, food safety question-answering systems, classification experiments, and educational AI systems. The dataset is intended for educational and AI research purposes only and cannot replace professional food safety regulations, inspection procedures, or medical advice. The license is Apache-2.0.

创建时间:
2026-08-23
原始信息汇总

🥗 Pashto Food Safety CLS 数据集详情

数据集简介

Pashto Food Safety CLS 是一个专注于食品安全、食品卫生、污染预防和食品处理安全的普什图语(Pashto)数据集,旨在支持普什图语自然语言处理(NLP)和大型语言模型(LLM)的训练与研究。

数据集采用 Apache-2.0 许可证,目前处于实验性阶段,规模较小(n<1K),但计划持续扩展。


基本信息

属性 详情
语言 普什图语(Pashto, ps)
格式 JSON / JSONL
结构 messages(对话式结构)
任务类型 文本分类 / 文本生成
领域 食品安全与卫生
许可证 Apache-2.0
状态 实验性 / 持续扩充中

内容覆盖范围

数据集涵盖以下食品安全相关主题:

  • 🍖 生肉的安全处理
  • 🦠 细菌污染
  • 🔄 交叉污染
  • ❄️ 冷藏与安全温度
  • 🧼 食品卫生
  • 🥘 安全的食品制备
  • 📋 HACCP 原则
  • ⚠️ 食品安全风险
  • 🧑‍🍳 食品从业人员的规范操作
  • 🥬 易腐食品的储存

数据格式说明

数据集采用标准的对话式 messages 结构,每条样本包含用户提问与助手回答:

json { "messages": [ { "role": "user", "content": "خامه غوښه څنګه په خوندي ډول وساتو؟" }, { "role": "assistant", "content": "خامه غوښه باید په پاک او تړل شوي لوښي کې وساتل شي او له نورو تیار خوړو څخه جلا وساتل شي." } ] }

该格式适用于对话式微调(conversational fine-tuning),并可适配现代 LLM 训练流程。


预期用途

该数据集可用于以下场景:

  • 普什图语食品安全聊天机器人
  • 食品卫生助手
  • 面向安全领域的 LLM 微调
  • 普什图语指令微调(instruction tuning)
  • 食品安全问答系统
  • 分类与安全实验
  • 教育类 AI 系统
  • 普什图语 NLP 研究

重要说明

⚠️ 该数据集仅供教育和 AI 研究目的使用,不应替代专业的食品安全法规、检验程序、医疗建议或来自合格食品安全机构的指导。食品安全建议可能因国家和监管体系而异。


数据集状态与未来规划

当前版本为早期阶段的小规模发布,作为构建更大普什图语食品安全数据集的基础。

未来版本可能包含:

  • 更多食品安全场景
  • 正反示例
  • 分类标签
  • HACCP 相关类别
  • 食品污染案例
  • 储存温度场景
  • 餐厅与厨房安全
  • 食源性疾病预防
  • 更多自然的普什图语对话

技术使用方式

加载数据集

python from datasets import load_dataset

dataset = load_dataset("nassimjp/pashto-food-safety-cls") print(dataset)

访问示例

python example = dataset["train"][0] print(example["messages"])


作者信息

  • 作者:Nasibullah Nassim (Nassim JP)
  • 机构:Pashto AI Research & Development, Japan 🇯🇵

引用格式

bibtex @misc{nassimjp_pashto_food_safety_cls_2026, author = {Nasibullah Nassim}, title = {Pashto Food Safety CLS}, year = {2026}, publisher = {Hugging Face Datasets}, url = {https://huggingface.co/datasets/nassimjp/pashto-food-safety-cls} }


数据集链接

🔗 Hugging Face 地址:https://huggingface.co/datasets/nassimjp/pashto-food-safety-cls

搜集汇总
数据集介绍
pashto-food-safety-cls 数据集图片
构建方式
该数据集聚焦于普什图语在食品安全领域的应用,采用对话式消息结构(messages)进行构建,每个样本包含用户提问与助手回答,内容覆盖生鲜肉品处理、细菌污染防控、交叉污染规避、冷藏温度规范、食品卫生实践、HACCP原则及易腐食品储存等主题。当前版本为早期实验性发布,规模小于1K,但已奠定基础框架,便于后续扩展。数据格式统一为JSON/JSONL,适配现代大语言模型的对话微调流程。
使用方法
使用者可通过Hugging Face的datasets库便捷加载,调用load_dataset("nassimjp/pashto-food-safety-cls")即可获取数据,并以dataset["train"][0]["messages"]访问具体样本。该数据集适用于普什图语食品安全聊天机器人开发、大语言模型的安全指令微调、食品卫生知识问答系统构建,以及普什图语自然语言处理研究中的分类与安全实验。注意,其定位为教育与科研用途,不可替代专业食品安全法规或权威指导。
背景与挑战
背景概述
普什图语食品安全分类数据集由Nasibullah Nassim于2026年创建,旨在推动低资源语言普什图语在食品安全领域的自然语言处理研究。该数据集聚焦于食品安全、卫生、污染预防及安全处理等核心议题,涵盖HACCP原则、交叉污染、冷藏温度等关键场景。作为普什图语AI研究的前沿成果,该数据集填补了普什图语在食品安全领域NLP资源的空白,为构建食品安全问答系统、对话式助手及LLM微调提供了基础语料,对促进普什图语NLP技术发展和食品安全信息普及具有重要意义。
当前挑战
该数据集面临多重挑战:领域层面,普什图语作为低资源语言,缺乏成熟的NLP基础设施和标注工具,且食品安全知识体系复杂,涉及法规、微生物学等多学科交叉,需确保语料专业性与准确性;构建层面,数据集目前处于实验性阶段,样本规模不足1K,覆盖面有限,难以支撑大规模模型训练,且对话格式单一,缺乏分类标签和正负样本,限制了其在分类任务中的适用性。此外,食品安全建议因地区法规而异,数据集的普适性和可扩展性仍需持续完善。
常用场景
经典使用场景
在普什图语自然语言处理研究领域,该数据集作为首个聚焦食品安全主题的对话式文本资源,为低资源语言下的安全领域建模提供了稀缺的基础语料。其采用标准的messages结构,适用于构建食品安全问答系统、指令微调与文本分类任务,尤其服务于普什图语聊天机器人的安全知识库构建,助力研究者探索非英语环境下食品安全信息的语义理解与生成。
解决学术问题
该数据集直面普什图语在专业领域(如食品安全)标注语料匮乏的学术困境,通过提供涵盖交叉污染、冷藏温度、HACCP原则等核心议题的高质量对话样本,支持了食品安全领域的文本分类、问答生成及对话系统研究。其贡献在于填补了低资源语言在安全敏感场景下的数据空白,为多语言NLP模型的公平性与鲁棒性研究提供了关键实证基础,推动了普什图语信息检索与知识服务的学术进展。
实际应用
在实际应用中,该数据集可被整合进普什图语智能客服系统或卫生教育AI平台,向公众普及安全食品处理、存储及污染预防知识。例如,面向阿富汗及巴基斯坦普什图语社区的食品安全助手,能针对肉类保鲜、交叉污染等常见问题提供即时且符合HACCP规范的回答,从而提升当地居民的食物安全意识,辅助公共卫生教育项目的数字化落地。
数据集最近研究
最新研究方向
该数据集聚焦普什图语食品安全领域,为低资源语言的自然语言处理研究开辟了全新路径。其前沿方向在于构建面向食品卫生与安全对话的指令微调基准,结合HACCP原则与冷链管理等关键议题,推动多模态安全问答系统在特定文化语境中的落地。作为实验性语料,它填补了普什图语在专用领域NLP资源的空白,为后续扩展至分类标签、风险场景及交互式智能助手提供了可迭代的基石,其Apache-2.0许可亦促进了开放科学与跨语言安全智能体的协同演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务