遇见数据集

poocha-behaviors-sft

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

Poocha — Kids Tutor Behaviours (Round 4, B2 Expanded) 是一个用于对话行为监督微调(SFT)的语料库,基于真实儿童使用日志构建,旨在弥补第三轮已知的行为差距。数据集包含659行数据,涵盖8个类别:身份(询问Poocha自身信息)、重定向(将偏离主题的询问温和引导回科学话题)、安全(友善且安全地处理不友好或沮丧的消息,作为运行时护栏代理后的模型级深度防御)、情感(温暖回应友谊或爱的表达)、世界(对超出印度国家教育研究与培训委员会(NCERT)和印度范围之外的好奇心,经过事实核查)、健康与舒适(B2新增,处理医院/发烧/害怕/孤独等情境,提供安慰并建议信任的成年人,不进行诊断或开药,且不以二选一结尾)、故事与书籍(B2新增,识别著名儿童书籍但不复制文本,提供原创故事)、数学基础(B2新增,使用印度示例进行分步数学教学,以“检查你的答案!”结尾而非指令性问题)和绘画(对绘画请求使用Pollinations图像嵌入回答,格式与app.js相同)。输入提示包括系统性的拼写错误、混合语言(如Manglish)、表情符号、简洁表达和语音识别噪声变体,以训练模型优雅处理真实儿童输入的混乱但可理解的文本。数据格式为聊天格式,包含系统、用户和助手消息,使用相同的POOCHA系统提示。数据集适用于文本生成任务,特别针对教育、儿童、科学、辅导和安全等应用场景,使用CC-BY-4.0许可,语言为英语。

Poocha — Kids Tutor Behaviours (Round 4, B2 Expanded) is a corpus for dialogue behavior supervised fine-tuning (SFT), built based on real childrens usage logs, aiming to address known behavioral gaps from the third round. The dataset contains 659 rows of data, covering 8 categories: Identity (inquiring about Poochas own information), Redirecting (gently guiding off-topic queries back to science topics), Safety (handling unfriendly or frustrating messages in a friendly and safe manner, as a model-level deep defense after runtime guardrails), Emotion (warmly responding to expressions of friendship or love), World (fact-checked curiosity beyond the National Council of Educational Research and Training (NCERT) and Indias scope), Health & Comfort (new in B2, handling situations like hospitals/fever/fear/loneliness, providing comfort and suggesting trusted adults, without diagnosis or prescription, and not ending with binary choices), Stories & Books (new in B2, recognizing famous childrens books without copying text, providing original stories), Math Foundations (new in B2, teaching step-by-step math using Indian examples, ending with Check your answer! rather than directive questions), and Drawing (using Pollinations image embeddings for drawing requests, with the same format as app.js). Input prompts include systematic spelling errors, mixed languages (e.g., Manglish), emojis, concise expressions, and speech recognition noise variants, to train models to gracefully handle the chaotic yet understandable text of real childrens inputs. The data format is chat format, including system, user, and assistant messages, using the same POOCHA system prompt. The dataset is suitable for text generation tasks, particularly for applications in education, children, science, tutoring, and safety, using the CC-BY-4.0 license, with the language being English.

创建时间:
2026-06-23
原始信息汇总

数据集概述

名称:Poocha — Kids Tutor Behaviours (Round 4, B2 Expanded)
许可证:CC-BY-4.0
语言:英语(en)
任务类型:文本生成(text-generation)
标签:教育、儿童、科学、辅导、安全、印度、Poocha
大小:1K 至 10K 条样本(实际包含 659 行 数据)


数据集组成

该数据集包含 8 个类别,覆盖儿童辅导场景中的关键行为:

类别 描述
identity(身份) 回答关于 Poocha 自身的问题(如名字、年龄、物种、起源)
redirect(引导转向) 温和地将离题问题(如家庭作业、体育、政治)引导回科学话题
safety(安全) 友善且安全地处理不友善或情绪化的消息(作为运行时防护代理的深层防御)
affection(情感) 温暖回应友谊或爱意的表达(如“我也爱你”),不作扩展
world(世界) 回答超出 NCERT/印度课程的好奇心问题,经事实核查确保准确性
health_comfort(健康安抚) 新增类别,处理医院/发烧/害怕/孤独等场景:提供安抚并建议寻求可信赖成年人的帮助;不得诊断或开药,避免二选一结局
stories_books(故事与书籍) 识别经典儿童书籍(不复制原文),并提供原创故事
drawing(绘画) 根据绘画请求回复 Pollinations 图像嵌入(格式与 app.js 相同)

数学基础(math_basics) 类别:用印度生活实例(芒果、拉杜球、板球跑分)进行分步数学指导,结尾为“Check your answer!”,不包含指令性问题。


数据格式

采用 Chat 格式,每条数据包含 {"messages": [system, user, assistant]} 结构,使用与 Poocha 相同的系统提示词。

训练/验证划分

  • 训练集:train.jsonl
  • 验证集:val.jsonl

数据特色

  • 输入提示包含系统性的拼写错误、Manglish(马拉雅拉姆语与英语混合)、表情符号、简短表述以及 ASR 噪声变体,旨在使模型能够优雅处理儿童真实输入的杂乱但不失词形的内容。
  • 由 Gemma 4 31B 教师模型生成(Apache-2.0 许可证),数据集采用 CC-BY-4.0 许可证发布。
搜集汇总
数据集介绍
poocha-behaviors-sft 数据集图片
构建方式
本数据集专为Poocha儿童科学教育助手设计,基于真实儿童使用日志中的对话行为进行构建,旨在弥补先前版本在行为覆盖上的不足。数据包含659条样本,横跨8个类别,如身份询问、话题重定向、安全应对、情感回应、世界知识、健康安慰等。每个对话均以标准JSON格式组织,包含系统提示、用户输入与助手回复,并采用Gemma 4 31B模型作为教师生成数据,遵循CC-BY-4.0许可。
特点
数据集的一大特色在于其高度模拟真实儿童输入场景,系统性地引入了拼写错误、Manglish混合语言、表情符号、简短表述及ASR噪声变体,从而训练模型优雅处理非规范但具语义的输入。此外,新增的健康安慰与故事书籍等类别强化了情感支持与知识边界控制,确保模型不提供医疗诊断或直接答案,而是引导至信任成人或鼓励自主探索。
使用方法
该数据集适用于文本生成任务的监督微调,可直接加载训练集与验证集JSONL文件。使用时需保持统一的Poocha系统提示词,并在对话上下文中嵌入多轮交互。数据支持通过标准HuggingFace接口或自定义脚本调用,特别适合研究儿童导向对话系统中的行为对齐、安全防护与多语言容错能力,为构建可靠的教育助手提供基准训练材料。
背景与挑战
背景概述
Poocha-behaviors-sft数据集诞生于儿童教育对话系统的前沿探索中,由致力于安全、包容性AI的团队于近期构建。该数据集聚焦于儿童科学导师场景下的对话行为微调,核心研究问题在于如何使AI助手在应对儿童用户多变的语言输入(如拼写错误、混合语码或情感化表达)时,既能精准维持科学教育主线,又能体现温暖、安全的交互规范。其影响力体现在为教育AI领域提供了一个从真实儿童使用日志中提取、并系统覆盖身份询问、安全保护、情感回应等八类行为的高质量训练语料,填补了此前模型在特定行为场景下的响应缺口。
当前挑战
该数据集面临的核心挑战在于解决儿童教育领域特有的交互复杂性:首先,模型需在兼顾学术准确性与情感安全性的前提下,妥善处理儿童可能出现的离题提问、负面情绪或安全隐患,避免提供不当建议(如医疗诊断);其次,构建过程中需从含大量噪声的真实儿童对话中清洗并标注出符合教育伦理的样本,同时通过系统性引入拼写变异、表情符号等扰动数据,模拟儿童输入的非标准形态,以提升模型对真实环境的泛化鲁棒性。
常用场景
经典使用场景
Poocha Behaviors SFT数据集专为构建儿童科学教育对话智能体的监督微调(SFT)而设计,其核心场景是模拟学龄儿童与虚拟助手之间真实、多变且充满干扰的交互过程。数据集包含659条精心标注的对话样本,覆盖身份询问、话题引导、情感回应、安全处理、数学基础等8个类别,每条样本均采用Chat格式(含系统、用户、助手的消息结构),可用于训练模型在开放式教育问答中保持对科学话题的聚焦,同时兼顾儿童用户的情绪需求与认知水平。通过引入打字错误、Manglish混合语、表情符号、ASR噪声等输入变体,该数据集帮助模型在现实环境下具备鲁棒性,是印度本土化教育AI系统开发的关键资源。
衍生相关工作
Poocha Behaviors SDT数据集衍生自Poocha儿童教育对话项目的前序版本(Round 3),其构建方法为后续工作提供了重要参照:数据生成采用Gemma 4 31B教师模型(Apache-2.0许可)进行蒸馏标注,这一'大模型标注-小模型微调'的范式启发了同类教育数据集(如KidsChat、EduBot)的合成数据生产流程;数据集中的'健康安慰'(新增于B2)类别已作为独立子集被引用至面向儿童情感支持对话的学术研究;此外,该数据集在OpenAssistant和ShareGPT等通用对话数据的基础上,专门补充了适用于8-12岁印度儿童的语言变体(Manglish、打字错误、表情符号),形成了独特的非标准输入处理基准,推动了多语言教育NLP社区中的鲁棒对话系统评测工作发展。
数据集最近研究
最新研究方向
当前,儿童教育领域的大语言模型研究正聚焦于构建安全、可控且富有人文关怀的对话系统。Poocha Behaviors SFT数据集应运而生,其核心价值在于通过真实儿童使用日志中的对话行为(涵盖身份认知、安全防护、情感抚慰、学科辅导等8个维度)来弥补先前模型在行为覆盖上的缺口。特别值得关注的是,该数据集引入了系统化的拼写错误、混合语码、表情符号及语音识别噪声等真实输入变体,旨在提升模型处理非标准儿童语言输入的鲁棒性。这一研究方向与全球日益重视的儿童在线安全与个性化教育伦理紧密关联,不仅推动了面向印度语境的多语言、多文化AI助教开发,更为跨文化儿童-人工智能交互的范式树立了标杆,其影响已延伸至教育公平、弱势群体数字包容等深层社会议题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务