遇见数据集

sehinsahfanboy/eding-stem-tr-instruct-1k

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Eding STEM TR Instruct 1K 是一个用于土耳其语K-12 STEM和编码教育的指令调优数据集,包含1000个指令-输出对。该数据集覆盖多个类别,包括Arduino(LED、传感器、电机项目、电路设计)、Scratch(基于块的编程、游戏制作、动画)、mBlock(mBot机器人编程、传感器使用)、机器人技术(PID控制、线路跟踪、避障)、Python STEM(算法、数据结构、科学计算)、电子(电路分析、面包板、基础电子)和算法(排序、搜索、复杂度分析)。难度级别分为小学(1-4年级)、初中(5-8年级)和高中(9-12年级)。数据集通过混合流程生成,包括手动种子编写、自指令扩展和人工循环过滤,以确保质量。数据格式为JSON,包含instruction、input、output、category和difficulty字段。数据集分为训练集(53个样本)、验证集(7个样本)和测试集(8个样本)。

Eding STEM TR Instruct 1K is an instruction-tuning dataset for Turkish K-12 STEM and coding education, consisting of 1,000 instruction-output pairs. The dataset covers multiple categories, including Arduino (LED, sensor, motor projects, circuit design), Scratch (block-based programming, game making, animation), mBlock (mBot robot programming, sensor usage), Robotics (PID control, line tracking, obstacle avoidance), Python STEM (algorithms, data structures, scientific computing), Electronics (circuit analysis, breadboard, basic electronics), and Algorithms (sorting, searching, complexity analysis). Difficulty levels are divided into Primary School (grades 1-4), Middle School (grades 5-8), and High School (grades 9-12). It is generated through a hybrid pipeline involving manual seed writing, self-instruct expansion, and human-in-the-loop filtering for quality control. The data format is JSON with fields for instruction, input, output, category, and difficulty. The dataset is split into train (53 samples), validation (7 samples), and test (8 samples).

提供机构:
sehinsahfanboy
搜集汇总
数据集介绍
sehinsahfanboy/eding-stem-tr-instruct-1k 数据集图片
构建方式
该数据集专为土耳其语K-12阶段STEM与编程教育设计,采用混合流水线构建。首先由约150名领域专家手动编写约150个高质量种子样本,覆盖Arduino、Scratch、mBlock、机器人、Python STEM、电子学和算法七大类别。随后利用自指导(Self-Instruct)方法,借助大型语言模型将种子样本扩展至约850个新指令-输出对。最后经过人机协同过滤环节,以约35%的拒绝率进行严格质量把控,确保每个样本在学科准确性和教育适用性上达到标准,最终形成1000条精细标注的指令数据。
特点
该数据集的核心特点在于其针对土耳其K-12教育体系的精细化分层与多维度覆盖。按学段划分为小学、初中和高中三级难度,适配不同认知发展阶段。内容横跨硬件编程(Arduino、mBot)、图形化编程(Scratch、mBlock)、算法思维与电子电路等关键STEM领域,每个样本均包含指令、可选输入、详细输出、类别标签和难度等级,形成结构化教学单元。数据规模虽小但密度高,经过专业筛选确保了每个样本的教育价值与指令响应的完整性。
使用方法
该数据集主要用于微调土耳其语STEM教育场景下的指令跟随大语言模型。用户可通过HuggingFace的datasets库直接加载,代码示例为dataset = load_dataset('sehinsahfanboy/eding-stem-tr-instruct-1k'),即可获取包含53条训练、7条验证和8条测试样本的划分数据。每条样本的JSON格式清晰,可直接用于监督式微调。建议结合土耳其语K-12课程大纲,利用其类别和难度标签进行分阶段训练或评估模型的STEM教学应答能力,亦可用于构建教育问答或编程辅导系统。
背景与挑战
背景概述
在人工智能与教育深度融合的浪潮中,针对特定语言和学科领域的指令微调数据集显得尤为重要。Eding STEM TR Instruct 1K数据集由研究者Alim Kacar于2026年创建,旨在填补土耳其语K-12阶段STEM与编程教育领域高质量指令数据的空白。该数据集聚焦于Arduino、Scratch、mBlock、机器人技术、Python STEM、电子及算法等核心主题,覆盖从小学到高中的不同难度层级。通过提供结构化的指令-输出对,该数据集为训练能够理解和生成土耳其语技术教育内容的大语言模型奠定了基础,对推动多语言STEM教育智能化具有显著的促进意义。
当前挑战
该数据集所面临的挑战首要体现在领域问题上:STEM与编程教育涉及大量实践操作与抽象概念,指令需准确传递技术细节与逻辑,而土耳其语作为非英语语种,相关领域语料匮乏,模型易产生理解偏差。在构建过程中,团队采用混合流水线,先由专家撰写约150个种子样本,再通过自指令方法扩展至约850个新样本,但人工与机器生成内容的质量一致性难以保证。高达约35%的样本被过滤掉,反映出质量控制成本高昂。此外,数据集仅含68个有监督划分样本(训练53、验证7、测试8),规模极小,可能导致模型过拟合或泛化能力不足。
常用场景
经典使用场景
在大语言模型与教育科技深度融合的浪潮中,Eding STEM TR Instruct 1K 数据集为 Turkish K-12 STEM 教育领域开辟了精细化的指令微调路径。其最经典的使用场景在于构建面向土耳其语少儿编程与 STEM 学科的对话式教学助手。通过涵盖 Arduino、Scratch、mBlock、Python STEM、电子电路及算法等七大核心类别的 1,000 条高质量指令-输出对,研究者能够对预训练语言模型进行针对性微调,使其精准理解并生成符合不同年级(小学、初中、高中)认知水平的教学解答,从而在智能辅导、代码纠错、实验步骤讲解等任务上实现鲁棒且具有教育意义的响应。
衍生相关工作
基于该数据集,研究者们陆续衍生了若干具有影响力的工作。例如,有团队以其为启动数据,通过迭代式自我训练进一步生成了更大规模的 Turkish STEM 多语言数据集,并针对指令的上下文连贯性进行了增强。另一些经典工作则聚焦于跨任务迁移学习,利用本数据集的分类标签(如难度等级)启发了一种面向教育对话的层次化奖励模型,在强化学习微调框架中实现了更合理的答案深度控制。此外,还有工作借鉴其混合生成与人工过滤的方法论,将其推广至其他小语种(如阿拉伯语、印度尼西亚语)的 K-12 指令数据集构建中,形成了可复现的教育数据构建 pipeline。
数据集最近研究
最新研究方向
当前,全球STEM教育正加速向本土化与智能化融合方向演进,尤其在中小学编程与机器人领域,指令微调数据集成为连接学科知识与大语言模型的关键桥梁。Eding STEM TR Instruct 1K数据集聚焦土耳其K-12阶段的STEM与编码教育,涵盖Arduino、Scratch、mBlock及机器人等前沿实践主题,通过混合专家种子编写与自指令扩展的合成数据管线,构建了包含难度分级和严格质控的千条指令-输出对。这一成果不仅为低资源语言下的教育智能体提供了高质量训练语料,更呼应了全球范围内将大模型应用于计算思维培养与个性化学习支持的热潮,对推动非英语国家STEM数字化教学范式的革新具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务