遇见数据集

轴承生产批次追溯语料训练数据

收藏
浙江省数据知识产权登记平台2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

本数据产品专为训练万向节制造行业垂类大语言模型而构建,旨在让模型能够深度理解轴承生产批次追溯场景中的制造任务、流转卡、装配工序等核心需求,从而实现批次质量追溯、工序流转分析、装配异常定位等应用目标。依托企业真实制造任务数据构建标准化语料体系,模型经训练后可精准理解"制造任务号""品号""品名""计划量""排产数""实际量""实际进度"等轴承生产批次追溯特有指标及判定标准。万向节制造企业可基于本语料数据的分类如"生产批次追溯""工序流转记录""质量追溯分析""生产知识"等字段内容,适配自身轴承制造任务数据结构,快速启用轴承生产批次追溯文本生成功能进行复用。本数据为万向节制造企业提供了稀缺的、高质量的垂直领域语料,有力支撑了轴承生产批次追溯的自然语言处理技术研发、模型训练与评测,对推动万向节制造行业轴承生产追溯数据价值的深度挖掘和智能追溯技术的发展具有重要意义。1.数据清洗与标准化 数据清洗:按"任务号+品号"去重,剔除重复语料;通过逻辑校验删除矛盾数据;保留"实际进度<80%"的样本,增强模型对异常场景的处理能力,清洗后数据有效率≥98%。 格式统一:统一时间格式(YYYY-MM-DD)、制造任务号标准化、品号编码标准化;对"品名"字段补全,补全率100%。 2.语料分类与结构化 从制造任务记录中提取轴承生产批次追溯数据,按"生产批次追溯""工序流转记录""质量追溯分析""生产知识"四种语料风格分类,标注"任务号""品号""排产状态"标签,确保覆盖轴承生产批次追溯90%以上核心场景,构建基础语料库。 3.语料生成与质量校验 语料生成:基于任务号、品号、品名、计划量、排产数、实际量、实际进度、排产状态、创建时间等字段,按"任务+品号+品名+计划量+排产数+实际量+进度+状态"八要素模板生成自然语言文本。 数值一致性校验:确保文本中引用的数值与原始数据完全一致,一致性率100%。 异常语料过滤:剔除文本长度小于50字或关键数值字段缺失的语料,过滤率≥99%。 人工核验:由资深生产工程师对生成语料进行抽样核验,核验比例≥5%,确保语料业务准确性。 4.语料库迭代优化 构建语料库的闭环迭代机制。新产生的生产数据及经核验的语料定期注入语料库。同时,通过分析大语言模型在实际应用中的反馈,定位语料库的薄弱环节并进行针对性补充,形成"应用-反馈-优化"良性循环,持续提升语料库的覆盖度和质量。

创建时间:
2026-07-13
搜集汇总
数据集介绍
轴承生产批次追溯语料训练数据 数据集图片
背景与挑战
背景概述
轴承生产批次追溯语料训练数据是由杭州中亚汽配有限公司登记的数据知识产权,规模2195条,以xlsx格式存储,包含语料正文、类别、任务号、品号等17个字段。该数据集专为训练万向节制造行业垂类大语言模型而构建,旨在支撑轴承生产批次追溯场景中的质量追溯、工序流转分析等应用,并经数据清洗、分类、生成与校验等流程处理,已进行区块链存证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务