IndustryInstruction
收藏资源简介:
本数据集为行业指令数据集,包含多个行业的中英文对照名称,旨在补充当前行业指令数据的空白,并挖掘高质量预训练语料中的行业高价值知识。数据构建过程中使用了多种生成模型和去重、过滤技术,确保数据的质量和多样性。数据集提供了词云可视化和数据质量分布曲线,方便用户了解数据分布情况。
This dataset is an industry instruction dataset containing paired Chinese and English names for multiple industries. It aims to fill the gap in current industry instruction datasets and extract high-value industry-specific knowledge from high-quality pre-training corpora. A variety of generation models, deduplication and filtering techniques were utilized during the dataset construction phase to guarantee the quality and diversity of the data. Additionally, the dataset provides word cloud visualizations and data quality distribution curves to help users better understand the data distribution.
数据集概述
基本信息
- 许可证: Apache 2.0
- 任务类别: 问答
- 语言: 中文, 英文
- 数据规模: 10M<n<100M
数据集描述
本数据集为行业指令数据集,包含以下行业的中英文对照名称:
- 汽车 : Automobiles
- 航空航天 : Aerospace
- 人工智能_机器学习 : Artificial-Intelligence
- 交通运输 : Transportation
- 科技_科学研究 : Technology-Research
- 法律_司法 : Law-Justice
- 金融_经济 : Finance-Economics
- 文学_情感 : Literature-Emotions
- 旅游_地理 : Travel-Geography
- 住宿_餐饮_酒店 : Hospitality-Catering
- 医疗 : Health-Medicine
- 学科教育 : Subject-Education
数据构建方案
数据生成方案说明
-
种子来源:
- 行业名称
- IndustryCorpus2.0高质量行业预训练语料
-
数据构建方案:
- doc2qa: 使用预训练语料合成指令数据
- topic2qa:
- 使用行业名称合成相关指令数据
- 使用行业人物描述+行业名称合成指令数据
-
数据去重:
- Query完全匹配去重和基于minihash去重
- 语义向量化聚类后簇内去重
-
数据过滤筛选:
- Deita: 指令复杂性和回复质量
- RW model: 回复偏好筛选
Doc2QA
-
Stage1: 生成预料中存在的问题
- 输入: 行业类目+预训练语料
- 逻辑: 判断预训练语料是否与行业类目匹配,若匹配则生成指定数量问题,若不匹配则丢弃该数据
- 输出: 问题列表
-
Stage2: 根据问题列表和预训练语料生成指令数据
- 输入: 预训练语料+问题列表
- 逻辑: 根据提供的预训练语料对问题列表生成回复
- 输出: 指令数据
-
生成模型:
- GPT4, EN(llama3.1-70B-Instruct), ZH(Qwen2-72b-chat)
topic2text
- 行业类目作为种子生成行业子主题和人物描述
- 行业子主题生成指定数量问题列表
- 人物描述与行业类目或行业子主题生成问题列表
- 问题列表使用生成模型合成行业指令数据
dedup数据去重
- 基于query的完全匹配去重和Minihash去重
- 使用query-emb进行聚类,计算样本距离簇中心的cosine距离,删除cos_distance<0.3的数据
filter数据过滤
- 使用基于Deita的数据复杂性和回复质量筛选
- 使用基于rw模型回复偏好对数据进行筛选
数据可视化
- 词云可视化数据




