InterviewForge_GenDS
收藏资源简介:
该数据集是一个用于面试准备练习的合成问答数据集,旨在解决数据科学和工程教育中缺乏真实、多样化面试材料的问题。数据集包含两万个独特的面试问答对,通过本地运行大型语言模型(使用 Ollama 和 NVIDIA RTX 3080 GPU)并采用高级提示工程技术生成,模拟了不同职位、行业部门、面试官人设和难度等级的面试场景。每个样本包含以下字段:面试问题(question)、模型生成的参考答案(answer)、领域特定的可搜索关键词(keywords)、职位名称(role,如数据科学家、软件工程师)、行业部门(sector,如金融、医疗保健)、面试轮次类型(interview_stage)、面试官人设/语气(interviewer)、问题子类别(question_category,如系统设计)以及难度/资历等级(question_level)。数据集经过严格的探索性数据分析验证,确保其在难度分布、问题类别覆盖、行业部门分布上保持平衡,文本长度自然,关键词相关,且几乎没有重复内容。情感分析进一步证实了面试官人设(如“支持性”或“攻击性”)在问题语气中得到准确体现。该数据集适用于文本生成、问答系统、面试模拟、职业培训等任务,并为人力资源和招聘相关研究提供行业无关的多样化语料。
数据集概述
地址:https://huggingface.co/datasets/Davichick/InterviewForge_GenDS
许可证:MIT
语言:英语(en)
任务类型:文本生成、问答
标签:面试、面试问题、职业、合成数据、大语言模型生成、人力资源、招聘、问答
数据规模:10,000 至 100,000 条
数据集配置:一个默认配置(default),包含一个训练集(train)文件,格式为 CSV(interview_forge_v3_complete.csv)
数据集描述
该数据集是一个合成的面试问答数据集,旨在为数据科学和工程教育提供真实、有挑战性的面试练习材料。作者使用本地 PC 上的 NVIDIA RTX 3080 显卡运行 Ollama,通过高级提示工程技术(包括角色扮演、少样本提示和严格 JSON 格式输出)生成了数据集。数据集包含两万条独特的面试问答对。
数据集结构
| 列名 | 类型 | 描述 |
|---|---|---|
| question | 字符串 | 大语言模型生成的面试问题 |
| answer | 字符串 | 模型生成的黄金标准答案 |
| keywords | 字符串 | 领域相关的可搜索关键词 |
| role | 字符串 | 职位名称(例如:数据科学家、软件工程师) |
| sector | 字符串 | 行业领域(例如:金融、医疗) |
| interview_stage | 字符串 | 面试阶段类型 |
| interviewer | 字符串 | 面试官的角色/语气 |
| question_category | 字符串 | 问题的子类别(例如:系统设计) |
| question_level | 字符串 | 难度/资历级别 |
探索性数据分析(EDA)
作者对生成数据进行了严格的探索性数据分析,以保证质量与多样性,包含以下维度:
- 类别分布:数据集在各难度级别、问题类别和行业领域上分布均衡,未过度偏向任何单一技能或行业。
- 文本长度分析:生成的问题简洁直接,答案深度适中,不显得冗长。
- 关键词存在性:模型成功注入了具体、相关的技术术语,避免泛泛之词。
- 近似重复检测:使用 TF-IDF 余弦相似度检测,几乎所有相似度接近零,无高相似度重复对,保证数据唯一性。
- 角色关键词对齐:验证了问题内容与对应职位的技术术语匹配度,并针对性地优化了验证规则。
- 情感分析:验证了面试官语气(如“攻击性”或“友好”)在问题中的情感倾向,证明提示工程成功操控了语言模型的语气。




