遇见数据集

Ai_interview

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Edudiagno发布目录是一个用于教育评估和招聘面试的题库数据集,专为桌面应用程序设计。它包含三种核心问题类型:多项选择题(MCQ)共1,017道,涵盖不同类别和难度;编程问题共1,071道,附带5,337个测试用例,每个问题包括问题描述、起始代码、时间限制和测试用例;面试问题池共25个池,每个池针对特定职位包含500个问题,总计12,500个问题。数据结构采用JSON和CSV格式,包括目录索引、评估定义文件、职位特定面试池以及共享的MCQ和编程题库。数据规模总计超过1,017道MCQ、1,071道编程问题(5,337个测试用例)和12,500个面试问题,编程问题的预期输出通过执行参考代码自动生成,确保评估准确性。该数据集适用于构建自动化评估系统、在线编程测试、技术面试模拟以及教育领域的技能评估,支持教师创建定制化评估,系统会从公共题库中随机抽取问题,确保不同考生获得不同的试卷,并采用校验和同步机制支持增量更新和高效分发。

The Edudiagno Release Catalog is a question bank dataset designed for educational assessment and recruitment interviews, purpose-built for desktop applications. The dataset contains standardized question resources for constructing online assessments and interviews, covering multiple-choice questions, programming problems, and position-specific interview questions. Data Content and Structure: The dataset includes three core question types: 1) Multiple-Choice Questions (MCQs), with a total of 1,017 questions spanning various categories and difficulty levels; 2) Programming problems, totaling 1,071, accompanied by 5,337 test cases. Each problem comprises a problem description, starter code, time limit, and test cases; 3) Interview question pools, consisting of 25 pools in total, with each pool containing 500 questions tailored for specific positions, amounting to 12,500 questions overall. The dataset is stored in JSON and CSV formats, including directory indexes, assessment definition files, position-specific interview pools, and shared MCQ and programming question banks. Data Scale: In total, the dataset contains over 1,017 MCQs, 1,071 programming problems (paired with 5,337 test cases), and 12,500 interview questions. The expected outputs for programming problems are automatically generated by executing reference code to ensure assessment accuracy. Applicable Tasks and Application Scenarios: This dataset is suitable for building automated assessment systems, online programming tests, technical interview simulations, and skill assessments within the education sector. It enables educators to create customized assessments, where the system randomly selects questions from the public question bank to ensure that different test takers receive distinct exam papers. The dataset adopts a checksum synchronization mechanism, supporting incremental updates and efficient distribution.

创建时间:
2026-07-20
原始信息汇总

数据集概述

该数据集是 Edudiagno 桌面应用程序的离线目录和题库,用于支持技术面试的自动化评估。数据集以 JSON 文件形式组织,包含多选题(MCQ)、编程题和面试问题池。

数据集结构

数据集根目录包含以下核心文件:

  • catalog.json:主索引文件,应用程序首先读取。
  • assessment_<key>.json:每个评估的配置文件(如 assessment_backend-python.json),定义了评估的标题、岗位、难度、题目数量和时间限制等参数。
  • <position>.json:特定岗位的面试问题池文件(如 frontend.jsonjava-backend.json),包含一系列面试问题字符串。
  • mcq_common.json:共享的多选题池,所有评估通用。
  • coding_common.json:共享的编程题池,所有评估通用。
  • index.csv:岗位与面试池的映射查找表。

题目数量

  • 1,017 道多选题
  • 1,071 道编程题(包含 5,337 个测试用例)
  • 25 个面试问题池(每个池包含 500 道问题,总计 12,500 道)

问题池类型

特性 面试池 通用池
文件 frontend.json, java-backend.json mcq_common.json, coding_common.json
范围 按岗位划分,与特定职位绑定 所有评估共享
下载方式 仅当评估使用时才下载 每次同步都会下载
用途 AI 面试环节 多选题和编程题环节

通用池中的题目在每次考试时会随机抽取子集,确保同一评估的不同候选人拿到不同的试卷。

题目格式

多选题格式

json { "text": "Which data structure uses FIFO ordering?", "options": ["Queue", "Stack", "Tree", "Graph"], "correct_index": 0, "category": "Data structures", "difficulty": "easy" }

  • 构建时会自动打乱选项顺序。

编程题格式

json { "title": "Sum of numbers", "category": "Arrays", "difficulty": "easy", "statement": "Read a line of space-separated integers and print their sum.", "starter_code": "import sys

def main(): ... ", "time_limit_secs": 5, "tests": [{"input": "3 7 11 ", "expected": "21"}] }

  • 所有 expected 值通过执行参考解决方案自动生成,确保正确性。

更新与同步机制

  • 向已发布的池中追加新问题是扩充题库的支持方式,无需特殊处理。
  • 同步机制基于 SHA256 校验和驱动:
    • 未更改的文件不会重新下载。
    • 已更改的文件会被下载、校验并合并,合并操作是幂等的,仅插入真正的新条目。
  • 已知限制:直接编辑已存在的问题不会传播到已安装的机器,因为匹配基于文本内容。若需修正错误答案,需同时修改题目文本。
  • 更新评估的元数据(如职位描述、标题)只需编辑对应的 assessment_<key>.json 文件并重新构建上传,教师设置(如题目数量、时长、优先级)不会被覆盖。

注意事项

  • 所有 JSON 文件均由构建脚本自动生成,不应手动编辑。
  • 编程题的预期输出必须通过运行参考解决方案计算,不得手写,否则会导致正确代码被判定为错误。
搜集汇总
数据集介绍
Ai_interview 数据集图片
构建方式
Ai_interview数据集由Edudiagno桌面应用的后端目录演化而来,其核心构建哲学强调自动化与精确性。数据集的生成依托于Python脚本,通过执行参考解决方案动态计算每个编程问题的预期输出,从而避免手工录入可能引入的微妙错误。当前版本包含1017道选择题、1071道编程题(涵盖5337个测试用例),以及25个面向不同岗位的面试题库,每个题库包含500道问题,总计12500道。数据集采用JSON格式组织,通过catalog.json文件作为索引,所有文件通过校验和驱动的同步机制分发至已安装的机器,确保增量更新的高效与数据一致性。
特点
该数据集的一大特色在于其双层池化结构:面试题库按岗位角色划分(如前端、Java后端),而选择题与编程题则共享于公共池中,供所有测评使用。每次考试从公共池中随机抽取全新子集,确保不同考生不会拿到相同试卷。面试题库规模建议超过50道以减少考生间的题目重叠。数据集的同步采用双向校验和机制,仅下载变更文件,极大优化了网络带宽与存储开销。合并操作基于文本匹配实现幂等性,新问题被添加,重复项被忽略,但现有问题的原地修改不会传播,这一设计虽限制灵活性,但保证了历史数据的稳定性。
使用方法
教师可通过编写岗位专属JSON面试题库与测评配置文件来扩展数据集。面试题库需遵循一问一概念、口语可答、避免是非问句等规则,测评文件则需指定岗位ID、题目数量与时长等参数。随后运行build_catalog.py脚本重建索引与校验和,最后将变更文件上传至Hugging Face数据集即可实现全球分发。选择题格式包含文本、选项、正确答案索引、类别与难度,编程题则要求提供标题、类别、描述、起始代码、时间限制及测试用例。所有预期输出必须通过执行参考解决方案生成,而非手动编写,以确保评分准确性。
背景与挑战
背景概述
在人工智能技术迅猛发展的今天,智能面试系统已成为人才评估领域的重要工具,能够高效、客观地衡量候选人的专业技能与问题解决能力。Ai_interview数据集由Edudiagno团队创建,旨在为AI驱动的技术面试提供结构化、可扩展的评估资源。该数据集不仅涵盖了1017道多选题与1071道编程题(包含5337个测试用例),还设计了25个岗位专属的面试题库,每个题库包含500道题目,总计12500道面试问题。其核心研究问题在于如何通过自动化的题目生成与校验机制,确保评估的公平性与准确性。该数据集通过构建时执行参考代码生成预期输出,避免了手动编写答案可能带来的错误,显著提升了评估的可靠性,对技术人才筛选与教育评估领域产生了深远影响。
当前挑战
Ai_interview数据集所解决的领域问题主要在于传统技术面试中存在的主观性强、标准不一和效率低下等挑战,特别是在编程能力评估中,手动编写的预期输出可能因细微错误而导致对候选人的误判。在构建过程中,数据集面临的挑战包括:如何确保题库的广泛覆盖性与岗位匹配度,避免题目内容重复或版权侵权;如何设计高效的同步机制,使得题目更新能够及时、准确地传播至所有安装实例,且不造成不必要的网络负载;以及如何处理已发布题目的修正问题,因为在文本匹配机制下,对已有题目答案的修改无法自动传播至已导入的机器,这要求开发者在修正错误时同步调整题目表述,增加了维护的复杂性。
常用场景
经典使用场景
Ai_interview 数据集专为技术人才智能评估场景而构建,广泛应用于自动化面试与编程能力测试领域。其核心设计涵盖三种评估模式:基于多选题(MCQ)的基础知识测评、基于编程题的代码能力考核,以及面向特定岗位的面试问题池。该数据集模拟真实招聘流程,支持从题库中随机抽题,确保每位候选人的试卷具备差异性与公平性,为研究者提供了构建智能招聘系统、实现自动化人才筛选的标准化数据基础。
解决学术问题
该数据集有效解决了技术面试评估中的标准化与规模化难题。传统面试依赖人工出题与主观评判,易出现偏差且难以覆盖大规模应聘者。Ai_interview 通过结构化题库与自动化测试用例执行机制,确保了评估结果的一致性与客观性。其设计考虑了考题难度分级、岗位匹配与随机抽题策略,为计算机科学教育评估、人力资源自动化、智能问答系统等学术领域提供了可复现的实验基准,推动了人才选拔过程的科学化与公平化。
衍生相关工作
基于 Ai_interview 的设计范式,已衍生出多项经典工作,包括自动化面试评分模型、编程题代码相似度检测系统以及自适应测试难度调节算法。研究者利用其结构化题库训练大语言模型,用于生成面试追问或评估候选人口头回答的质量。另有工作聚焦于利用测试用例执行结果分析错误类型,构建学生编程能力画像。这些衍生研究不仅丰富了智能评估领域的理论与实践,也推动了从静态题库到动态交互式评估系统的技术演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务