遇见数据集

viorra-admissions-essays

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

VIORRA Admissions Essays 数据集是一个经过精心整理和验证的数据集,包含59篇成功帮助申请者获得精英大学录取的个人陈述(650词Common App风格文书),并附有来自大学招生委员会的真实、直接的结构性批评反馈。本数据集专为教育技术(EdTech)人工智能模型的检索增强生成(RAG)流程而设计,旨在为大型语言模型(LLM)提供基于现实世界精英录取标准的深度反馈逻辑基础,使其超越通用的“语法检查”建议,提供符合常春藤联盟招生标准的深层、结构性反馈。数据内容为纯英文,每个样本包含Essay(个人陈述全文)、Score(基线分数,默认为95)、Feedback_cleaned(招生委员会官方评论)和Marker_used(元数据标记)四个字段。数据来源于约翰霍普金斯大学官方公开发布的“Essays That Worked”文集(2025至2029届),原始论文由被录取的真实高中生撰写,反馈由本科招生委员会提供,通过自动化Python抓取和解析处理以保持真实性。数据集适用于构建RAG系统改进AI反馈生成、训练自动作文评分模型,以及作为教育研究工具,但根据CC BY-NC 4.0许可协议,禁止用于训练AI模型代写论文(剽窃生成)和未经许可的商业用途,并存在机构偏见(偏向约翰霍普金斯大学特质)和幸存者偏差(仅含成功论文)。

The VIORRA Admissions Essays dataset is a meticulously curated and validated collection containing 59 personal statements (650-word Common App style essays) that successfully helped applicants gain admission to elite universities, accompanied by real, direct structural critique feedback from university admissions committees. This dataset is specifically designed for the Retrieval-Augmented Generation (RAG) process of educational technology (EdTech) AI models, aiming to provide a deep feedback logic foundation for large language models (LLMs) based on real-world elite admission standards, enabling them to go beyond generic grammar check suggestions and offer deep, structural feedback aligned with Ivy League admissions criteria. The data content is entirely in English, with each sample including four fields: Essay (full text of the personal statement), Score (baseline score for accepted essays, defaulting to 95), Feedback_cleaned (official comments from the admissions committee explaining the essays success), and Marker_used (metadata marker used by automated scraping tools to separate essays and feedback). The data is sourced from Johns Hopkins Universitys publicly released Essays That Worked collections (for the classes of 2025 to 2029), with original essays written by real high school students admitted to Johns Hopkins and feedback provided by the universitys undergraduate admissions committee, processed through automated Python scraping and parsing to preserve authenticity. The dataset is suitable for building RAG systems to improve AI feedback generation, training or fine-tuning automated essay scoring models based on elite university grading standards, and serving as an educational tool for students to research successful essay examples. Under its CC BY-NC 4.0 license, it is strictly prohibited for training AI models to write essays for students (plagiarism generation) or for commercial use without separate written permission from the authors, and it notes institutional bias (feedback favoring traits valued by Johns Hopkins) and survivor bias (including only successful essays).

创建时间:
2026-06-01
原始信息汇总

数据集概述:VIORRA Admissions Essays

该数据集包含59篇经过严格筛选的大学入学个人陈述(Common App风格,650词),每篇均配有招生委员会的官方反馈和评论,旨在提升AI在入学文书评审方面的反馈质量。

核心信息

  • 许可证: CC BY-NC 4.0(非商业用途)。
  • 语言: 英语。
  • 创建者: Sardor & The Antigravity AI Agent Team。
  • 数据来源: 约翰霍普金斯大学官方“Essays That Worked”资料库(2025至2029届)。
  • 数据大小: 下载大小178,333字节,数据集总大小259,224字节。
  • 数据拆分: 仅包含训练集(train),共59个样本。

数据集结构

每个数据点包含以下字段:

  • Essay (string): 被录取学生的个人陈述全文。
  • Score (int64): 基准分数,默认值为95。
  • Feedback_cleaned (string): 招生委员会对文章成功原因的官方评语。
  • Marker_used (string): 用于从原文中分离文章与反馈的标记字符串。

数据用途

  • 直接用途:
    • RAG系统: 将真实作文与评语注入大语言模型上下文,改进AI反馈生成。
    • 自动作文评分: 基于藤校评分标准训练或微调模型。
    • 教育工具: 为学生提供成功申请文书的数据库。
  • 超出范围的使用:
    • 禁止用于训练AI代写作文。
    • 未经许可禁止商业使用。

数据创建与处理

  • 收集方法: 使用 trafilatura 库从HTML页面自动抓取原始文本。
  • 处理方法: 通过解析算法识别内部标记(如“Admissions Committee Comments”),将学生作文与大学反馈分离。
  • 注释: 未进行二次注释,保留原始文本和官方反馈的完整性。注释者为约翰霍普金斯大学本科招生委员会。
  • 隐私信息: 大学在公开发布前已对高度敏感的个人身份信息(如姓氏、完整地址)进行脱敏处理。

偏见、风险与局限性

  • 机构偏见: 数据主要来自约翰霍普金斯大学,反馈偏好该校看重的特质(如求知欲、研究能力、协作精神),与其他名校可能存在差异。
  • 幸存者偏差: 仅包含成功录取的文书,缺少失败案例作为对比。
  • 建议: 若用于构建通用入学指导系统,应结合其他院校的多样化样本以平衡偏差。

引用

若在研究中引用本数据集,请使用以下格式:

bibtex @dataset{viorra_admissions_essays_2026, author = {Sardor}, title = {VIORRA Admissions Essays Dataset}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/qsardor/viorra-admissions-essays}, license = {CC BY-NC 4.0} }

联系方式

搜集汇总
数据集介绍
viorra-admissions-essays 数据集图片
构建方式
在精英大学录取竞争日益激烈的背景下,高质量的文书辅导工具亟需真实、权威的反馈数据作为支撑。本数据集通过自动化Python爬虫管线,从约翰·霍普金斯大学官方公布的“成功入学文书”库中(覆盖2025至2029届)提取原始文本。随后,利用精密的解析算法识别文本中的内部标记,如“招生委员会评语”,将学生文书与官方反馈进行清晰分离。所有数据均以原始形式保存,未进行二次人工标注,确保了地面真相的完整性。
特点
该数据集汇聚了59篇经过严格筛选的650字通用申请文书,每篇均附有招生委员会的真实现场评语与结构化的评分。其独特之处在于,评语摒弃了肤浅的语法纠错,直击叙事钩子、机构契合度等菁英大学核心评估维度。数据集中还包含了用于区分文书与反馈的元数据标记,特别适合用于检索增强生成管线,为教育科技人工智能提供从“纠错型”向“战略型”反馈跃迁的标杆范例。
使用方法
用户可将该数据集直接注入大语言模型的上下文窗口,驱动检索增强生成系统生成符合常春藤联盟标准的深度反馈。它亦适用于自动化文书评分模型的微调,或作为成功案例库供学生研习。使用时需注意,数据集来源单一,存在机构偏好偏差,且仅包含成功案例,建议结合其他院校样本以构建通用的辅导模型。数据集仅限非商业用途,并需遵循CC BY-NC 4.0许可协议进行引用。
背景与挑战
背景概述
在高等教育竞争日趋激烈的背景下,大学入学文书作为申请材料中的关键一环,往往承载着展现申请者独特性格与学术潜力的重任。VIORRA Admissions Essays数据集由Sardor与Antigravity AI Agent团队于2026年创建,核心旨在为检索增强生成(RAG)管道提供高质量的精英级个人陈述及其官方评审反馈。该数据集收录了59篇经过严格筛选的Common App风格文书,均来自约翰·霍普金斯大学官方公布的“Essays That Worked”系列(2025至2029届),并附有招生委员会的结构化评语。这一资源填补了教育技术领域中缺乏高保真、符合藤校标准评审逻辑的数据空白,对推动AI辅助文书反馈系统的深度革新具有奠基性意义。
当前挑战
该数据集所应对的领域核心挑战在于,现有通用AI写作助手对大学文书的评估往往流于表面,仅关注语法与基础结构,无法提供如“叙事钩子”或“院校契合度”等顶尖学府所看重的深层结构性反馈。为此,数据集构建过程需克服三重技术难题:其一是从约翰·霍普金斯大学公开的HTML页面中,利用trafilatura库搭建自动化爬取管道,高效提取原始文本;其二是设计解析算法精准识别如“Admissions Committee Comments”等内部标记,将学生文书与官方评语干净分离;其三是确保数据集的真实性与可溯源性,严格保留原文及官方反馈的逐字内容,避免任何人工重注释,从而维护标杆评审逻辑的完整性。
常用场景
经典使用场景
在自然语言处理与教育科技交叉领域中,VIORRA Admissions Essays数据集被广泛应用于构建检索增强生成(RAG)流水线。该数据集包含59篇经名校招生委员会官方点评的精英大学入学申请文书,每篇文书均配有结构化的招生反馈。研究者常将其注入大语言模型的上下文窗口,使模型摆脱仅提供语法修正的浅层建议,转而生成符合藤校录取标准的深度结构性评语,从而显著提升AI在文书辅导场景中的专业性与可信度。
实际应用
在实际教育科技落地中,该数据集赋能智能申请辅导系统实现范式突破。基于其构建的RAG系统可实时对比用户文书与真实成功案例,并提供契合藤校评价体系的修改建议。诸如VIORRA Admissions Coach AI等开源工具已将其集成,帮助学生在叙事结构、主题选择与情感张力等层面获得招生官视角的指导。该数据亦被用于开发留学生咨询服务中的辅助教学模块,通过解码录取委员会内部反馈逻辑,缩小申请者与理想院校之间的认知鸿沟。
衍生相关工作
围绕该数据集衍生了多项具有代表性的学术与工程实践。研究者基于其构建了精英文书结构化知识库,探索了RAG嵌入策略对反馈生成质量的影响。部分工作将其与多源名校数据集融合,以缓解单一院校偏好带来的偏见。另有一些实证研究对比了基于该数据微调与提示工程方法在AES任务上的表现差异,验证了真实招生反馈对模型决策边界校正的有效性。这些工作共同推动了可解释、高保真的教育AI系统在高等教育选拔场景中的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务