遇见数据集

FOXGLOVE

收藏
arXiv2026-06-04 更新2026-06-08 收录
官方服务:

资源简介:

FOXGLOVE是由伊利诺伊大学厄巴纳-香槟分校研究团队构建的写作反馈数据集,旨在系统比较专家与大型语言模型在议论文反馈上的差异。该数据集包含2,340条评论,基于69篇高中12年级议论文,涵盖696条训练有素的写作导师评论和1,644条来自GPT-5.2、Claude Sonnet 4.5等四个前沿模型的生成评论,每篇文章平均约423词。数据创建过程遵循统一的反馈协议,包括句子级锚定、目标导向标签和紧迫性排名标注,通过独立专家注释与模型提示生成并行收集。该数据集主要应用于教育技术领域,旨在探究人类与AI反馈在目标定位、文本锚定和优先级排序等维度的对齐与分歧,为智能化写作辅助工具的开发提供实证基础。

FOXGLOVE is a writing feedback dataset developed by the research team at the University of Illinois Urbana-Champaign, which aims to systematically compare the differences between human experts and large language models (LLMs) when providing argumentative writing feedback. The dataset consists of 2,340 comments derived from 69 12th-grade high school argumentative essays, including 696 comments from professionally trained writing tutors and 1,644 generated comments from four cutting-edge models such as GPT-5.2 and Claude Sonnet 4.5. Each essay has an average length of approximately 423 words. The dataset was constructed following a unified feedback protocol that covers sentence-level anchoring, goal-oriented labeling, and urgency ranking annotation, and was collected in parallel through independent expert annotations and model prompt-based generation. This dataset is primarily applied in the field of educational technology, with the goal of investigating the alignment and divergence between human and AI feedback across dimensions including goal orientation, text anchoring, and priority ranking, thereby providing an empirical foundation for the development of intelligent writing assistance tools.

创建时间:
2026-06-04
原始信息汇总

数据集概述

FOXGLOVE(FOrmative feedback from eXperts, with Goal-oriented, Localized annotatiOns and eValuations of student Essays)是一个面向12年级议论文写作反馈的平行数据集,旨在系统比较人类专家与前沿大语言模型在写作反馈上的差异。

核心特点

  • 数据来源:69篇来自PERSUADE 2.0语料库的12年级议论文
  • 反馈来源:14名经过培训的写作指导教师,以及4个大语言模型(GPT-5.2、Claude Sonnet 4.5、Llama 3.3 70B、Qwen3-Next 80B)
  • 数据规模
    • 人类反馈评论:696条
    • 大语言模型反馈评论:1,644条
    • 反馈评论总计:2,340条
    • 专家质量评级:1,430条(覆盖7个维度,由2名额外评分员对105条评论进行评分)

反馈结构设计

每位反馈提供者(人类或模型)均按照统一纲要为每篇论文生成反馈:

  1. 句子级评论:锚定到连续句子,并标注为五种议论文目标之一(立场、论点、证据、反驳、反驳论证)
  2. 优先级排序:每篇论文中选出最重要的三条句子级评论(排名1–3)
  3. 全局评论:每篇论文一条自由文本评论,综合说明论文与议论文目标的契合度

文件结构

文件名 描述
essay_goals.csv 包含12年级源论文全文及每位反馈提供者被要求关注的三个议论文目标
feedback.csv 所有人类与模型的反馈评论,一行一条评论
ratings_global.csv 专家对全局评论在6个质量维度的评分
ratings_items.csv 专家对句子级评论在7个质量维度的评分

essay_goals.csv 字段

  • essay_id:匿名化论文标识符(关联至PERSUADE 2.0)
  • Essay Contents:论文全文
  • goal_1 / goal_2 / goal_3:呈现给反馈提供者的议论文目标

feedback.csv 字段

  • essay_id:评论对应的论文
  • model:反馈来源(human 或模型名称)
  • reviewer_id:匿名化评论者标识符(如R1、R2)或模型名称
  • goal_addressed:目标(立场、论点、证据、反驳、反驳论证或全局)
  • urgency_rank:1(最紧急)、2、3(未排名则为空)
  • feedback_content:自由文本反馈评论
  • sentences_or_sections:评论锚定的论文文本高亮片段(全局评论为空)

ratings_global.csvratings_items.csv 字段

  • rater_id:匿名化评分员(如rater1、rater2)
  • essay_id / real_model / reviewer_id:被评分反馈的身份信息
  • anonymous_label:评分员看到的盲化标签(如Feedback Set C)
  • feedback_id(仅句子级):对应feedback.csv中的行
  • 评分维度(1–5李克特量表):accuracy_contentactionabilityclarityrelevancespecificitytone
  • accuracy_position(仅句子级):锚定文本片段的位置准确性(不适用于全局评论)

许可协议

  • 源论文来自PERSUADE 2.0语料库
  • 已移除所有个人身份信息,教师与评分员仅以匿名标识符指代
  • 数据采用CC BY-NC-SA 4.0 DEED Attribution-NonCommercial-ShareAlike 4.0 International许可(https://creativecommons.org/licenses/by-nc-sa/4.0/deed.en)
搜集汇总
数据集介绍
FOXGLOVE 数据集图片
构建方式
FOXGLOVE数据集基于PERSUADE 2.0语料库中69篇12年级议论文构建,由14名受过专业培训的美国写作教师依据统一反馈模式(包括句子级锚定评语、紧迫性排名和全局评语)独立撰写696条反馈,同时以相同协议驱动四种前沿大语言模型(GPT-5.2、Claude Sonnet 4.5、Llama 3.3 70B、Qwen3-Next 80B)生成1644条反馈,共计2340条平行评语,并额外收集了105条评语在七个维度上的专家质量评级。
特点
该数据集独特地融合了目标导向、锚定具体句段和优先级排序三种写作研究确认的关键反馈属性,提供了人类与模型在相同协议下对同一批议论文的平行反馈,并标注了评语所针对的论辩目标(立场、主张、证据、反论点、反驳)和紧迫性等级,同时包含两位独立写作教师对评语在准确性、可操作性、清晰度、具体性、相关性及语气等维度的质量评分。
使用方法
研究者可利用FOXGLOVE系统比较人类与LLM在反馈落点、目标分布和紧迫性判断上的异同,分析评语语言特征(如可读性、代词使用和疑问句频率)的差异,并通过长度校正方法探究评语长度对质量评分的影响。该数据集提供可复用的标注协议和生成代码,支持扩展至更多模型,便于开展受控实验,考察不同来源反馈对学生修改效果的影响。
背景与挑战
背景概述
在人工智能与教育深度融合的浪潮中,大语言模型越来越多地被用于生成写作反馈,但其与人类专家反馈的异同尚缺乏系统性比较。为填补这一空白,来自伊利诺伊大学厄巴纳-香槟分校的研究团队于2025年创建了FOXGLOVE数据集,聚焦于12年级议论文写作反馈中的目标导向性、锚定于具体句段以及优先级排序三个核心维度。该数据集包含14位训练有素的写作教师对69篇作文撰写的696条反馈,以及来自GPT-5.2、Claude Sonnet 4.5、Llama 3.3 70B和Qwen3-Next 80B这四种前沿大模型在相同协议下生成的1644条反馈,共计2340条标注样本,并附有专家对部分反馈的1430次质量评分。FOXGLOVE的发布为系统比较人类与机器在写作反馈中的对齐与分歧提供了宝贵的基准资源。
当前挑战
FOXGLOVE面临的核心挑战在于如何量化和理解人类教师与大语言模型在写作反馈上的本质差异。首先,在领域问题层面,现有数据集均无法同时捕获锚定于具体文本、带有写作目标标签、标注紧迫性等级并涵盖人类与模型平行反馈的完整信息,使得对两者在“何处需要修改”、“针对何种论证目标”以及“哪些反馈最为紧迫”等关键问题上的系统比较成为盲区。其次,在数据集构建过程中,团队面临多重技术挑战:需设计严格统一的反馈模式(包括句子级评论、紧迫性排序和全局评语)以确保可比性;需对四位模型进行多轮验证,手动修正其持续性的引用错误;同时需招募并培训14位写作教师,确保其遵循标准化的标注协议,并在有限预算内完成高质量的人工标注。
常用场景
经典使用场景
FOXGLOVE数据集为探究大语言模型与人类写作导师在提供议论文反馈时的异同提供了系统性的比较基准。该数据集收录了14位专业写作导师对69篇十二年级议论文的696条反馈,以及四种前沿大语言模型在相同协议下生成的1644条反馈,共计2340条带有目标标签、锚定于具体句子且标注了紧急程度的反馈评语。研究者可利用这一对齐于教学实践的语料,深入分析人机反馈在论证目标分配、文本锚点选择、紧急程度排序以及语言风格上的共识与分歧。
解决学术问题
该数据集解决了当前写作反馈研究中缺乏可量化比较人机反馈的平行语料这一关键瓶颈。以往的数据集或仅涵盖人类反馈,或缺少对反馈的细粒度标注如锚定句子与紧急排序,难以支撑系统化的对比分析。FOXGLOVE通过统一协议收集了导师与模型在相同议论文上的反馈,并配备了七个维度的专家质量评分,从而实现了对人机反馈在目标导向性、锚定性、优先级排序等方面的精确统计。它使得研究者能够量化地检验大语言模型反馈是否真正达到了专家级别的精准、具体与可操作。
衍生相关工作
FOXGLOVE衍生了一系列探索反馈质量决定因素与下游效果影响的经典工作。研究者基于其提供的专家评分与长度调整分析,揭示了反馈长度对质量评分的显著驱动作用,进而催生了关于如何平衡反馈详尽度与可读性的深入讨论。此外,该数据集中人机反馈在锚点选择上的有条件重合模式,启发了后续针对不同论证目标设计专门化反馈生成策略的研究。这些工作共同推动了对大语言模型反馈在教育场景中实际有效性的理解,并形成了人机反馈质量对比的标准化评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务