遇见数据集

lexi-grader-sft

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集名为 qninhdt/lexi-grader-sft,由教师模型生成的句子评分训练数据组成。数据集的目标是训练一个句子评分器:给定一个学习者的英语句子和一个目标词的特定词典义项,模型应生成内联纠错、一个意义等级(0-4)以及一行反馈。数据构建分为两步:首先,Diversifier 根据学习者的背景、目标等级和错误配方等规范生成类似于学习者风格的句子;然后,Grader 只看到{目标词、义项、文本}并输出答案。数据集包含 12454 个生成的学习者句子,其中 12103 个被接受的评分,覆盖 2000 个不同的词典义项。数据分为训练集(9545 行)、验证集(1251 行)和测试集(1307 行),按目标词分组,不同划分之间没有重叠句子。每个样本包含三个字段:correction(内联纠错,使用标记语法如 [speak>speaks:agr] 表示替换,[the>:art] 表示删除,[>to the:art] 表示插入)、meaning(0-4 的整数等级,含义分别为 0: 16.7%, 1: 21.6%, 2: 1.1%, 3: 18.8%, 4: 41.9%)、feedback(一行文本反馈)。错误标签分布包括 art、prep、agr、tense、word、form、num、order、unnat、coll、pron、poss、sp、punc、part、other 等。注意事项:数据没有人工黄金集,所有标签都是教师模型的观点;句子是模型模仿学习者错误生成的,并非真实学习者数据;等级未校准(band_config.json 中 calibrated 为 false);反馈未评估;语法和自然度等级基于纠错标签的公式计算,但未校准。数据集许可证为 other,适用于文本生成任务,语言为英语。

This dataset is named qninhdt/lexi-grader-sft, consisting of sentence scoring training data generated by a teacher model. The goal of the dataset is to train a sentence scorer: given a learners English sentence and a specific dictionary sense of a target word, the model should generate inline corrections, a meaning level (0-4), and a line of feedback. The data construction is divided into two steps: first, the Diversifier generates sentences similar to the learners style based on specifications such as the learners background, target level, and error recipe; then, the Grader only sees {target word, sense, text} and outputs the answer. The dataset contains 12,454 generated learner sentences, of which 12,103 are accepted scores, covering 2,000 different dictionary senses. The data is split into training set (9,545 rows), validation set (1,251 rows), and test set (1,307 rows), grouped by target word, with no overlapping sentences between splits. Each sample includes three fields: correction (inline corrections using markup syntax such as [speak>speaks:agr] for replacement, [the>:art] for deletion, [>to the:art] for insertion), meaning (integer level 0-4, with percentages: 0: 16.7%, 1: 21.6%, 2: 1.1%, 3: 18.8%, 4: 41.9%), and feedback (a line of text feedback). Error tag distribution includes art, prep, agr, tense, word, form, num, order, unnat, coll, pron, poss, sp, punc, part, other, etc. Notes: The data has no human gold standard; all labels are the teacher models perspective; the sentences are generated by the model imitating learner errors, not real learner data; the levels are not calibrated (band_config.json shows calibrated as false); feedback is not evaluated; grammar and naturalness levels are computed based on a formula of error tags but are not calibrated. The dataset license is other, suitable for text generation tasks, and the language is English.

创建时间:
2026-08-07
原始信息汇总

数据集概述:qninhdt/lexi-grader-sft

基本信息

  • 任务类型:文本生成(text-generation)
  • 语言:英语
  • 标签:语法错误纠正、语言学习、知识蒸馏
  • 许可证:其他(other)
  • 数据规模:1K-10K 样本

数据集内容

该数据集用于训练句子评分器:给定学习者的英语句子和一个目标词的具体词典义项,生成:

  • 行内纠错(inline correction)
  • 含义等级(meaning band,0-4)
  • 一条反馈(feedback)

包含:

  • 12,454 条生成的学习者句子(raw/raw_texts.parquet
  • 12,103 条被接受的评分结果(raw/raw_labels.parquet
  • 2,000 个不同的词典义项

数据划分

划分 行数
train 9,545
val 1,251
test 1,307

按目标词分组,不同划分间无句子重叠,验证阶段未拒绝任何样本。

数据格式

纠错使用标签语法,例如: json { "correction": "He [speak>speaks:agr] very [eloquent>eloquently:form].", "meaning": 3, "feedback": "Right sense, but the verb needs to agree with the subject." }

纠错操作包括:

  • 替换:[A>B:tag]
  • 删除:[A>:tag]
  • 插入:[>B:tag]

干净句子原样输出;不可读句子返回 correction: nullgrammarnaturalness 根据纠错标签计算,而非模型生成。

构建方法

采用两步式流程:

  1. 多样化器:根据规范生成学习者风格文本
  2. 评分器:仅基于 {target, sense, text} 生成答案

关键参数:

  • 教师模型zm1/zyloo/gemini-3.1-pro-preview(通过端点报告,未独立验证)
  • 端点https://api.vilao.ai/v1
  • 格式有效性:0.9475
  • 批量多样性 (distinct-2):0.9367

数据分布

含义等级分布

meaning 行数 占比
0 2,017 16.7%
1 2,611 21.6%
2 128 1.1%
3 2,281 18.8%
4 5,066 41.9%

中段等级(1-3)占总行数的 42.69%。

错误标签分布

常见标签包括:art (4,317)、prep (3,018)、agr (2,202)、tense (2,110)、word (2,055)、form (1,905)、num (1,800)、order (1,355),以及其他15个标签。

质量限制

  • 无人工金标准:所有标签均来自教师模型输出
  • 真实学习者分布未验证:句子为模型模拟的学习者错误
  • 等级未校准band_config.json"calibrated": false
  • 反馈质量未评估:无相关指标
  • grammar 和 naturalness 未校准:基于设计猜测,非语料库惩罚分布;由于81%行无 usage 错误,校准产生重复切点

未包含内容

W&I+LOCNESS 转换的 A 阶段纠错格式数据不包含在此数据集中,因其许可证禁止向第三方再分发。

搜集汇总
数据集介绍
lexi-grader-sft 数据集图片
构建方式
该数据集由教师模型通过两阶段调用构建,旨在生成用于句子评分模型的监督微调数据。首先,一个多样化器根据学习者画像、目标语言水平和错误配方生成模拟学习者风格的句子,这些设计参数作为多样性控制信息而非标签;随后,评分器仅基于目标词、词义和句子文本,输出内联纠错、意义等级(0-4)和一条反馈信息。这种分离式构建方式避免了单次自动标注中标签描述指令而非文本的问题,确保了数据的可靠性。数据覆盖了2000个不同的词典义项,共计12454条生成的句子和12103条被接受的评分。
特点
数据集具有显著的结构化特点。每条数据包含标准化的纠错格式(如替换、删除、插入操作),且语法和自然度评分由纠错标签的公式计算得出,而非模型生成,保证了相同错误集合的评分一致性。数据按目标词分组划分训练、验证和测试集,且无跨集句子重复。质量分布上,意义等级分布不均,中间等级占42.69%,错误标签覆盖了冠词、介词、一致性等16种类型。但需注意,数据未经过人工金标准验证,且真实学习者分布未得到验证。
使用方法
使用时,数据集可直接用于训练句子评分模型或进行序列到序列的文本生成微调。推荐采用监督微调方式,模型输入为目标词、词义和句子文本,输出格式遵循JSON结构,包含纠错、意义等级和反馈。由于意义等级分布不均衡,建议采用加权损失或分层采样。此外,数据集的评分阈值可通过band_config.json调整,无需重新生成数据。使用前需注意其局限,如需校准意义等级和语法、自然度评分,且需遵守数据许可限制。
背景与挑战
背景概述
lexi-grader-sft数据集由研究者于2026年创建,旨在为语言学习者提供细粒度的句子评分训练数据。该数据集源自教师模型生成,包含超过1.2万条学习者句子及其对应的修正、意义等级和反馈,覆盖2000个词典义项。其核心研究问题在于如何自动评估学习者句子的语法正确性和自然度,并为教师提供可解释的修正建议。该数据集在语法错误纠正(GEC)和语言学习领域具有潜在影响力,为构建更智能的写作辅导系统提供了数据基础。
当前挑战
构建该数据集面临的挑战包括:首先,领域问题层面,学习者句子的错误模式多样且复杂,传统GEC系统难以精准定位并分类错误,而该数据集通过标记化修正方案(如'[speak>speaks:agr]')明确错误类型,但如何确保标签的一致性和可解释性仍是一大挑战。其次,构建过程中,数据生成依赖教师模型,缺乏人类金标准验证;同时,生成的学习者句子基于模型模仿,可能偏离真实学习者分布,存在数据代表性不足的问题。此外,意义等级和自然度评分尚未经过校准,反馈质量缺乏评估指标,这些都限制了数据集的可靠性和泛化能力。
常用场景
经典使用场景
lexi-grader-sft数据集专为句子评分任务而设计,它基于词典释义,对学习者生成的英语句子进行逐句的内联纠错、语义层级(0-4级)标注及个性化反馈。该数据集的核心使用场景在于训练和评估文本生成模型,使其能够模仿教师行为,针对给定的目标词汇及其特定词典义项,输出格式规范的修正结果。在语言教育技术领域,这一数据集使得模型能够学习到细粒度的错误识别与纠正能力,并生成符合教学语法的反馈,从而为自动化写作辅导系统提供关键的训练数据支持。
实际应用
在实际应用中,lexi-grader-sft可直接用于开发智能写作助手、语言学习APP及在线教育平台的实时反馈模块。例如,在词汇练习场景中,当学生尝试使用特定高级词汇造句时,系统能基于该数据集训练的模型,即时提供内联修正(如“He [speak>speaks:agr] very [eloquent>eloquently:form]”),并给出关于词义匹配和语法正确性的评分与反馈,从而辅助学生自我纠错。这种细粒度的纠错与反馈机制,不仅能够提升学习者的写作准确度,还能培养其语言意识,弥补了传统工具只改错不解释的不足。
衍生相关工作
该数据集的发布催生了多方面的衍生研究。其一,由于数据集中包含丰富的错误标签分布(如冠词、介词、主谓一致等),研究者可基于此训练专门的错误类型分类器,或改进GEC系统的错误检测能力。其二,数据集的“语义层级”标注设计,启发了针对词义区分与语境适配的研究,促进了对一词多义现象的建模。其三,构建过程中采用的双阶段生成策略(先多样化生成再评分),为后续数据合成工作树立了范式,推动了利用大型语言模型生成高质量训练数据的研究,例如在低资源语言教育任务中采用类似方法。此外,关于“band calibration”的讨论也引发了对自动评估指标标定方法的深入探索,促进了可信赖教育AI系统的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务