mohamedemam/Essay-quetions-auto-grading
收藏资源简介:
Open Orca Enhanced数据集旨在通过深度学习技术提升自动作文评分模型的性能。该数据集集成了FLAN集合的数据实例,并增加了由GPT-3.5或GPT-4生成的响应,为训练模型提供了多样化和上下文丰富的资源。数据集以表格形式组织,包含唯一标识符、系统提示、问题、响应、标签等关键字段。数据收集过程中,从QuAC数据集过渡到Open Orca数据集,采用RAG技术提高模型准确性。数据增强包括使用教学提示和多阶段过滤过程确保上下文的丰富性。评估显示,数据集在英语和阿拉伯语模型上均表现出色。此外,通过Google Translate将英语数据集翻译成阿拉伯语,创建了多语言资源。
The Open Orca Enhanced Dataset is meticulously designed to improve the performance of automated essay grading models using deep learning techniques. This dataset integrates robust data instances from the FLAN collection, augmented with responses generated by GPT-3.5 or GPT-4, creating a diverse and context-rich resource for training models. The dataset is structured in a tabular format, with key fields including a unique identifier, system prompt, question, response, and label. During data collection, the transition from the QuAC dataset to the Open Orca dataset was made, employing RAG technology to enhance model accuracy. Data augmentation involves the use of instructional prompts and a multi-stage filtering process to ensure contextual richness. Evaluation shows that the dataset performs excellently on both English and Arabic models. Additionally, the English dataset was translated into Arabic using Google Translate, creating a multilingual resource.
Open Orca Enhanced Dataset
概述
Open Orca Enhanced Dataset 旨在通过深度学习技术提升自动作文评分模型的性能。该数据集整合了来自 FLAN 集合的强大数据实例,并增加了由 GPT-3.5 或 GPT-4 生成的响应,创建了一个多样化和上下文丰富的训练资源。
数据结构
数据集以表格格式组织,包含以下关键字段:
- id: 每个数据实例的唯一标识符。
- system prompt: 提供给 GPT-3.5 或 GPT-4 API 的提示。
- question: 来自 FLAN 集合的问题条目。
- response: 从 GPT-3.5 或 GPT-4 收到的响应。
- label: 响应的分类,标记为 "True"(理想响应)或 "False"(生成的接近但不正确的替代方案)。
数据收集与处理
- 初始数据选择: 最初选择了 QuAC 数据集,但由于其局限性,转而使用 Open Orca 数据集,因其结构和数据质量更优。
- 格式转换: 通过识别 "True" 答案为真实答案,并生成 "False" 答案,将 QuAC 的上下文-问题-答案格式进行转换。最初使用 flan T5 模型测试,准确率为 40%。
- RAG 实现: 使用检索增强生成(RAG)选择第三相似答案作为 "False" 响应,显著提高模型准确率至 88%。
数据增强
- 指令提示: 数据集包含指令提示,有助于训练类似 ChatGPT 的模型,显著提高准确性。
- 上下文相关性: 多阶段过滤过程确保保留上下文丰富的提示,从 1,000 个初始提示筛选至与 210 万个样本对齐。
- 标注: 最终数据集包含不仅分类答案为 "True" 或 "False",还提供真实答案的标签,增强模型对上下文和逻辑响应生成的理解。
评估与性能
- 准确性指标: 经过优化的数据集取得了显著的性能:
- 英语 LLM: 97% 准确率。
- 阿拉伯语 LLM: 90% 准确率。
- 模型比较: 将真实答案纳入标签显著提高了模型准确性:
- Flan T5: 从 20% 提升至 83%。
- Bloomz: 从 40% 提升至 85%。
多语言模型翻译
- 阿拉伯语数据集创建: 利用 Google Translate 的先进技术,将强大的英语数据集翻译成阿拉伯语,确保创建真正的多语言资源。Google Translate 的高准确率(82.5%)为此翻译提供了坚实基础。




