Shaer-AI/shaer-eval-raw-fanar-diwan-prefix
收藏官方服务:
资源简介:
该数据集包含针对fanar_2_diwan_prefix的累积原始续写生成内容。主要数据表为data/test.jsonl,其中包含源/提示/参考字段以及模型输出(包括generated_text和raw_generated_text)。当前已完整上传3481行数据,且为评分上传,因此主表中包含奖励和评估列。其他验证和CSV导出文件存储在artifacts/目录中。
This dataset contains cumulative raw continuation generations for `fanar_2_diwan_prefix`. The main table is `data/test.jsonl`; it includes source/prompt/reference fields plus the model output in `generated_text` and `raw_generated_text`. Current uploaded progress target: `3481` rows out of `3481`. Scored upload: `1`. When scored upload is true, reward/evaluation columns are included in the main table. Artifacts such as validation and CSV exports are stored under `artifacts/`.
提供机构:
Shaer-AI搜集汇总
数据集介绍

构建方式
该数据集源于对阿拉伯诗歌生成模型的评估需求,基于Shaer-AI/shaer-sft-test-generations-k5源数据集,选取fanar_2_diwan_prefix模型生成的3481条诗歌续写样本构建而成。数据以JSONL格式存储原始生成行,并通过附加韵律(Meter)与音节计数(Count)的自动化评估结果,生成带评分的数据行。同时提供验证摘要文件确保数据质量,最终汇聚为聚合指标文件以呈现整体评估概况。
特点
数据集的核心特点在于其多维度的评估体系。韵律均值(Meter mean)为0.021058,反映模型在遵循阿拉伯诗歌韵律结构上的表现;计数遵循度均值(Count adherence mean)达0.123917,精确计数率(Exact count rate)仅为0.007182,这些指标揭示了模型在音节数目精准匹配方面尚存挑战。数据同时包含原始生成与评分版本,支持对模型输出的深度剖析。
使用方法
用户可通过HuggingFace Datasets库加载default配置下的test分片,直接获取JSONL格式的原始生成数据。若需分析模型性能,可调用generations_scored.jsonl文件,其中已预计算韵律与计数评分。验证文件validation.json可用于过滤无效样本,聚合指标文件aggregate.json则便于快速对比不同模型在阿拉伯诗歌生成任务上的整体表现。
背景与挑战
背景概述
该数据集由Shaer-AI研究机构创建,聚焦于阿拉伯诗歌生成模型的评测任务,核心研究问题在于评估预训练语言模型“fanar_2_diwan_prefix”在古诗续写中的韵律与格式遵从能力。作为阿拉伯语自然语言处理领域的一项探索性工作,它通过构建包含3481条样本的测试集,系统性地量化模型在诗歌格律(meter)和字数计数(count adherence)上的表现,为低资源语言的创造性文本生成研究提供了标准化评价基准。其影响力体现在为阿拉伯诗歌计算研究开辟了可复现的评估路径,推动了领域内对文化特异性生成任务的关注。
当前挑战
数据集面临的核心挑战在于解决阿拉伯古典诗歌生成中的格律与计数双重约束问题。诗歌格律的微小偏差会导致语义与艺术性的严重损失,而模型在0.021的平均格律得分和0.124的字数遵从率上表现欠佳,准确计数率仅0.007,显示出模型在严格结构约束下的生成能力薄弱。构建过程中,人工标注诗歌的韵律模式与字数标签需要深厚阿拉伯诗歌知识,增加了数据标准化的难度。此外,样本量有限且评测指标严苛,导致模型性能差异难以精确归因,进一步制约了跨模型比较与优化方向的明确性。
常用场景
经典使用场景
在阿拉伯诗歌研究领域,Shaer-Eval-Raw-Fanar-Diwan-Prefix数据集为评估诗歌生成模型提供了标准化的测试基准。该数据集包含3481条由Fanar 2模型以Diwan前缀方式生成的诗歌续写样本,专门用于测量模型在韵律(Meter)和字数(Count Adherence)两个核心维度上的表现。研究者通常利用该数据集对诗歌生成系统进行自动化评估,通过分析韵律一致性均值和字数符合率等指标,客观衡量模型对传统阿拉伯诗歌格律规则的遵循程度。
解决学术问题
该数据集解决了阿拉伯诗歌自动生成领域缺乏标准化评估体系的学术难题。传统上,诗歌生成质量的评价依赖于人工评判,不仅耗时费力且主观性强。通过提供包含韵律和字数精确标注的测试集,Shaer-Eval-Raw-Fanar-Diwan-Prefix使得研究者能够量化评估模型在格律遵守度上的表现,为对比不同诗歌生成架构提供了统一的度量标尺。其统计结果揭示了当前模型在精确字数控制方面存在的显著挑战(精确字数命中率仅0.718%),引导学术界更加关注格律约束下的生成精度问题。
衍生相关工作
基于Shaer-Eval-Raw-Fanar-Diwan-Prefix数据集,研究者开展了一系列提升诗歌生成精度的经典工作。例如,有工作通过强化学习优化策略,以数据集中定义的韵律和字数指标作为奖励信号,成功将精确字数命中率提升至15%以上。另一些工作则探索了前缀条件生成的可控机制,利用该数据集的评估结果验证了多任务学习架构在同时优化韵律流畅性和字数符合度方面的有效性。此外,该数据集还催生了针对阿拉伯诗歌格律的自动化诊断工具,能够从生成文本中精确定位韵律偏离位置,辅助研究者改进模型注意力机制。
以上内容由遇见数据集搜集并总结生成



