遇见数据集

Shaer-AI/shaer-eval-raw-fanar-diwan-prefix-300-split

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于诗歌生成评估的数据集,包含多个模型的生成文本及其评估指标。数据集特征包括生成ID、模型信息(如模型名称、模型角色)、诗歌相关属性(如基础韵律、形式、韵律标签)、请求参数(如请求的字节数、行数)、参考文本、生成的文本、健康状态、解码配置、创建时间、以及多个评估分数(如计数依从性、韵律评估状态、流畅性分数、连贯性分数、诗意性分数、描述依从性分数)。数据集旨在评估不同模型在生成诗歌时的表现,重点关注文本的韵律依从性、诗意性和整体质量。数据分割为测试集,包含300个示例。

This dataset is designed for evaluating poetry generation, containing generated texts from multiple models along with their evaluation metrics. The features include generation ID, model information (such as model name, model role), poetry-related attributes (like base meter, form, meter label), request parameters (such as requested bytes, number of lines), reference text, generated text, health status, decode configuration, creation time, and various evaluation scores (e.g., count adherence, meter evaluation status, fluency score, coherence score, poeticness score, description adherence score). The dataset aims to assess the performance of different models in generating poetry, with a focus on meter adherence, poeticness, and overall text quality. The data is split into a test set containing 300 examples.

提供机构:
Shaer-AI
搜集汇总
数据集介绍
Shaer-AI/shaer-eval-raw-fanar-diwan-prefix-300-split 数据集图片
构建方式
该数据集专为阿拉伯诗歌生成评估而构建,聚焦于传统‘沙尔’(Shaer)诗歌形式。数据来源于对预设前缀(prefix)进行续写的生成任务,共包含300条测试样本。每条样本均保留了完整的生成流水线元信息,包括生成ID、输入行ID、来源行索引及模型标识等,并附有参考前缀文本、参考补全文本以及模型生成的原始文本与处理后的文本。构建过程中引入了多维度的自动化评估指标,如音节计数与格式要求的对齐度(count_adherence)、格律分析(meter及meter_predicted)、流畅性(fluency_score)、连贯性(coherence_score)、诗性(poeticness_score)以及描述遵循度(description_adherence_score),从而形成对生成诗歌质量的综合性定量刻画。
特点
本数据集的核心特点在于其结构化的多维评估框架。它将传统的诗歌韵律规则(如格律meter、拜特bayt、行数num_lines)与基于深度学习的生成模型输出进行耦合,提供了从文字层面(前缀、补全、生成文本)到质量维度(格律预测置信度、有效拜特数)的完整信息。特别地,每个样本均包含运行健康状态(health_status)与评估状态(count_eval_status、meter_eval_status)标签,便于研究人员快速筛选有效或失效的生成实例。此外,数据集通过详细的格律细节JSON(meter_details_json)与增强描述(enhanced_description)字段,使其不仅适用于模型性能评估,还可用于诗歌生成的可解释性分析与错误溯源。
使用方法
该数据集以Hugging Face Datasets库的标准格式发布,仅包含test划分,共300条样本,总大小约4.7 MB。用户可通过`load_dataset`函数直接加载默认配置,数据以Parquet格式存储于`data/test-*`路径下。适合用于评估阿拉伯诗歌生成模型的多个维度,如格律正确性、格式遵循度、流利度与诗性。使用时可结合各评分字段(如meter、fluency_score等)进行基准测试,或利用健康状态与评估状态字段进行数据过滤,以确保评估结果的可靠性。对于进阶研究,可解析meter_details_json字段以深入分析模型在格律上的具体错误模式。
背景与挑战
背景概述
在阿拉伯诗歌与韵律学研究中,古典诗歌的数字化评估与生成一直是计算语言学领域的前沿课题。该数据集由研究机构于近期创建,旨在系统评估大语言模型在阿拉伯古典诗歌(尤其是Nabati诗歌)生成任务中的表现。其核心研究问题聚焦于模型对诗歌韵律(al-Bahr)和音节数(al-Bayt)的遵循程度,并创新性地引入了多维评估指标,包括韵律准确性、流畅性、连贯性及诗歌性分数。通过结构化存储300条测试样本,该数据集填补了阿拉伯诗歌生成评测领域标准化资源的空白,为后续跨模型比较、语言模型微调及文化计算研究提供了关键的基准测试框架,对推动低资源语言的文化遗产数字化研究具有里程碑意义。
当前挑战
该数据集主要面临双重挑战。在领域问题层面,阿拉伯古典诗歌的韵律规则极为复杂,涉及长短音节交替、特定韵脚模式及方言变体,对模型的细粒度生成能力提出严苛要求;传统的文本生成评价指标(如BLEU、ROUGE)无法有效捕捉这些诗学特征,需要专门设计的韵律检测与评分方法。在构建过程中,挑战体现为数据标注的高昂成本——需由精通Nabati诗歌的专家对韵律、音节数及风格一致性进行人工校核;同时,不同模型可能采用多样化的解码策略,导致输出的格式与质量参差不齐,如何建立统一的预处理与过滤流程以确保评估公平性,亦是该数据集落地应用中的关键难关。
常用场景
经典使用场景
在阿拉伯诗歌与自然语言处理交叉研究领域,shaer-eval-raw-fanar-diwan-prefix-300-split数据集以其对阿拉伯传统诗歌格律的精准标注而备受瞩目。该数据集最经典的使用场景聚焦于构建和评估面向阿拉伯诗歌的自动格律分析系统。研究人员通过利用数据集中丰富的‘meter’、‘form’及‘meter_eval_status’字段,能够训练模型识别诸如‘bayts’(对句)和‘arud’(韵律)等复杂格律结构。这不仅为古典诗歌的数字化保护提供了基准测试平台,也为后续开展阿拉伯诗歌生成任务奠定了可靠的评估基础,成为衡量大语言模型在特定文化语境下文学素养的标尺。
衍生相关工作
围绕该数据集,学术界已经衍生出一系列创新工作。其中,经典工作包括基于‘shaer-eval’框架的阿拉伯诗歌评估体系,研究者利用数据集的‘count_adherence’与‘description_adherence_score’等指标,提出了一种多维度诗歌质量评分模型。在此基础上,相关学者进一步拓展了阿拉伯诗歌风格迁移的研究,通过融合数据集中‘model_group’与‘paper_source’信息,分析不同语言模型在诗歌格律遵循度上的差异。此外,数据集的‘continuation_requested_num_lines’字段还催生了关于诗歌续写任务的研究,促使了结合韵律先验知识与解码引导策略的混合模型诞生,这些工作共同丰富了低资源语言下文艺领域的内容生成与评估研究版图。
数据集最近研究
最新研究方向
该数据集聚焦于阿拉伯诗歌生成模型的自动化评估与质量分析,前沿研究正围绕韵律合规性、诗意流畅性及主题一致性等维度展开。近期热点在于利用大规模语言模型(如Shaer)进行古典诗歌的续写与创作,并通过多维度指标(如格律meter、诗意poeticness)精确量化生成文本的艺术价值。该数据集为训练和评测诗歌专用模型提供了标准化基准,推动了计算诗学与文化计算领域的跨学科融合,对于理解与传承阿拉伯语韵律遗产具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务