遇见数据集

Shaer-AI/shaer-sft-test-generations-k5

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Shaer SFT Test Generations K=5,包含从最终Shaer SFT适配器在测试集上生成的阿拉伯诗歌输出。具体来说,它基于源数据集Shaer-AI/ashaar-with-enhanced-descriptions-baseform-final-sft-lte20-min500-splits的测试分割(包含3,481行),每行生成5个样本,总计17,405行生成数据。生成过程使用基础模型Navid-AI/Yehia-7B-preview和适配器仓库Shaer-AI/Shaer-adapters中的适配器(位于adapters/fresh_sft/train/best子文件夹),通过带LoRA的vLLM后端实现,解码设置包括最大新令牌数768、温度0.55、top_p 0.9和重复惩罚1.08。数据集仅包含健康的生成行,排除了本地失败的重试尝试。

This dataset contains generated outputs from the final Shaer SFT adapter on the held-out test split. It is based on the source dataset Shaer-AI/ashaar-with-enhanced-descriptions-baseform-final-sft-lte20-min500-splits (test split with 3,481 rows), generating 5 samples per source row for a total of 17,405 generated rows. Generation uses the base model Navid-AI/Yehia-7B-preview and an adapter from the Shaer-AI/Shaer-adapters repository (subfolder adapters/fresh_sft/train/best), implemented with vLLM backend with LoRA, with decoding settings including max_new_tokens 768, temperature 0.55, top_p 0.9, and repetition_penalty 1.08. Only healthy generated rows are included, and local failed retry attempts are excluded.

提供机构:
Shaer-AI
搜集汇总
数据集介绍
构建方式
本数据集源自阿拉伯诗歌生成项目Shaer,旨在为诗歌生成模型提供评估与测试资源。构建基于已训练的最终有监督微调适配器,在保留的测试集上通过vLLM与LoRA后端进行生成。每个来源样本生成5个候选输出,最终收录健康生成样本,剔除本地重试失败的条目。来源数据集为阿拉伯诗歌的增强描述版本,包含3481条测试样本,经生成后总计17405条记录。基座模型选用Yehia-7B-preview,适配器来自Shaer适配器仓库中的最优微调子文件夹。生成过程采用max_new_tokens 768、温度0.55、top_p 0.9及重复惩罚1.08的采样策略,确保诗作出品兼具多样性与流畅度。
使用方法
本数据集适用于评估阿拉伯诗歌生成模型的输出质量与风格一致性,用户可直接将生成的诗歌文本与原始描述进行对照分析,或用于计算BLEU、ROUGE等自动指标。亦可作为少样本微调的候选池,选择高质生成样例进行二次训练或领域适应。考虑到数据集的测试集分割属性,建议用于最终模型的盲测与泛化性能检验,避免混入训练流程。支持加载后以源行为单位分组,对五条候选进行多样性或偏好排序,还可配合奖励模型进行对齐优化实验。
背景与挑战
背景概述
阿拉伯诗歌作为阿拉伯文学的灵魂,其格律、韵脚与修辞的复杂性长期以来对自然语言生成模型构成严峻挑战。在此背景下,Shaer SFT Test Generations K=5数据集由Shaer-AI研究团队于近期创建,依托Yehia-7B基础模型与特定适配器进行微调生成,旨在评估阿拉伯诗歌生成模型在保留诗性特质与语义连贯性方面的能力。该数据集源于包含增强描述的阿拉伯诗歌语料库,精选3,481条测试样本,每条生成5个候选变体,总计17,405条记录,为阿拉伯诗歌自动生成研究提供了标准化测评基准,推动了该领域从规则驱动向数据驱动范式的转变。
当前挑战
该数据集面临多重挑战:首先,阿拉伯诗歌格律复杂,包括16种传统格律与自由韵脚,要求模型在严格形式约束下保持语义创新,对生成算法构成根本性难题;其次,数据集构建中需平衡温度、top-p与重复惩罚等解码参数以规避非法生成,例如本地重试失败样本被严格排除,确保了数据健康性但降低了生成多样性;再次,诗歌中古语词汇与现代阿拉伯语的混用增加了语言歧义性,模型需克服历史语料稀疏性与风格跳变问题,在忠实描绘诗意美感与避免冗长重复间寻找微妙平衡。
常用场景
经典使用场景
Shaer SFT Test Generations K=5数据集专为评估和优化阿拉伯诗歌生成模型而设计。其核心使用场景在于作为微调后模型的测试基准,通过提供多候选生成结果(每源文本5个样本),研究者可系统性地评估生成诗歌的质量、韵律一致性与文化适应性。该数据集常被用于对比不同解码策略(如温度、top-p采样)对诗歌结构完整性的影响,或验证特定微调方法能否提升语义连贯性与传统格律的匹配度。
解决学术问题
该数据集解决了阿拉伯诗歌自动生成领域中的关键瓶颈——即如何客观衡量并提升模型在受限格式中的创造性表达能力。它使学者得以量化分析微调后模型在保持古典诗歌韵律(如巴赫尔、韵律尾音)时的失败模式,并探索温度、重复惩罚等超参数对生成多样性与合理性的权衡影响。通过标准化测试分片,该数据集推动了生成质量评估准则的建立,为后续研究提供了可重复的对比基线。
实际应用
在实际应用中,该数据集支撑了阿拉伯诗歌辅助创作工具的开发与迭代。例如,诗人或内容创作者可利用基于此数据集优化的模型快速生成符合特定韵律范式的诗句草稿,再结合人工润色完成作品。此外,该数据集也可服务于教育场景,自动生成古典诗歌范例用于教学展示,或帮助非母语学习者理解传统诗歌结构。其多候选输出特性还适合搭建交互式创作平台,为用户提供多样化的美学选择。
数据集最近研究
最新研究方向
在阿拉伯语诗歌生成领域,该数据集聚焦于大语言模型在古典诗歌创作中的可控生成与质量评估前沿。基于Shaer SFT适配器对Yehia-7B预览模型的微调结果,通过核心解码参数(温度0.55、top_p 0.9、重复惩罚1.08)的精细调控,生成5组候选诗作,为诗歌自动创作中的语义连贯性与韵律保真度研究提供了结构化基准。数据集摒弃生成失败样本,确保数据纯净度,契合当前自然语言生成领域对高质量、细粒度评估数据集的迫切需求。此项工作推动了低资源语言中文化遗产数字化与AI文学创作交叉方向的发展,为阿拉伯诗歌的智能辅助创作与自动化鉴赏评估奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务