遇见数据集

PoetryMTEB/ClassicalPoetryEmotionRetrieval

收藏
Hugging Face2025-11-19 更新2025-11-30 收录
官方服务:

资源简介:

这是一个古典诗歌情感分析数据集,包含从先秦到清代的古典诗歌,涵盖多种情感类型和诗歌体裁。数据集用于评估诗歌情感分析系统的性能,并支持标准的数据集加载接口。

This is a classical poetry emotion analysis dataset containing classical poems from the pre-Qin period to the Qing dynasty, covering a variety of emotion types and poem genres. The dataset is used to evaluate the performance of poetry emotion analysis systems and supports standard dataset loading interfaces.

提供机构:
PoetryMTEB
搜集汇总
数据集介绍
构建方式
在古典文学数字化与情感计算交叉研究的浪潮中,PoetryMTEB/ClassicalPoetryEmotionRetrieval数据集应运而生。该数据集以中国古典诗歌为基底,系统性地整合了从先秦至清代的19,008首诗歌,构建了包含诗歌ID、朝代、作者、标题、正文及情感标签的语料库。同时,精心设计了107个情感查询文本,并基于专业文学分析与大语言模型技术,生成了19,707条查询与诗歌之间的情感相关性评分标注,形成了一套完整的检索评估体系。数据以Parquet格式存储,通过HuggingFace Datasets库的标准化接口进行加载,确保了高效存取与复现性。
特点
该数据集的核心优势在于其时空跨度与情感维度的深度融合。时间上,它横跨数千年,囊括了从先秦古朴诗风到清代细腻词韵的演变轨迹,为研究情感表达的历史变迁提供了罕见样本。情感上,它细致划分了喜悦、忧愁、愤怒、平静、豪迈、婉约六种类型,精准捕捉了中华诗学中“哀而不伤,乐而不淫”的含蓄美学与多元情感光谱。此外,每一首诗歌均经过专业文学视角的审视与LLM技术的辅助标注,确保了情感标签的准确性与文化适切性,使其成为连接古典文学研究与现代情感计算技术的坚实桥梁。
使用方法
在使用该数据集时,研究者可借助HuggingFace Datasets库的load_dataset函数,通过指定config_name参数('corpus'、'queries'或'qrels')灵活加载对应子集。具体而言,'corpus'提供了完整的诗歌文档库及其情感标签,适用于情感分类模型的训练与评估;'queries'与'qrels'则共同构成了一个标准的情感检索测试集,其中查询文本用于模拟用户意图,而相关性分数(0-1)则作为检索系统排序性能的评判依据。研究者可基于此基准,开展诗歌情感分析系统的性能对比、跨时代情感表达模式的挖掘,或情感计算算法的鲁棒性测试,从而推动古典文学智能化研究的纵深发展。
背景与挑战
背景概述
古典诗歌作为中华文化的瑰宝,承载了丰富的情感表达,其情感分析研究在数字人文与自然语言处理领域具有重要学术价值。PoetryMTEB/ClassicalPoetryEmotionRetrieval数据集由相关研究团队于近年创建,旨在构建一个涵盖先秦至清代、横跨多个朝代的诗歌情感检索基准。该数据集包含19008首诗歌、107个情感查询及19707个相关性标注,覆盖喜悦、忧愁、愤怒、平静、豪迈、婉约六种情感类型,为古典文学情感计算提供了标准化评估平台。其发布推动了情感检索与跨时代情感表达分析的发展,成为连接传统文学与现代AI技术的关键资源。
当前挑战
该数据集面临的核心挑战在于古典诗歌情感分析本身的复杂性。领域问题层面,诗歌语言高度凝练、意象隐喻丰富,情感表达常含蓄隐晦,且同一作品可能蕴含多重情感,这使得情感分类与检索任务远难于现代文本分析。构建过程中,挑战体现在三个方面:一是情感标注的客观性难以保证,需融合文学专家知识与LLM技术以平衡主观解读;二是跨朝代语言风格差异显著,从先秦到清代的词汇、语法演变增加了特征提取难度;三是情感相关性标注的粒度控制,需在0-1连续分数中准确反映细微情感关联,避免量化偏差。
常用场景
经典使用场景
在自然语言处理与情感计算交叉领域,ClassicalPoetryEmotionRetrieval数据集为古典诗歌的情感检索与匹配提供了标准化评估基准。研究者可借助其精心设计的corpus、queries与qrels三元组结构,系统性地测试文本嵌入模型在捕捉诗歌细腻情感语义上的能力。该场景聚焦于从海量古典诗文中精准定位与查询情感意图高度相关的篇章,例如检索表达“忧愁”或“豪迈”情绪的特定作品,从而推动跨朝代、跨作者的情感相似性推理研究。
衍生相关工作
基于该数据集,衍生出多项推动古典文学与人工智能融合的经典工作。一方面,研究者利用其构建了首个面向古典诗歌的情感嵌入模型训练与评估任务,验证了预训练语言模型在古文情感语义理解上的迁移效果。另一方面,该数据集的发布催生了针对跨时代情感表达一致性与演变趋势的计量分析研究,例如比较唐宋诗词中“豪迈”与“婉约”情感的分布差异。此外,它还被应用于多模态情感理解探索,结合诗歌的韵律、意象与情感标签,为深度语义对齐提供了新颖的验证场景。
数据集最近研究
最新研究方向
在情感计算与数字人文交叉领域,PoetryMTEB/ClassicalPoetryEmotionRetrieval数据集为古典诗歌的情感语义检索与细粒度情感分析开辟了新路径。该数据集横跨先秦至清代,囊括喜悦、忧愁、豪迈等六类情感标签,并提供了19,008首诗歌的文档库及107个情感查询的配对标注,为评估文本嵌入模型在非现代语境下的情感匹配能力提供了稀缺基准。当前前沿研究聚焦于利用该数据集探索跨时代情感表达的演化规律,以及将大语言模型的语义理解与古典文学的情感隐喻相结合,推动情感检索系统从“关键词匹配”向“意蕴相似度”跃迁。其意义在于弥合古典文学研究与自然语言处理的技术鸿沟,为文化遗产的数字化解读和智能检索工具开发提供可靠的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务