遇见数据集

CCPoetry-49K

收藏
arXiv2026-06-11 更新2026-06-12 收录
数据链接:
官方服务:

资源简介:

CCPoetry-49K是由北京航空航天大学研究团队构建的面向古诗词理解的高质量指令数据集,旨在解决古诗词精确翻译与情感语义理解领域数据稀缺的难题。该数据集包含49,404条精心对齐的指令-响应对,数据源自Poetry CN、Chinese ancient poetry translation等多个开源语料库,经过大规模清洗与对齐处理,覆盖术语解释、语义阐释和情感推理三大核心子任务。其构建过程基于CCL25-Eval Task 5的评估框架,通过结构化标注实现了古诗词多维度解析,主要应用于古诗词领域大语言模型的指令微调与性能评估,为提升古诗词的精准翻译与深度情感理解提供关键数据支撑。

CCPoetry-49K is a high-quality instruction dataset for classical Chinese poetry understanding, developed by the research team from Beihang University. It is designed to address the data scarcity issue in the domains of precise classical Chinese poetry translation and emotional semantic understanding. This dataset consists of 49,404 meticulously aligned instruction-response pairs, sourced from multiple open-source corpora such as Poetry CN and Chinese ancient poetry translation. It has undergone large-scale cleaning and alignment processing, and covers three core subtasks: terminology explanation, semantic interpretation and emotional reasoning. Its development is grounded in the evaluation framework of CCL25-Eval Task 5, enabling multi-dimensional analysis of classical Chinese poetry through structured annotation. It is primarily applied to instruction fine-tuning and performance evaluation of Large Language Models (LLMs) in the classical Chinese poetry field, providing pivotal data support for advancing precise translation and in-depth emotional comprehension of classical Chinese poetry.

创建时间:
2026-06-11
搜集汇总
数据集介绍
CCPoetry-49K 数据集图片
构建方式
CCPoetry-49K的构建源于对古典诗词鉴赏任务的深度解构,将其拆解为术语解释、语义解释与情感推断三个子任务。研究团队从多个开源数据源(如Poetry CN、Chinese ancient poetry translation、poems-db)中收集包含部分标注的诗词数据,这些数据虽来源广泛但结构不一、标注质量参差不齐。为此,团队执行了大规模的数据清洗与对齐操作,筛选出高质量基础样本,并基于每个样本的标题、作者、内容、术语注释、白话译文及情感标签,构造了统一的指令-响应对格式。最终,该数据集汇集了49,404条精心对齐的高质量指令对,覆盖了三个子任务,为领域专用大模型的微调提供了坚实的数据基础。
特点
CCPoetry-49K的核心特色在于其高度的领域专精性与任务细粒度。不同于以往仅聚焦于诗词生成或翻译的数据集,本数据集专为诗词鉴赏的评估任务而设计,精准覆盖术语解释、语义理解和情感推断三大关键维度。每条样本均经过严格的数据清洗与语义对齐,确保了指令与响应之间的准确映射。数据规模达49,404条,其中术语解释19,323条、语义解释21,799条、情感推断8,282条,分布均衡且覆盖广泛。这种结构化、多任务的构建方式,使得该数据集能够有效捕捉古典诗词在语言、历史与情感层面的复杂性,填补了该领域高质量指令数据的空白。
使用方法
CCPoetry-49K主要面向需要领域适配的大语言模型微调场景。使用者可将数据集划分为三个子任务,分别用于训练独立的LoRA适配器。以Qwen2.5-14B为基础模型,采用LoRA(秩为16,alpha为32,dropout为0.1)进行参数高效微调,输入长度上限设定为1240 tokens,训练2个epoch,学习率设为2e-4。针对情感推断任务,还需利用Qwen2.5-14B-Instruct对模型输出进行后处理对齐,以适配评测平台要求的预设情感标签格式。数据集及其对应模型PoetryQwen已在CCL25-Eval Task 5基准上验证有效性,研究者可直接下载并复现实验流程。
背景与挑战
背景概述
古典诗歌作为中华文化的瑰宝,其鉴赏任务长期面临术语释义、语义解析与情感推断的复杂性挑战。现有研究多聚焦于诗歌生成或古文翻译,缺乏系统化的评估与解读框架。CCPoetry-49K数据集由杭州北航国际创新研究院的谢浩涛等人于2025年构建,旨在填补这一空白。该数据集基于多个开源语料库,经过大规模数据清洗与对齐,整合了49,404条高质量指令-响应对,涵盖术语解释、语义解析与情感推断三个子任务。这一创新性资源为大型语言模型(LLM)在古典诗歌领域的精准翻译与情感理解提供了专业化支撑,显著推动了领域内评估体系的完善。
当前挑战
古典诗歌鉴赏面临的首要挑战在于其领域特殊性被忽视,多数研究将其视为通用自然语言处理问题,未能捕捉诗歌独有的历史语境、文化内涵与情感层次。此外,高质量、细粒度的领域专用数据集极度匮乏,现有资源多服务于翻译或生成任务,缺乏对术语、语义及情感多维解读的支持。在构建CCPoetry-49K过程中,研究人员需应对开源数据来源结构不一、标注粒度参差不齐及对齐困难等难题,通过严格的数据清洗与格式统一,确保指令数据的一致性与可靠性,最终实现多任务标注的高效整合。
常用场景
经典使用场景
在古典诗词智能理解的学术疆域中,CCPoetry-49K数据集最为经典的应用场景是作为领域专用大语言模型(LLM)的指令微调燃料。它将诗词鉴赏这一高度复杂的人文任务拆解为术语释义、语义解读与情感推断三个结构化子任务,为模型提供高质量、多维度的监督信号。研究者可基于该数据集对通用基座模型(如Qwen2.5-14B)进行低秩适应(LoRA)微调,从而训练出像PoetryQwen这样在精准翻译与情感语义理解上显著优于基线的领域专家模型。该数据集以其精细的标注粒度和明确的子任务划分,成为连接古典文学意蕴与现代深度学习技术的枢纽。
衍生相关工作
CCPoetry-49K的诞生催生了一系列衍生研究工作。在其构建思路上,研究者借鉴了CCL25-Eval Task 5的三层次评估框架,将“术语解释—语义翻译—情感推断”这一范式迁移至其他古典文学体裁,如明清散文或元曲鉴赏。同时,该数据集为低秩适应技术在人文领域的落地提供了典范,后续工作探索了更高效的参数高效微调方案(如AdaLoRA、IA3)在诗词理解上的表现。此外,该成果也启发了多模态诗词理解研究,结合图像或书法作品中的诗意元素,将CCPoetry-49K的指令格式扩展至图文联合解读,从而构建更富沉浸感的古典文艺智能交互系统。
数据集最近研究
最新研究方向
在古典诗词理解与鉴赏的智能化研究中,当前前沿方向已从传统的诗词生成与翻译转向精细化、多维度评估的领域专用大模型构建。CCPoetry-49K数据集的问世,标志着研究者开始聚焦于古典诗词的术语释义、语义解读与情感推断三大子任务,通过构建高质量指令微调数据集,突破通用NLP范式在诗词鉴赏中的局限性。该数据集基于多源开放语料进行清洗与对齐,为领域适配的大语言模型提供精细的监督信号,其与LoRA微调技术的结合,显著提升了模型在翻译准确性与情感语义理解上的表现。这一方向不仅回应了古典诗词深层语境与审美意蕴的数字化解析需求,也为文化智能计算领域开辟了新的研究路径,具有促进传统文化传承与AI深度融合的重要意义。
相关研究论文
  • 1
    System Report for CCL25-Eval Task 5: New Dataset and LoRA-Fine-Tuned Qwen2.5北京航空航天大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务