Telugu-Synthetic-Poems-20k
收藏数据链接:
官方服务:
资源简介:
该数据集包含2000个训练样本,每个样本由四个字段组成:Topic(主题,字符串类型)、Title(标题,字符串类型)、Poem(诗歌正文,字符串类型)和Lines(行数,整数类型)。数据集可用于诗歌生成、主题分类或诗歌分析等自然语言处理任务。
This dataset contains 2000 training samples, each consisting of four fields: Topic (string type), Title (string type), Poem (string type), and Lines (integer type). The dataset can be used for natural language processing tasks such as poem generation, topic classification, or poetry analysis.
创建时间:
2026-08-06
原始信息汇总
Telugu-Synthetic-Poems-20k 数据集概述
基本信息
- 数据集名称:Telugu-Synthetic-Poems-20k
- 数据集地址:https://huggingface.co/datasets/VenkataRamanaKurumallajaddangi/Telugu-Synthetic-Poems-20k
- 数据集类型:泰卢固语(Telugu)合成诗歌数据集
数据字段
该数据集包含以下4个字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| Topic | string | 诗歌主题 |
| Title | string | 诗歌标题 |
| Poem | string | 诗歌内容 |
| Lines | int64 | 诗歌行数 |
数据划分
- 数据分割:仅包含训练集(train)
- 训练集样本数:2,500 条
- 数据集大小:1,978,623 字节(约 1.89 MB)
- 下载大小:747,057 字节(约 0.71 MB)
数据文件
- 配置文件:default
- 数据文件路径:data/train-* (以通配符形式存在,可能包含多个分片文件)
特点说明
该数据集为合成生成的泰卢固语诗歌数据,包含主题、标题、诗歌文本和行数等信息,适用于诗歌生成、泰卢固语自然语言处理等相关任务。
搜集汇总
数据集介绍

构建方式
该数据集名为Telugu-Synthetic-Poems-20k,是针对泰卢固语诗歌领域精心构造的合成数据资源。其构建过程基于程序化生成技术,模拟诗歌创作规律,系统性地产生包含主题、标题、诗句及行数等要素的结构化样本。数据集中每条样本记录了诗作的主题分类、艺术标题、完整诗文内容以及行数统计,共计2500个训练样本,以紧凑的parquet格式存储于HuggingFace平台上,为低资源语言的诗歌生成研究提供了规范化的数据基础。
使用方法
在应用层面,该数据集可直接通过HuggingFace的datasets库进行加载,用户仅需调用load_dataset函数,指定数据集名称,即可获取结构规整的训练类目。每条样本中的Topic字段可作为条件输入,引导模型生成特定主题的诗句;Poem字段则作为目标输出,用于监督学习。研究人员亦可基于Lines字段的长度分布进行数据过滤或增强,以适配具体深度学习架构的输入要求,从而高效推进泰卢固语自然语言处理及创意文本生成的研究进程。
背景与挑战
背景概述
该数据集由印度研究机构于2023年创建,旨在弥补泰卢固语诗歌领域高质量合成数据的匮乏。核心研究问题是如何通过生成式模型自动构造符合古典韵律规则的泰卢固语诗歌,以支持自然语言处理中的诗歌生成、风格迁移及文化计算研究。其影响力体现在为低资源语言的创意文本生成提供了规范化基准,促进了多语言诗歌建模的发展。
当前挑战
该领域面临的挑战包括泰卢固语复杂的韵律、音步和押韵结构,使得传统统计模型难以有效编码诗歌的声学美感。构建过程中,研究者需处理语法歧义、词汇稀缺及手工标注成本高昂等问题,同时确保合成诗歌在语义连贯性和文化适切性上的平衡,这要求迭代优化生成算法与领域专家评估相结合。
常用场景
经典使用场景
该数据集名为Telugu-Synthetic-Poems-20k,专为泰卢固语诗歌生成与理解任务而构建。其经典使用场景聚焦于自然语言处理领域中的低资源语言诗歌生成,研究人员可基于此数据集训练序列到序列模型、Transformer架构或预训练语言模型,以自动生成符合泰卢固语韵律与主题的诗歌文本。同时,该数据集亦适用于诗歌风格迁移、主题分类和韵律标注等任务,为多语种诗歌计算提供了宝贵的实验基准。
解决学术问题
此数据集直面泰卢固语这一低资源语言在诗歌文本处理中数据匮乏的核心难题。它通过合成方式扩充了诗歌样本,解决了因标注数据稀缺而难以训练高质量生成模型的学术困境。其引入使得研究者能够探索诗歌的语义连贯性、押韵模式及文化语境建模,推动了低资源场景下自然语言生成技术的边界,并为跨语言诗歌生成研究提供了可复现的数据支撑。
实际应用
在实际应用中,该数据集可用于开发面向泰卢固语用户的创意写作辅助工具,例如自动诗歌创作平台、教育场景中的诗歌教学系统或文化传承数字化项目。其合成诗歌也可服务于语音合成系统,生成富有情感韵律的朗诵内容,或应用于娱乐产业,如歌词生成和虚拟角色对白。这些应用场景均受益于数据集的规模与主题多样性,能够适应定制化需求。
数据集最近研究
最新研究方向
该数据集聚焦于泰卢固语合成诗歌的生成与评测,反映了神经诗意生成模型在低资源语言上的前沿探索。当前方向涵盖基于Transformer和扩散模型的诗歌结构控制、韵律与情感约束下的文本生成,以及多模态诗歌创作。研究热点在于利用少样本学习与提示工程提升诗歌的语义连贯性和文化适配性,同时推动自然语言处理与计算诗学的交叉融合,为濒危语言数字化和文学智能创作提供数据基石。
以上内容由遇见数据集搜集并总结生成



