遇见数据集

matheusrdgsf/re_dial_ptbr

收藏
Hugging Face2023-11-13 更新2024-03-04 收录
官方服务:

资源简介:

ReDial (Recommendation Dialogues) PTBR数据集是一个标注的对话集合,用户在其中互相推荐电影,并且已翻译为巴西葡萄牙语。该数据集的巴西葡萄牙语版本由Maritalk翻译,为研究目标导向的对话系统(如餐厅推荐)和自由形式的日常对话系统的交叉领域提供了机会。由于Maritalk的使用限制,原始数据集中的一些样本已被移除,训练集减少了近10%。

ReDial (Recommendation Dialogues) PTBR dataset is an annotated collection of dialogues where users recommend movies to each other, and it has been translated into Brazilian Portuguese. This Brazilian Portuguese variant of the dataset was translated by Maritalk, providing research opportunities at the intersection of goal-oriented dialogue systems (such as restaurant recommendation) and free-form daily dialogue systems. Due to the usage restrictions of Maritalk, some samples from the original dataset have been removed, reducing the training set by nearly 10%.

提供机构:
matheusrdgsf
原始信息汇总

数据集概述

数据集名称

ReDial (Recommendation Dialogues) PTBR

数据集描述

ReDial (Recommendation Dialogues) PTBR 数据集是一个经过注释的对话集合,用户在其中互相推荐电影,并翻译成巴西葡萄牙语。

数据集特征

  • conversationId: 对话ID,数据类型为 int32
  • messages: 消息列表,包含以下字段:
    • messageId: 消息ID,数据类型为 int64
    • senderWorkerId: 发送者ID,数据类型为 int64
    • text: 消息文本,数据类型为 string
    • timeOffset: 时间偏移,数据类型为 int64
  • messages_translated: 翻译后的消息列表,字段与 messages 相同。
  • movieMentions: 电影提及列表,包含以下字段:
    • movieId: 电影ID,数据类型为 string
    • movieName: 电影名称,数据类型为 string
  • respondentQuestions: 回应者问题列表,包含以下字段:
    • liked: 是否喜欢,数据类型为 int64
    • movieId: 电影ID,数据类型为 string
    • seen: 是否看过,数据类型为 int64
    • suggested: 是否推荐,数据类型为 int64
  • respondentWorkerId: 回应者ID,数据类型为 int32
  • initiatorWorkerId: 发起者ID,数据类型为 int32
  • initiatorQuestions: 发起者问题列表,字段与 respondentQuestions 相同。

数据集分割

  • train: 训练集,包含 9005 个样本,大小为 26389658 字节。
  • test: 测试集,包含 1342 个样本,大小为 3755474 字节。

数据集大小

  • 下载大小: 11072939 字节
  • 数据集大小: 30145132 字节

数据集配置

  • config_name: default
  • data_files:
    • train: 路径为 data/train-*
    • test: 路径为 data/test-*

许可证

MIT

任务类别

  • 文本分类
  • 文本生成
  • 对话系统
  • 翻译

语言

  • 葡萄牙语
  • 英语

标签

  • 对话推荐
  • 推荐
  • 对话

数据实例

json { "conversationId": 391, "messages": [ { "messageId": 1021, "senderWorkerId": 0, "text": "Hi there, how are you? Im looking for movie recommendations", "timeOffset": 0 }, { "messageId": 1022, "senderWorkerId": 1, "text": "I am doing okay. What kind of movies do you like?", "timeOffset": 15 } ], "messages_translated": [ { "messageId": 1021, "senderWorkerId": 0, "text": "Olá, como você está? Estou procurando recomendações de filmes.", "timeOffset": 0 }, { "messageId": 1022, "senderWorkerId": 1, "text": "Eu estou indo bem. Qual tipo de filmes você gosta?", "timeOffset": 15 } ], "movieMentions": [ { "movieId": "203371", "movieName": "Final Fantasy: The Spirits Within (2001)" } ], "respondentQuestions": [ { "liked": 1, "movieId": "203371", "seen": 0, "suggested": 1 } ], "respondentWorkerId": 1, "initiatorWorkerId": 0, "initiatorQuestions": [ { "liked": 1, "movieId": "203371", "seen": 0, "suggested": 1 } ] }

数据字段

  • conversationId: 对话ID,数据类型为 int32
  • initiatorWorkerId: 发起者ID,数据类型为 int32
  • respondentWorkerId: 回应者ID,数据类型为 int32
  • messages: 消息列表,包含以下字段:
    • messageId: 消息ID,数据类型为 int64
    • text: 消息文本,数据类型为 string
    • timeOffset: 时间偏移,数据类型为 int64
    • senderWorkerId: 发送者ID,数据类型为 int64
  • messages_translated: 翻译后的消息列表,字段与 messages 相同。
  • movieMentions: 电影提及列表,包含以下字段:
    • movieId: 电影ID,数据类型为 string
    • movieName: 电影名称,数据类型为 string
  • initiatorQuestions: 发起者问题列表,包含以下字段:
    • liked: 是否喜欢,数据类型为 int64
    • movieId: 电影ID,数据类型为 string
    • seen: 是否看过,数据类型为 int64
    • suggested: 是否推荐,数据类型为 int64
  • respondentQuestions: 回应者问题列表,字段与 initiatorQuestions 相同。

数据分割

  • 原始数据集包含 11348 个对话,其中 10006 个用于训练和模型选择,1342 个用于测试。
  • 翻译版本的数据集在训练集上减少了约 10%。

贡献者

搜集汇总
数据集介绍
matheusrdgsf/re_dial_ptbr 数据集图片
构建方式
在对话推荐系统研究领域,多语言数据资源的匮乏一直是制约模型泛化能力的关键瓶颈。为突破这一局限,研究者基于经典的英文ReDial(Recommendation Dialogues)数据集,借助Maritalk API的高质量机器翻译能力,将其系统性转化为巴西葡萄牙语版本。构建过程中严格保留了原始对话的完整结构,包括对话轮次、说话者身份、时间偏移量以及电影提及实体等核心要素,同时新增了messages_translated字段存储译后文本。由于API调用次数限制,训练集规模较原始版本缩减约10%,最终形成包含9005条训练样本和1342条测试样本的平行语料库。
使用方法
数据集以JSONL格式存储,每行对应一个完整的对话实例,可直接通过HuggingFace Datasets库加载。研究者可灵活调用messages字段进行对话生成与翻译任务的训练,利用movieMentions字段开展电影实体识别研究,或基于initiatorQuestions与respondentQuestions中的标注信息构建推荐效果评估模型。数据已预划分为训练集与测试集,支持text-classification、text2text-generation、conversational及translation等多类任务场景的即用型实验。
背景与挑战
背景概述
在对话式推荐系统领域,如何将自然语言交互与个性化推荐深度融合一直是研究的热点与难点。ReDial(Recommendation Dialogues)数据集诞生于2018年,由多位研究者联合构建,其核心论文发表于NeurIPS,旨在通过收集真实用户间关于电影推荐的对话,为构建能够理解用户偏好、进行多轮交互并给出精准推荐的对话式智能体提供基准。该数据集原始版本以英文呈现,包含超过一万条带有丰富标注的对话,每条对话不仅记录了消息序列,还涵盖了电影提及、观看状态与喜好反馈等结构化信息,对推动对话式推荐的研究具有里程碑式的影响。在此基础上,matheusrdgsf与wfco等人借助Maritalk API将其翻译为巴西葡萄牙语,形成了re_dial_ptbr版本,从而拓展了这一重要资源在葡萄牙语社区的应用,为跨语言对话推荐研究开辟了新路径。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:对话式推荐系统需要同时处理自然语言理解、用户意图建模与推荐策略生成,而ReDial中对话的开放性与非结构化特征使得模型难以从有限的交互中准确捕捉用户动态变化的偏好,尤其是在多轮对话中平衡探索与利用。其次,在数据集构建与适配过程中,翻译环节引入了新的困难——由于使用了第三方API,部分原始样本因使用限制被移除,导致训练集规模缩减约10%,可能影响模型训练的稳定性和泛化能力;同时,机器翻译在保留电影领域专有名词、口语化表达及上下文一致性方面存在潜在误差,可能扭曲原始对话中的语义与推荐逻辑,进而对下游任务(如推荐准确性、对话连贯性)的评估构成挑战。
常用场景
经典使用场景
在对话式推荐系统的研究版图中,ReDial PTBR数据集以其独特的双语属性——保留了原始英文对话的流畅性,同时提供精准的巴西葡萄牙语翻译——成为跨语言对话建模的经典基准。该数据集的核心应用场景在于训练和评估能够理解自然语言交互、动态捕捉用户偏好并生成个性化电影推荐的智能对话体。研究者可借助其结构化的多轮对话、电影提及标签及用户反馈(如喜好、是否观看)等丰富信息,深入探索融合语义理解与推荐决策的端到端模型,从而推动对话系统从简单问答向具备主动推荐能力的认知智能演进。
解决学术问题
该数据集有效回应了对话推荐领域中长期存在的两大学术困境:其一,缺乏面向低资源语言(如葡萄牙语)的高质量标注对话语料,限制了多语言推荐系统的普适性研究;其二,现有模型往往割裂了对话流畅性与推荐准确性之间的耦合关系。通过提供包含9,005条训练样本和1,342条测试样本的双语平行对话,ReDial PTBR使得研究者能够系统性地探究跨语言迁移学习、对话状态追踪与推荐策略联合优化等核心问题。其意义在于为构建能够跨越语言壁垒、在真实社交对话中无缝嵌入推荐功能的通用对话体奠定了数据基石,显著拓展了对话推荐研究的语言多样性与生态包容性。
实际应用
在实际产业部署中,ReDial PTBR数据集直接赋能了面向巴西葡萄牙语用户的智能客服与娱乐推荐系统。例如,流媒体平台可基于该数据集训练具备多轮对话能力的虚拟助手,使其能够通过自然语言交互理解用户对电影类型、导演风格或情感基调的模糊偏好,进而提供高度个性化的片单推荐。此外,该数据集还可应用于社交电商场景,辅助构建模拟真人好友间推荐行为的对话式购物导购,通过分析对话中的隐含意图与反馈信号,动态调整推荐策略以提升用户满意度和转化率,展现了从学术研究到商业落地的清晰路径。
数据集最近研究
最新研究方向
在对话式推荐系统领域,ReDial PTBR数据集的发布标志着跨语言推荐研究的重要突破。该数据集将经典的英文电影推荐对话语料库ReDial翻译为巴西葡萄牙语,填补了非英语对话推荐系统资源的空白。当前前沿研究方向聚焦于多语言对话推荐模型的构建与迁移学习策略,研究者利用该数据集探索如何将基于英语预训练的语言模型高效适配至低资源语言场景,同时保持推荐对话的流畅性与上下文一致性。此外,该数据集推动了跨文化推荐偏好的研究,通过对比原始英文与翻译版本中用户提及的电影实体、交互模式及情感表达差异,揭示语言与文化因素对推荐效果的影响。这一资源为构建全球化、包容性的对话式推荐系统奠定了数据基础,尤其在巴西这一快速增长的数字娱乐市场中具有显著的应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务