遇见数据集

ashmib/synthTRIPS

收藏
Hugging Face2025-02-14 更新2025-02-15 收录
官方服务:

资源简介:

SynthTRIPS是一个基于知识的框架,用于为个性化旅游推荐器生成基准查询。它包含了一个覆盖43个国家200个欧洲城市的全面知识库,其中包括关于兴趣点(如景点、活动和目的地)、城市受欢迎程度、估计的月度游客人流量(季节性)以及关键可持续性指标(如步行指数和空气质量指数)的详细信息。这个知识库被用来通过LLMs生成查询。

SynthTRIPS: A Knowledge-Grounded Framework for Benchmark Query Generation for Personalized Tourism Recommenders, which includes a comprehensive Knowledge Base covering 200 European cities across 43 countries with detailed information on points of interest, city popularity, estimated monthly visitor footfall, and key sustainability metrics.

提供机构:
ashmib
搜集汇总
数据集介绍
ashmib/synthTRIPS 数据集图片
构建方式
在个性化旅游推荐系统研究领域,构建高质量的基准查询数据集是评估推荐算法性能的关键。SynthTRIPS数据集基于一个覆盖43个国家200个欧洲城市的综合知识库,该知识库囊括了景点、活动、目的地等兴趣点信息,以及城市热度、月度访客量(季节性)和步行适宜性、空气质量指数等可持续性指标。研究团队采用知识增强的查询生成框架,利用llama-3.2-90b和gemini-1.5-pro-002两种大型语言模型,结合精心设计的系统提示、用户提示及上下文学习示例,自动生成多样化的个性化旅游查询。整个生成过程辅以严格的验证流程,确保查询的真实性与合理性。
特点
该数据集的核心特色在于其知识驱动的构建范式与多维度的数据整合能力。知识库不仅提供了丰富的城市与兴趣点属性,还融入了季节性客流和可持续性指标,使得生成的查询能够反映真实旅游场景中的复杂约束,如时间偏好与环保意识。此外,数据集包含由两种不同规模与架构的语言模型生成的查询,为研究模型间差异与泛化能力提供了独特视角。配套的专家评估工具允许人工验证与反馈,进一步提升了数据集的可靠性与实用性,使其成为个性化旅游推荐研究中的宝贵基准资源。
使用方法
使用者可通过HuggingFace平台直接下载知识库与生成的查询文件,轻松集成至文本生成或推荐系统任务中。数据集以JSON格式存储,便于解析与处理。为复现或定制查询生成流程,用户可访问配套的代码仓库,其中包含了详尽的生成管道与评估代码,并提供了Google Colab笔记本供快速上手实践。专家评估工具以HuggingFace Space形式部署,输入验证码SynthTRIPS2025后即可对查询质量进行人工评判,适用于模型性能对比或数据质量分析。
背景与挑战
背景概述
在个性化旅游推荐系统领域,如何构建能够真实反映用户多样化偏好与复杂查询意图的基准测试数据集,始终是制约算法评估与模型泛化能力提升的关键瓶颈。现有数据集多依赖历史交互日志,难以覆盖新兴目的地、季节性变化及可持续性指标等动态要素。SynthTRIPs数据集由Ashmi Banerjee等研究者在2025年发表于SIGIR会议的研究中提出,依托涵盖43个国家200个欧洲城市的综合知识库,整合景点热度、月度游客流量、步行友好度及空气质量指数等多维信息,通过大语言模型生成合成查询,旨在为个性化旅游推荐器提供更贴近现实场景的标准化评估基准。该数据集填补了知识驱动型查询生成框架的空白,对推动旅游推荐系统的鲁棒性测试与跨领域迁移研究具有重要影响。
当前挑战
SynthTRIPs所应对的核心挑战在于旅游推荐领域基准查询的稀缺性与生成质量的可控性。一方面,传统推荐系统评估依赖固定模板或历史行为数据,无法模拟用户对城市可持续性、季节性偏好等复杂约束的灵活表达,导致模型在实际场景中泛化能力不足。另一方面,数据集构建过程中面临多重技术难点:如何从异构知识库中提取结构化信息以支撑LLM生成语义连贯的查询,如何设计提示模板确保查询覆盖意图多样性并避免偏差,以及如何通过专家评估验证生成查询的真实性与合理性。此外,跨城市文化差异与数据稀疏性进一步增加了知识库构建的复杂度,而查询生成的长尾分布问题也对评估指标的公平性提出更高要求。
常用场景
经典使用场景
SynthTRIPS数据集的核心经典用途在于为个性化旅游推荐系统构建一个知识驱动的基准查询生成框架。该数据集覆盖了43个欧洲国家的200个城市,整合了景点、活动、城市热度、季节性游客流量以及步行性与空气质量等可持续性指标,为研究者提供了丰富的多维度信息。通过利用Llama-3.2-90B和Gemini-1.5-Pro-002等大型语言模型生成合成查询,该数据集支持在受控条件下模拟用户偏好,从而评估和优化推荐算法的性能,成为旅游推荐领域标准化测试的基石。
实际应用
在实际应用中,SynthTRIPS可赋能旅游科技公司开发更精准的行程规划工具,例如根据用户对步行友好性或空气质量的偏好,智能推荐欧洲城市的最佳游览路线与季节。其生成的查询可用于训练聊天机器人或移动应用中的交互式推荐系统,提升用户体验的个性化程度。此外,该数据集还能辅助城市旅游管理部门进行流量预测与可持续性分析,通过模拟不同游客群体的需求,优化资源配置并减少过度旅游对环境的冲击。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于其查询生成流水线的对比研究,如评估不同大型语言模型在旅游推荐任务中的表现差异。研究者还利用其知识库开发了可解释性推荐算法,探索如何将城市可持续性指标融入用户偏好建模。此外,SynthTRIPS的专家评估工具启发了人机协同的验证方法,促进了半自动化基准构建的标准化流程。这些工作共同推动了旅游信息检索与推荐系统领域的实证进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务