遇见数据集

wanderlust-ai-dataset

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集是Wanderlust AI旅行推荐应用生成的合成数据集,用于构建双层旅行推荐和行程规划系统。数据集包含两个文件:destinations_final.csv(2861行)描述220个真实城市的旅行体验,每个城市从13种旅行者画像(如预算背包客、奢华旅行者、美食家、家庭、独自女性旅行者、数字游民、蜜月夫妇、户外爱好者、退休人士、朋友团体、健康/瑜伽修行者、摄影师/Instagrammer、历史/文化爱好者)角度生成描述;pois_final.csv(23256行)包含各城市内真实命名的兴趣点(餐厅、咖啡馆、酒店、博物馆、海滩等)及其AI生成描述。总样本26117行。数据使用Meta Llama 3.1-8B-Instant模型通过Groq API生成,未使用网络爬虫。清洗过程移除了8176个完全重复的POI条目、728个模糊匹配重复项、5个提示指令泄露条目和4个空描述条目,并修正了509个(city, persona)重复行。探索性分析显示城市覆盖偏向欧洲和亚洲,描述长度因画像而异,POI类别以餐厅、咖啡馆、酒店为主。手动质量审核(80个样本)显示总体准确率63.7%(95% CI: 53.2%–74.3%),其中历史遗迹、酒店和海滩准确率高,餐厅和咖啡馆错误率较高。数据集已知限制包括:餐厅和咖啡馆建议需谨慎;某些城市类别深度不均;小众POI类别地理集中;可能存在少量残留重复。数据集预期用途为:构建旅行推荐系统、测试嵌入模型、探索合成数据生成技术,不作为经过验证的旅行指南。

This dataset is a synthetic dataset generated by the Wanderlust AI travel recommendation application, used to build a two-layer travel recommendation and itinerary planning system. The dataset contains two files: destinations_final.csv (2861 rows) describing travel experiences of 220 real cities, each city generated from the perspective of 13 traveler personas (such as budget backpacker, luxury traveler, foodie, family, solo female traveler, digital nomad, honeymoon couple, outdoor enthusiast, retiree, group of friends, wellness/yoga practitioner, photographer/Instagrammer, history/culture enthusiast); pois_final.csv (23256 rows) containing real-named points of interest within each city (restaurants, cafes, hotels, museums, beaches, etc.) along with AI-generated descriptions. Total samples: 26117 rows. The data was generated using the Meta Llama 3.1-8B-Instant model via the Groq API, without web scraping. The cleaning process removed 8176 exact duplicate POI entries, 728 fuzzy duplicate entries, 5 prompt injection entries, and 4 empty description entries, and corrected 509 duplicate (city, persona) rows. Exploratory analysis shows city coverage is biased towards Europe and Asia, description length varies by persona, and POI categories are dominated by restaurants, cafes, and hotels. Manual quality review (80 samples) shows an overall accuracy of 63.7% (95% CI: 53.2%–74.3%), with high accuracy for historical sites, hotels, and beaches, but higher error rates for restaurants and cafes. Known limitations include: caution needed for restaurant and cafe recommendations; uneven depth in some city categories; geographic concentration of niche POI categories; possible residual duplicates. Intended use: building travel recommendation systems, testing embedding models, exploring synthetic data generation techniques; not to be used as a verified travel guide.

创建时间:
2026-07-30
原始信息汇总

✈️ Wanderlust AI — 旅游推荐数据集

📋 数据集概览

该数据集用于驱动 Wanderlust AI,一个双层旅游推荐和行程生成应用。第一层将用户的旅行“氛围”匹配到真实目的地;第二层在选定目的地内推荐真实景点;生成式功能则构建个性化的每日行程。

项目 详情
生成方式 Meta 的 Llama 3.1-8B-Instant(通过 Groq 免费推理 API)
方法 对真实、命名地点的 AI 生成描述(无网络爬取)
总规模 26,117 行
覆盖范围 6 大洲的 220 个真实城市

📊 数据结构

destinations_final.csv — 2,861 行

220 个真实城市的描述,每个城市从 13 种不同旅行者人设角度撰写。

主要列: city(城市)、country(国家)、region(大洲/地区)、persona(旅行者人设)、vibe_tags(氛围/主题标签)、budget_level(预算等级:穷游/中等/奢华)、best_season(最佳旅行季节)、description(AI 生成的个性化描述)

13 种人设: 预算背包客、奢华旅行者、美食家、带小孩的家庭、独自女性旅行者、数字游民、蜜月情侣、探险/户外爱好者、退休/老年旅行者、朋友团体、健康/瑜伽静修追求者、摄影师/Instagram 博主、历史/文化爱好者

pois_final.csv — 23,256 行

每个城市内的真实命名景点(餐厅、咖啡馆、酒店、博物馆、海滩等)。

主要列: name(地点名称)、category(景点类别)、description(AI 生成描述)、city(所在城市)、country(所在国家)

🧹 数据清洗

  • 移除 8,176 条完全重复的 POI 记录和 728 条模糊匹配的近似重复记录(90% 相似度阈值,同类别内匹配)
  • 统一了人设、类别和预算等级中的不一致大小写
  • 移除 5 条包含泄露提示指令文本的异常记录
  • 移除 4 条描述为空的记录
  • 在后续推荐系统测试中发现并移除 509 条重复的 (city, persona)

📈 探索性数据分析

  • 城市覆盖:偏重欧洲(78 城)和亚洲(56 城);所有 13 种人设均匀分布(各约 220 条)
  • POI 覆盖:每城 POI 数量 44 至 179 个(平均 105.7 个)
  • 描述长度:目的地描述(平均 418 字符)远长于 POI 描述(平均 98 字符)
  • 类别分布:餐厅和咖啡馆在所有地区占据主导;小众类别呈地域性集中,如“观景点”仅出现在欧洲,“水疗/健康场所”仅出现在亚洲和北美
  • 预算分布:各区域内预算等级均衡,与现实生活成本无关联

🔍 数据质量审计

人工核验 80 条随机样本(对照真实世界来源):

判定 数量 百分比
✅ 准确 51 63.7%
❌ 错误/幻觉 19 23.75%
⚠️ 不确定 10 12.5%

统计置信度: 准确率 63.7%(95% 置信区间:53.2%–74.3%,n=80)

按类别的错误率:

  • 高错误率:咖啡馆(63%)、海滩酒吧(60%)、餐厅(55%)
  • 低错误率:历史遗址(0%)、海滩(0%)、酒店(10%)、博物馆(25%)

主要发现: 餐厅和咖啡馆的可靠性明显低于其他类别,尽管它们是数量最大的两个类别。历史遗址、酒店和海滩高度可靠。

幻觉模式: 模型有时会将真实地标/地点名称错误地附加虚构的商业类型,例如“Restaurant Kapuzinerberg”(Kapuzinerberg 是萨尔茨堡的真实山丘地标,无此餐厅)、“Puri Saren Agung Restaurant”(实为乌布的真实宫殿/礼拜场所)、“Dar Chouara Museum”(混淆了非斯的真实 Chouara 皮革厂与虚构博物馆)。

⚠️ 已知局限性

  • 餐厅和咖啡馆推荐需比历史遗址、博物馆或酒店更谨慎对待
  • 部分城市类别深度不均(如某些城市历史遗址/博物馆覆盖薄弱)
  • 小众 POI 类别按设计呈地域集中,非全球均匀分布
  • 基于名称的模糊匹配存在固有限制,可能残留少量近似重复 POI 记录

🎯 预期用途

该数据集用于驱动双层旅游推荐系统(目的地匹配 + 目的地内 POI 匹配)。适用于构建推荐系统、测试嵌入模型和探索合成数据生成——不适用作事实性、经过验证的旅行指南

📄 许可证

MIT

作者: Omer Inbar & Ohad | Reichman University — Adelson School of Entrepreneurship | Introduction to Data Science | 2026

搜集汇总
数据集介绍
wanderlust-ai-dataset 数据集图片
构建方式
在人工智能驱动的旅行推荐系统研究中,高质量领域数据的匮乏长期制约着模型性能的发挥。wanderlust-ai-dataset的构建依托Meta公司Llama 3.1-8B-Instant大语言模型,经由Groq推理API完成内容生成。构建者首先从六大洲筛选出220座文献记载充分、旅游资料丰富的真实城市,以降低模型幻觉风险;继而从13种旅行者画像(如预算背包客、奢华旅行者、美食家、亲子家庭等)的视角出发,对每座城市生成个性化描述,并依据城市氛围标签动态分配兴趣点类别,生成具有真实感名称与描述的兴趣点条目。原始生成规模达35,536行,经去重、大小写规范化、剔除提示词泄漏及空描述等清洗步骤后,最终保留26,117行,涵盖2,861条目的地记录与23,256条兴趣点记录,远超课程作业万行数据的最低要求。
特点
该数据集在结构与内容两个维度均展现出鲜明的设计特征。整体覆盖220座真实城市、6大洲及13种旅行者画像,目的地条目包含城市、国家、区域、画像、氛围标签、预算等级、最佳季节与描述等字段,兴趣点条目则涵盖名称、类别、描述、所属城市与国家。目的地描述平均长度约418字符,显著长于兴趣点的98字符,体现了二者在推荐系统中角色差异的刻意设计。数据质量审计显示,人工核验的80个随机样本中准确率为63.7%(95%置信区间53.2%–74.3%),其中历史遗迹、酒店与海滩类条目可靠度极高,而餐厅与咖啡馆类因底层模型训练数据覆盖不足而错误率偏高,并呈现出将真实地标误植为虚构商业场所的系统性幻觉模式。嵌入空间分析进一步揭示,目的地嵌入未按区域或氛围形成清晰聚类(轮廓系数仅0.042–0.052),而兴趣点嵌入则呈现显著更强的聚类结构(轮廓系数峰值0.171),支持采用相似度检索而非硬聚类作为推荐架构。
使用方法
该数据集面向双层旅行推荐与行程生成应用而设计,使用者可通过HuggingFace平台加载destinations_final.csv与pois_final.csv两个配置文件。推荐流程分为两层:Layer A通过paraphrase-multilingual-MiniLM-L12-v2句嵌入模型将用户自由文本“氛围”查询映射至FAISS余弦相似度索引,检索最契合的目的地,并支持按画像、预算与区域进行过滤;Layer B在选定目的地内推荐相关兴趣点,借助类别感知的关键词映射机制防止类别串扰。生成层复用Llama 3.1-8B-Instant模型,基于推荐结果与用户偏好生成逐日行程。数据集附带完整的项目笔记本,涵盖数据生成、清洗、探索性分析、推荐系统、行程生成与应用代码,可供复现与二次开发。需注意该数据集定位为合成数据,适用于推荐系统构建、嵌入模型测试及合成数据生成研究,不宜作为经事实核验的旅行指南使用。
背景与挑战
背景概述
近年来,合成数据在推荐系统与自然语言处理交叉领域受到广泛关注,其核心价值在于以可控成本构建大规模、多维度且隐私友好的训练资源。在此背景下,wanderlust-ai-dataset 由 Reichman University Adelson 创业学院的 Omer Inbar 与 Ohad Danon 于 2026 年创建,旨在支撑双层旅行推荐与行程生成应用。该数据集借助 Meta Llama 3.1-8B-Instant 生成覆盖六大洲 220 座真实城市的旅行描述与兴趣点信息,原始规模达 35,536 行,清洗后保留 26,117 行,并按 13 种旅行者画像进行组织。其核心研究问题在于如何将用户抽象的旅行偏好与真实目的地和兴趣点进行语义匹配,并为合成数据在推荐系统中的可靠性评估提供了可复用的实验基础。
当前挑战
该数据集所面对的领域问题在于旅行推荐中用户意图的模糊性与语义匹配的准确性,其核心挑战在于如何从自由文本的旅行偏好中稳健检索出真正契合的目的地与兴趣点。构建过程中的挑战则集中于合成数据的质量控制:人工审计显示整体准确率仅为 63.7%,餐馆与咖啡馆类别的错误率高达 55% 至 63%,并出现将真实地标错误赋予虚构商业类型的系统性幻觉模式;此外,生成重试逻辑导致 509 条重复的目的地记录,兴趣点嵌入与清洗后数据之间亦发生错位。嵌入空间分析进一步表明,目的地嵌入缺乏清晰的聚类结构,轮廓系数仅为 0.042 至 0.052,使得基于硬聚类的组织方式难以奏效。
常用场景
经典使用场景
在旅行推荐系统与个性化行程规划领域,wanderlust-ai-dataset以其双层架构设计成为典型的基准数据资源。该数据集囊括220座真实城市的2861条目的地描述与23256条兴趣点记录,每条目的地均从13种旅行者画像视角撰写,并附带氛围标签、预算层级与最佳季节等元数据。经典使用场景即以自然语言“氛围”查询为起点,经由句向量编码与FAISS余弦相似度检索完成目的地匹配,继而在选定城市内进行类别感知的兴趣点推荐,最终由大语言模型生成逐日行程。
解决学术问题
合成数据在推荐系统中的可靠性与偏差问题长期困扰学界,该数据集通过人工核验80条随机样本提供了63.7%准确率的量化基准,并揭示餐厅与咖啡馆类目错误率显著高于历史遗迹、酒店与海滩的规律。其嵌入空间分析表明目的地向量不呈现按地理或氛围的清晰聚类,轮廓系数仅0.042至0.052,而兴趣点向量聚类结构明显更强,轮廓系数可达0.171,为相似度检索优于硬聚类的架构决策提供了实证依据,亦为合成数据质量审计方法学贡献了可复用的分析范式。
衍生相关工作
围绕该数据集衍生出多项经典工作:其一为基于Qwen2.5-0.5B的LoRA微调模型,用于结构化旅行意图抽取,在147个样本上完成训练与评估;其二为多轮对话式旅行助手的检索增强生成实现,将推荐结果作为外部知识约束模型输出;其三为面向嵌入模型选择的对比实验,系统评估了all-MiniLM-L6-v2、all-mpnet-base-v2与paraphrase-multilingual-MiniLM-L12-v2三种预训练句向量模型,最终确立多语言模型在氛围查询中的优势,为后续旅行领域嵌入研究提供了参照基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务