遇见数据集

ViHoRec

收藏
arXiv2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

ViHoRec是一个经过质量控制的越南酒店推荐数据集,由胡志明市国家大学的研究团队创建,旨在填补越南语推荐系统领域公开数据的空白。该数据集包含18,267条用户与酒店之间的交互记录,涉及6,832名用户和560家酒店,数据来源于Booking.com、Traveloka和Ivivu三大预订平台,并整合了309家酒店的元数据信息。数据集的构建过程采用了可复现的采集流程,通过跨平台实体解析技术统一酒店名称,并实施了严格的定量质量控制与隐私保护处理。该数据集主要应用于推荐系统研究领域,特别针对冷启动场景下的个性化推荐问题,为低资源语言环境下的酒店推荐算法提供了真实的稀疏数据测试基准。

ViHoRec is a quality-controlled Vietnamese hotel recommendation dataset developed by a research team from Vietnam National University Ho Chi Minh City, aiming to fill the gap of publicly available datasets in the Vietnamese recommendation system domain. This dataset contains 18,267 user-hotel interaction records, involving 6,832 users and 560 hotels. The data is sourced from three major booking platforms: Booking.com, Traveloka, and Ivivu, and integrates metadata information for 309 hotels. The dataset construction adopts a reproducible data collection pipeline, unifies hotel identities across platforms via cross-platform entity resolution technology, and implements rigorous quantitative quality control and privacy protection measures. This dataset is primarily applied in recommendation system research, particularly for personalized recommendation tasks in cold-start scenarios, serving as a realistic sparse data test benchmark for hotel recommendation algorithms in low-resource language environments.

创建时间:
2026-07-15
原始信息汇总

数据集概述:ViHoRec — 越南酒店推荐数据集

ViHoRec(Vietnamese Hotel Recommendation Dataset)是一个面向推荐系统研究的、经过质量控制、匿名化处理且可直接用于基准测试的数据集。该数据集源自从 Booking、Traveloka 和 Ivivu 三个网站爬取的原始酒店评论,并通过一套可复现的流水线进行构建。

关键特征

  • 数据来源:爬取自 Booking、Traveloka 和 Ivivu 三个旅行预订网站。
  • 数据规模
    • 原始交互记录:18,274 条。
    • 清洗后数据:18,267 条交互记录,涉及 6,832 个用户560 家酒店
  • 实体匹配:通过实体匹配合并了 21 个跨网站的名称变体,其中 78 家酒店在至少两个网站上出现。
  • 基准测试分割:采用留一法(leave-last-one-out)时间分割,构建了包含 800 个用户、535 个物品的基准测试集,共 9,787 条训练数据和 800 条测试数据,稀疏度为 97.53%。

数据内容与结构

数据集目录结构如下:

  • release/:公开发布的匿名化数据集(采用 CC BY-NC 4.0 许可)。
    • interactions.csv:用户与酒店的交互记录,包含用户 ID、酒店 ID、评分、日期和来源。
    • users.csv:用户信息,包含用户 ID 和交互次数。
    • hotels.csv:酒店信息,包含酒店 ID、名称和位置。
    • benchmark/:基准测试数据,包含训练集(train.csv)、测试集(test.csv)及对应的映射文件(*_map.csv)、分割配置(split_config.json)和基线模型结果。
  • scripts/:用于复现数据构建流程的全部代码(采用 MIT 许可),涵盖质量控制、匿名化、基准测试分割、基线模型运行、数据分析及冷启动评估等步骤。
  • reports/:质量控制报告。
  • annotation/:用于人工评估的验证表和一致性评估示例。
  • DATASHEET.md:数据集文档,遵循 Datasheets-for-Datasets 标准。
  • LICENSE:数据集采用 CC BY-NC 4.0 许可,代码采用 MIT 许可。

可用性与复现

  • 环境要求:Python ≥ 3.9,依赖库包括 pandasnumpyscikit-learn
  • 复现流程:可通过运行 scripts/ 目录下的脚本来端到端复现数据集的生成,包括质量控制、匿名化、基准测试分割、基线模型评估、数据分析和冷启动评估。
  • 基线模型:内置了 Random、MostPop、ItemKNN、UserKNN、BPR-MF 及基于 TF-IDF 的内容模型等基线。
  • 额外模型:可通过 cornacrecommenders 库运行更多前沿模型。
搜集汇总
数据集介绍
ViHoRec 数据集图片
构建方式
ViHoRec数据集从越南三大主流订房平台Booking.com、Traveloka和Ivivu采集原始评论数据,通过API调用与HTML解析相结合的方式获取用户对酒店的评分及时间戳信息。针对跨平台酒店名称不一致的问题,构建了基于规范键的实体解析流程,对酒店名称进行去重音、小写化、去除标点及领域停用词、词序排序等标准化处理,将581个原始名称合并为560个规范酒店实体。经过精确去重与近似去重双重校验,最终保留18,267条高质量交互记录,涵盖6,832名用户与560家酒店,并额外为309家酒店收集了包含设施、周边环境、价格等11项属性的内容元数据。
使用方法
ViHoRec数据集适用于协同过滤、基于内容及混合推荐模型的开发与评估,尤其适合冷启动与稀疏数据场景下的算法研究。使用者应采用论文提供的公开时间序列划分方案(保留至少4次交互的800名用户,以最后一次交互作为测试集)以确保公平比较。数据集提供交互表、用户表、酒店表及内容元数据表,可利用设施、周边、邻近和价格四类文本属性构建基于词向量的内容特征。附带的零依赖基线代码与超参数配置支持快速复现实验,所有资源均可通过GitHub仓库获取。
背景与挑战
背景概述
在推荐系统研究领域,高质量的用户-项目交互数据集是推动算法创新与评估的基石。然而,现有广泛使用的推荐数据集如MovieLens、Amazon Reviews和HotelRec等,主要面向英语市场,严重缺乏针对越南语场景的公开酒店推荐资源。为填补这一空白,来自越南胡志明市大学理学院的Minh Hoang Nguyen及其团队于2026年发布了ViHoRec数据集。该数据集从Booking.com、Traveloka和Ivivu三大主流预订平台爬取,经过严格的质量控制与跨平台实体解析,最终包含18,267条用户-酒店交互记录,涉及6,832名用户与560家酒店,并附有309家酒店的内容元数据。ViHoRec的核心研究问题在于构建一个可复现、质量可控、保护隐私且能真实反映冷启动挑战的越南酒店推荐基准,其发布为低资源语言与稀疏数据场景下的推荐系统研究提供了首个可复现的越南语测试平台。
当前挑战
ViHoRec数据集所面临的挑战深刻且多维。首先,在领域问题层面,越南酒店推荐面临极端冷启动与数据稀疏性的双重困境:数据集中69.5%的用户仅有单次交互,整体稀疏度高达99.52%,且项目流行度高度倾斜(基尼系数0.599),这使得传统协同过滤模型在冷启动用户上性能急剧下降(例如BPR-MF的Recall@10从0.120跌至0.065),凸显了低资源场景下个性化推荐的严峻挑战。其次,在数据集构建过程中,三大挑战尤为突出:跨平台酒店名称不一致性要求实施严格的实体解析(合并了21个名称变体并识别出78家跨平台酒店);网络爬取数据需通过可复现的量化指标进行质量审计(如重复率、完整性与一致性检测);公开发布必须在去除直接标识符的同时(采用HMAC-SHA256假名化)仍支持可复现的冷启动基准测试,这些难题共同构成了ViHoRec建设中的核心障碍。
常用场景
经典使用场景
ViHoRec作为首个公开的越南语酒店推荐数据集,其核心价值在于为低资源语言环境下的推荐系统研究提供了真实、可复现的测试平台。该数据集最经典的使用场景是冷启动推荐问题的评估与建模,因其69.5%的用户仅拥有一条交互记录,且整体稀疏度高达99.52%,天然构成了对协同过滤算法的严苛考验。研究者可借助其公开的时间序列留一法划分,系统性地对比各类推荐模型在用户历史稀疏条件下的表现差异,从而深入理解模型在真实越南旅游市场数据上的泛化能力与个性化瓶颈。
解决学术问题
ViHoRec的提出有力回应了越南语推荐领域长期缺乏标准化语料库的窘境,填补了跨平台实体消解与可复现质量控制流程在非英语推荐数据集构建中的方法论空白。该数据集通过公开的管道代码与量化质量指标,解决了数据集构建过程中的重复记录、实体歧义与隐私保护三大核心挑战,使得学术社区能够在可比较的基准上评估冷启动场景下的推荐性能。其分层冷启动分析结果揭示了学习型模型在极稀疏用户子集上的显著退化趋势,为领域内长期存在的稀疏性与冷启动难题提供了来自低资源语言的实证证据。
实际应用
在实际应用中,ViHoRec所模拟的场景直接对应于越南蓬勃发展的在线旅游市场,尤其适用于面向Booking.com、Traveloka与Ivivu等主流平台的酒店推荐系统开发。数据集所包含的设施、周边环境、价格等结构化元数据,为构建混合推荐模型或跨模态特征融合提供了基础资源。在工业实践中,该数据集可用于验证与调优冷启动用户的个性化推荐策略,例如对历史记录不足三条的用户,评估基于流行度或邻域方法的推荐效果。此外,其隐私保护设计(HMAC伪昵称机制)为商业场景下的合规数据共享提供了可参考的工程范式。
数据集最近研究
最新研究方向
在低资源语言环境与稀疏数据场景下,ViHoRec作为首个经质量控制的越南酒店推荐基准数据集,聚焦于冷启动困境的精准刻画与可复现评估。前沿研究利用其跨平台实体解析和量化质量控制流程,验证了协同过滤模型在极端稀疏交互下的性能崩塌——尤其当用户历史交互少于4条时,BPR-MF的Recall@10从0.120骤降至0.065,而UserKNN凭借邻域鲁棒性仍保持最优。这一发现揭示了饱和英文语料库难以暴露的真实越南市场痛点:69.5%的冷启动用户、99.52%的数据稀疏度及高度倾斜的物品流行度(基尼系数0.599),共同将ViHoRec塑造成检验流行度偏差缓解算法与混合推荐模型的严苛试验场。该资源通过公开时序划分、依赖无关基线及去中心化消融实验,为后续融合内容元数据的跨域冷启动研究奠定了可复现基石,直接回应了东南亚旅游推荐领域长期缺乏标准化评估资源的空白。
相关研究论文
  • 1
    ViHoRec: A Quality-Controlled Vietnamese Hotel Recommendation Dataset and Cold-Start Benchmark胡志明市国家大学; 胡志明市自然科学大学·信息技术学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务