遇见数据集

ViHoRec

收藏
github2026-07-14 更新2026-07-16 收录
官方服务:

资源简介:

一个经过质量控制、匿名化、可用于基准测试的越南酒店推荐数据集,用于推荐系统研究。数据集包含用户与酒店的交互数据、用户信息和酒店信息,通过爬取原始酒店评论并经过标准化、去重和匿名处理生成。

A quality-controlled, anonymized Vietnamese hotel recommendation dataset designed for benchmarking recommender system research. This dataset encompasses user-hotel interaction data, user profiles and hotel profiles, which is generated by crawling original hotel reviews followed by standardization, deduplication and anonymization processing.

创建时间:
2026-07-13
原始信息汇总

数据集概述

ViHoRec 是一个面向越南酒店评论的质量控制、匿名化且可用于基准测试的数据集,专门为推荐系统研究设计。该数据集通过可复现的流水线从原始爬取数据中构建。

核心特性

  • 规模:包含 18,267 条经过清洗后的交互记录,涉及 6,832 位用户和 560 家酒店。
  • 数据来源:原始交互记录 18,274 条,分别来自 Booking(7,597 条)、Traveloka(6,273 条)和 Ivivu(4,404 条)。
  • 数据清洗:经过实体匹配,合并了 21 个跨站点名称变体,其中 78 家酒店在至少两个站点上出现。
  • 基准划分:采用时间序列的留最后一项(leave-last-one-out)划分方式,形成训练集 9,787 条、测试集 800 条,涉及 800 位用户和 535 个项目,稀疏度达 97.53%。

数据内容

数据集以 CSV 文件形式发布,包含以下内容:

  • interactions.csv:用户 ID、酒店 ID、评分、日期、来源。
  • users.csv:用户 ID、交互次数。
  • hotels.csv:酒店 ID、名称、位置。
  • benchmark/:包含 train.csv、test.csv 及对应的映射文件,以及划分配置和基线结果。

许可与使用

  • 数据许可:CC BY-NC 4.0(非商业使用)。
  • 代码许可:MIT 许可,提供完整的可复现流水线脚本。
  • 运行要求:Python ≥ 3.9,依赖 pandas、numpy、scikit-learn。如需运行完整 SOTA 基准测试,还需 cornac 和 recommenders 库。

相关文档

数据集附有完整的 Datasheets-for-Datasets 文档(DATASHEET.md),包含质量控制报告、分析报告以及标注一致性评估等材料。

搜集汇总
数据集介绍
ViHoRec 数据集图片
构建方式
ViHoRec数据集的构建始于从Booking、Traveloka和Ivivu三大平台爬取原始酒店评论数据,共计18,274条交互记录。随后,通过可复现的流水线执行质量控制,包括去重、缺失值处理、一致性检查以及跨站点实体匹配,通过文本标准化(如口音和停用词规范)成功合并了21个跨站名称变体。接着,采用基于食盐哈希的匿名化技术移除用户身份信息,确保隐私合规。最终,按照留最后一项的时间分割策略生成基准数据集,为推荐系统研究提供标准化的训练和测试集。
特点
ViHoRec具备多项突出特点:首先,经过严格质量控制,最终保留18,267条高质量交互、6,832位用户和560家酒店,数据纯净度极高。其次,跨平台实体匹配使得78家酒店在两个以上站点拥有对应记录,丰富了跨域推荐潜力。此外,基准数据集呈现极端的稀疏性(97.53%),真实反映了实际推荐场景的挑战。数据集还附带完整的质量报告、冷启动评估和标注一致性分析,支持用户历史长度分层的性能评估,为算法鲁棒性研究提供多维参考。
使用方法
使用ViHoRec时,研究者可直接从release目录加载公开的交互、用户和酒店CSV文件,或利用benchmark子文件夹中的训练测试分割进行模型评估。推荐运行流水线的基线脚本,快速重现随机、最流行、协同过滤及BPR-MF等基准结果。进阶用户可通过Cornac或Recommenders库训练状态最优模型,并使用data_analysis.py进行长尾分布、基尼系数等分析。建议设置环境变量VIHOREC_SALT以复现匿名化过程,代码和脚本均采用MIT许可,便于扩展和自定义实验。
背景与挑战
背景概述
在推荐系统研究领域,高质量、标准化的数据集是推动算法创新与性能评估的基石。ViHoRec(Vietnamese Hotel Recommendation Dataset)应运而生,由研究团队于近年构建并发布,旨在填补越南酒店推荐场景中标准化基准数据集的空白。该数据集从Booking、Traveloka和Ivivu三大主流平台爬取原始评论数据,经过严格的质量控制、实体匹配与匿名化处理,最终形成包含18,267条交互记录、6,832名用户和560家酒店的精炼集合。其核心研究问题聚焦于多源异构数据的融合、跨平台实体对齐以及时间感知的推荐评估范式。ViHoRec通过提供可复现的数据构建流水线与基准测试框架,为越南语环境下的推荐系统研究奠定了坚实基础,并对理解新兴市场中的用户行为模式与酒店推荐挑战产生了重要影响。
当前挑战
ViHoRec所解决的领域挑战主要体现为多源数据融合与稀疏性难题。在推荐系统层面,数据源自三个平台,存在用户重叠稀疏、评分尺度不一致及跨平台实体名称歧义等问题,传统算法在此类多源异构场景下易因数据碎片化而性能衰减。构建过程中,团队面临三大挑战:其一,实体匹配需应对越南语特有的声调符号与停用词变异,通过定制化的文本归一化算法实现仅21处跨站点名称合并;其二,数据清洗后仅移除极少量无效记录,但基准划分仍呈现97.53%的高稀疏度,对协同过滤模型构成严峻考验;其三,匿名化需在保护隐私与保留用户行为模式间取得平衡,采用Salted-HMAC假名方案确保不可逆的同时维持时间序列的连续性,为时序推荐评估提供可靠支撑。
常用场景
经典使用场景
ViHoRec 数据集为越南酒店推荐系统的研究提供了标准化的基准测试平台。研究人员常将其用于评估协同过滤、矩阵分解及内容感知推荐算法在真实多源评论数据上的表现。数据集采用时间留一法分割,有效模拟了用户历史行为与未来偏好之间的时序关系,适合进行离线评估与模型对比。其交互数据涵盖评分、时间戳及来源平台信息,为跨平台用户建模和推荐鲁棒性研究奠定了数据基础。
实际应用
ViHoRec 支持开发面向越南市场的个性化酒店推荐服务。实际应用中可基于其交互特征,构建冷启动缓解与长尾物品推荐策略。平台可整合 Booking、Traveloka 等来源的评分数据,为用户提供跨站点综合推荐结果。该数据集还适用于动态偏好建模,支撑实时行程规划与促销活动的智能推送,相关部署需适配数据集的时序分割与稀疏性约束。
衍生相关工作
基于 ViHoRec 衍生的工作包括:利用预训练语言模型对用户历史行为进行编码的序列推荐模型;融合多源评论内容与评分矩阵的混合推荐方法;以及基于图神经网络的跨平台用户兴趣迁移研究。此外,针对其 97.53% 的高稀疏特性,研究者提出了非均匀负采样策略与数据增强技术,显著提升了长尾物品的推荐覆盖率与排序准确性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务