ViHoRec
收藏资源简介:
ViHoRec是一个经过质量控制的越南酒店推荐数据集,由胡志明市国家大学的研究团队创建,旨在填补越南语推荐系统领域公开数据的空白。该数据集包含18,267条用户与酒店之间的交互记录,涉及6,832名用户和560家酒店,数据来源于Booking.com、Traveloka和Ivivu三大预订平台,并整合了309家酒店的元数据信息。数据集的构建过程采用了可复现的采集流程,通过跨平台实体解析技术统一酒店名称,并实施了严格的定量质量控制与隐私保护处理。该数据集主要应用于推荐系统研究领域,特别针对冷启动场景下的个性化推荐问题,为低资源语言环境下的酒店推荐算法提供了真实的稀疏数据测试基准。
ViHoRec is a quality-controlled Vietnamese hotel recommendation dataset developed by a research team from Vietnam National University Ho Chi Minh City, aiming to fill the gap of publicly available datasets in the Vietnamese recommendation system domain. This dataset contains 18,267 user-hotel interaction records, involving 6,832 users and 560 hotels. The data is sourced from three major booking platforms: Booking.com, Traveloka, and Ivivu, and integrates metadata information for 309 hotels. The dataset construction adopts a reproducible data collection pipeline, unifies hotel identities across platforms via cross-platform entity resolution technology, and implements rigorous quantitative quality control and privacy protection measures. This dataset is primarily applied in recommendation system research, particularly for personalized recommendation tasks in cold-start scenarios, serving as a realistic sparse data test benchmark for hotel recommendation algorithms in low-resource language environments.
数据集概述:ViHoRec — 越南酒店推荐数据集
ViHoRec(Vietnamese Hotel Recommendation Dataset)是一个面向推荐系统研究的、经过质量控制、匿名化处理且可直接用于基准测试的数据集。该数据集源自从 Booking、Traveloka 和 Ivivu 三个网站爬取的原始酒店评论,并通过一套可复现的流水线进行构建。
关键特征
- 数据来源:爬取自 Booking、Traveloka 和 Ivivu 三个旅行预订网站。
- 数据规模:
- 原始交互记录:18,274 条。
- 清洗后数据:18,267 条交互记录,涉及 6,832 个用户 和 560 家酒店。
- 实体匹配:通过实体匹配合并了 21 个跨网站的名称变体,其中 78 家酒店在至少两个网站上出现。
- 基准测试分割:采用留一法(leave-last-one-out)时间分割,构建了包含 800 个用户、535 个物品的基准测试集,共 9,787 条训练数据和 800 条测试数据,稀疏度为 97.53%。
数据内容与结构
数据集目录结构如下:
release/:公开发布的匿名化数据集(采用 CC BY-NC 4.0 许可)。interactions.csv:用户与酒店的交互记录,包含用户 ID、酒店 ID、评分、日期和来源。users.csv:用户信息,包含用户 ID 和交互次数。hotels.csv:酒店信息,包含酒店 ID、名称和位置。benchmark/:基准测试数据,包含训练集(train.csv)、测试集(test.csv)及对应的映射文件(*_map.csv)、分割配置(split_config.json)和基线模型结果。
scripts/:用于复现数据构建流程的全部代码(采用 MIT 许可),涵盖质量控制、匿名化、基准测试分割、基线模型运行、数据分析及冷启动评估等步骤。reports/:质量控制报告。annotation/:用于人工评估的验证表和一致性评估示例。DATASHEET.md:数据集文档,遵循 Datasheets-for-Datasets 标准。LICENSE:数据集采用 CC BY-NC 4.0 许可,代码采用 MIT 许可。
可用性与复现
- 环境要求:Python ≥ 3.9,依赖库包括
pandas、numpy、scikit-learn。 - 复现流程:可通过运行
scripts/目录下的脚本来端到端复现数据集的生成,包括质量控制、匿名化、基准测试分割、基线模型评估、数据分析和冷启动评估。 - 基线模型:内置了 Random、MostPop、ItemKNN、UserKNN、BPR-MF 及基于 TF-IDF 的内容模型等基线。
- 额外模型:可通过
cornac和recommenders库运行更多前沿模型。

- 1ViHoRec: A Quality-Controlled Vietnamese Hotel Recommendation Dataset and Cold-Start Benchmark胡志明市国家大学; 胡志明市自然科学大学·信息技术学院 · 2026年



