遇见数据集

trek-finder

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Trek Finder是一个完全合成的徒步路线与旅行者评论数据集,旨在支持自然语言徒步搜索应用。用户可以用自己的语言描述想要的徒步路线,系统返回匹配的路线。该数据集由Qwen2.5-1.5B-Instruct模型生成,作为数据科学入门课程期末项目的一部分。数据集包含三个主要部分:路线目录(treks.csv,193条路线)、评论数据集(reviews_final.csv,11,249条评论,为核心数据)和评估查询集(eval_queries.csv,701条查询,清理后为446条)。每条路线包含字段:trek_id、路线名称、国家、地区、景观类型、难度、持续时间、预算等级、最大海拔、最佳季节、是否需要许可证、拥挤程度、摘要等。每条评论包含字段:review_id、trek_id、旅行者类型、团体类型、访问月份、关注点、评分以及用于嵌入的评论文本。数据集适用于语义搜索、推荐系统、句子相似度计算和文本检索任务。已知限制包括:约46%的评论包含套话;696条评论在团体类型上存在矛盾;仅17%的评论提及路线名称;评估标签中36%存在错误(已清理)。建议使用预计算向量或自己嵌入时在评论文本前添加路线名称和景观类型。

Trek Finder is a fully synthetic dataset of hiking routes and traveler reviews, designed to support natural language hiking search applications. Users can describe their desired hiking route in their own words, and the system returns matching routes. The dataset was generated by the Qwen2.5-1.5B-Instruct model as part of a final project for an introductory data science course. It consists of three main parts: a route catalog (treks.csv with 193 routes), a review dataset (reviews_final.csv with 11,249 reviews, the core data), and an evaluation query set (eval_queries.csv with 701 queries, cleaned to 446). Each route includes fields: trek_id, route name, country, region, landscape type (e.g., alpine, desert, jungle), difficulty (1-5), duration (days), budget level, max altitude, best season, permit requirement, crowding level, summary, etc. Each review includes fields: review_id, trek_id (foreign key), traveler type, group type, visit month, focus points, rating (1-5), and review text for embedding. The dataset is suitable for semantic search, recommendation systems, sentence similarity computation, and text retrieval tasks. Known limitations include: approximately 46% of reviews contain boilerplate; 696 reviews have contradictions in group type; only 17% of reviews mention the route name; 36% of evaluation labels have errors (cleaned). It is recommended to use precomputed vectors (provided in the repository) or, when embedding, prepend the route name and landscape type to the review text.

创建时间:
2026-08-17
原始信息汇总

Trek Finder 数据集概述

基本信息

  • 许可证: MIT
  • 语言: 英语
  • 标签: 合成数据、旅行、徒步、语义搜索、推荐
  • 数据规模: 10K-100K 条记录
  • 任务类型: 句子相似性、文本检索
  • 数据配置:
    • reviews: 训练集(11,249 条评论)
    • treks: 训练集(193 条徒步路线)
    • eval_queries: 测试集(701 条查询)

数据集内容

这是一个完全合成的徒步路线和旅行者评论数据集,旨在支持自然语言徒步搜索应用,用户可以用自然语言描述想要的徒步路线,应用返回匹配的路线。

核心文件

文件 行数 说明
treks.csv 193 路线目录
reviews_final.csv 11,249 主数据集,每行一条评论
eval_queries.csv 701 带标签的搜索查询
eval_queries_clean.csv 446 审核后的可用测试集
embeddings.npy 11,249 应用使用的向量
search_index.csv 11,249 嵌入文本,与向量对齐

treks.csv 字段

  • trek_id(关联 reviews 表)
  • trek_name, country, region
  • landscape_type: 高山、沙漠、丛林、沿海、火山、北极、森林、峡谷
  • difficulty: 1(简单)至 5(非常困难)
  • duration_days: 2 至 22 天
  • budget_level: 低、中、高
  • max_altitude_m, best_season, permit_required, crowd_level
  • summary: 35-45 词

reviews_final.csv 字段

  • review_id
  • trek_id(外键关联 treks.csv)
  • persona: 8 种旅行者类型之一
  • group_type: 独自、情侣、朋友、家庭、导游团
  • month_visited, focus, rating(1-5 分)
  • review_text: 用于嵌入的字段

eval_queries.csv 字段

  • query_text
  • true_trek_id, true_landscape, true_difficulty_band, true_duration_band, true_budget

数据生成方式

  • 使用 Qwen/Qwen2.5-1.5B-Instruct 模型生成
  • 两阶段生成:先创建 193 条路线档案,再为每条路线生成多条评论
  • 路线属性(地形、难度、时长、预算)在 Python 中采样并固定,模型仅撰写散文
  • 每条评论由 persona、团体类型、月份、关注点、开头风格和语气参数化,共 115,200 种组合
  • 使用 SEED = 42,无完全重复项,余弦相似度不超过 0.90

已知限制

  1. 固定短语: 约 46% 的评论包含陈词滥调
  2. 团体矛盾: 696 条评论描述了独自旅行但被分配了团体
  3. 路线命名率低: 仅 17% 的评论提及路线名称
  4. 语言问题: 4 条西班牙语评论已移除
  5. 评分未范围检查: 65 个 0 分和 1 个 6 分已从最终文件移除
  6. 评估标签准确性: 36% 的原始标签有误,eval_queries_clean.csv 为审核后版本
  7. 覆盖不完整: 35 条路线无测试查询,仅覆盖约 82% 的目录
  8. 事实准确性不保证: 部分路线名称对应真实路径,部分为虚构

检索性能

设置 召回率@3(含噪键) 召回率@3(干净键) 地形准确率
纯语义 10.3% 11.2% 69.7%
语义 + 约束重排序 14.0% 17.3% 72.9%
纯语义文本 9.4% 8.1% 68.4%
语义文本 + 重排序 13.8% 14.6% 67.3%
  • 最佳模型为 all-mpnet-base-v2
  • 嵌入不支持否定词(如"nothing steep"与"steep"向量相似)
  • 采用约束重排序(非过滤)来处理难度、预算、时长等属性

使用建议

  • 存储库提供预计算向量,无需重新嵌入
  • 自行嵌入评论时,应先将路线名称和地形前缀添加到 review_text
  • 不要混用不同模型生成的向量

清理过程

reviews.csv(11,569 条)清理为 reviews_final.csv(11,249 条):

  • 移除 160 条少于 40 词的评论
  • 移除 90 条与路线地形矛盾的评论
  • 移除 66 条评分超出 1-5 范围的评论
  • 移除 4 条非英语评论
  • 未发现高于 0.90 余弦相似度的近似重复

包含的 Notebooks

  • 01_dataset_generation.ipynb
  • 02_exploratory_data_analysis.ipynb
  • 03_evaluation_set.ipynb
  • 04_search_engine.ipynb
  • 05_search_fixes.ipynb
  • 07_evaluation_audit.ipynb
搜集汇总
数据集介绍
trek-finder 数据集图片
构建方式
该数据集为一个完全合成的徒步路线与旅行者点评数据集,旨在支持自然语言驱动的徒步路线搜索应用。其构建采用两阶段生成策略:首先利用Qwen2.5-1.5B-Instruct模型生成193条路线档案,随后将档案嵌入提示词中,令模型依据给定事实撰写评论,确保评论与路线信息的自洽性。关键属性如地形、难度、时长与预算并非生成,而是通过Python采样固定,以避免模型输出偏斜。每条评论由人格、团体类型、月份、焦点等参数化控制,共组合出115,200种可能性,从而保证数据多样性。最终生成11,249条评论,并附带评估查询集与预计算嵌入向量。
特点
该数据集的核心特点在于其合成性与可控性,通过参数化设计实现了高度多样性,且无重复样本,余弦相似度均低于0.90。数据集包含多维度信息,如路线属性、评论者人格、评论文本及标注查询,为语义搜索提供了丰富语料。然而,其已知局限也被明确记录,如约46%的评论含套话、696条评论存在群体矛盾、部分路线名称仅在评论中提及等。评估标签经人工审计后仅保留446条有效查询,反映了对数据质量的审慎态度。预计算嵌入向量与索引文件可直接使用,便于复现。
使用方法
数据集的使用方式清晰明确,预计算向量和索引已包含在仓库中,用户可简单加载即可实现语义搜索,无需自行嵌入。推荐使用MPNet模型进行嵌入,且向量已归一化,点积即可计算余弦相似度。若需自行嵌入,建议在评论文本前拼接路线名称和地形信息以提升检索性能。评估集提供了查询与对应路线的标签,可用于衡量检索效果。此外,提供了多个笔记本涵盖从生成、分析到评估的完整流程,便于用户深入理解并扩展研究。注意不可混用不同模型生成的向量,以保证检索结果的有效性。
背景与挑战
背景概述
Trek Finder数据集的诞生,源于对自然语言驱动的徒步路线语义检索技术的一次前沿探索,由一位数据科学入门课程的学生于近期独立构建,巧妙运用了Qwen2.5-1.5B-Instruct模型进行全流程合成。该数据集的核心研究问题在于,如何通过旅行者视角的多样化评论,而非单一官方描述,来丰富路线的语义表征,进而支持基于用户自由文本描述的高效路线匹配。其构建理念开创性地将路线属性(如难度、预算)与自然语言生成相分离,通过参数化评论生成,产出超过一万条无重复、低相似度的评论数据,为语义搜索领域提供了全新的数据范式。该数据集不仅为信息检索研究提供了测试平台,其关于模型幻觉、数据验证的深刻洞察,亦对合成数据生成领域产生了启示性影响。
当前挑战
该数据集所面临的核心挑战,首先体现在其致力于解决的领域问题之上:语义搜索需精准捕捉用户查询中的否定与约束条件,而传统嵌入模型易忽略'无陡坡'此类表达,导致返回不相关路线。其次,构建过程遭遇多重技术困境:生成模型存在默认值偏好,曾致43%路线被误标为沿海地貌;且输出内容难以确保一致性,约36%的评估查询标签自相矛盾,凸显了自动生成标签的可靠性危机。此外,评论中存在大量固定套话与群体矛盾描述,语言控制失效导致个别非英语文本混入,种种问题共同构成了对数据集质量保障与后续应用的严峻考验。
常用场景
经典使用场景
Trek Finder数据集的核心应用场景在于语义搜索与文本检索,旨在通过自然语言描述匹配远足路线。其设计理念植根于信息检索与语义相似度计算的交叉领域,利用大规模合成评论数据构建高维语义空间,以实现对用户自由文本查询的精准响应。该数据集提供预计算的嵌入向量与标准化搜索索引,支持即时的余弦相似度计算,使得开发者能够快速构建零样本的路线推荐系统,无需额外训练。其经典使用范式包括:基于查询向量的向量检索、基于约束的排序优化,以及多模态特征(如难度、预算、地形)的联合建模,为自然语言驱动的户外活动推荐提供了可复现的基准平台。
实际应用
在实际应用中,Trek Finder可用于构建旅游推荐平台、户外活动规划助手及个性化行程生成系统。例如,用户输入'寻找一条为期五天的廉价沙漠徒步路线',系统即可通过语义检索返回符合条件的路线列表,并依据难度、预算等硬性约束进行智能重排序,兼顾匹配精度与结果覆盖度。该数据集还支持多模态用户画像建模,通过评论中的旅行者类型(如独行背包客、家庭游客)与群体特征,实现细粒度的体验预测,赋能旅游产品的差异化推荐。此外,其预计算向量与轻量级推理代码,降低了部署门槛,适用于原型验证与教学演示,为自然语言处理在垂直领域的落地提供了直观案例。
衍生相关工作
该数据集衍生的相关工作主要集中在合成数据生成与评估方法论两个方向。一方面,其两阶段生成策略(先构建路线档案,再基于档案生成评论)启发了后续研究,如何在提示中注入结构化事实以保持生成内容的一致性,成为可控文本生成领域的热点。另一方面,对标签噪声的系统性审计与清理流程,催生了针对检索基准的自动清洗工具与保守型检测器,推动了对评估集可信度的重新审视。此外,基于约束的重排序技术,因其在处理否定语义和多重属性约束时的有效性,被借鉴到更广泛的推荐系统与问答场景中,例如多条件电商搜索和医疗症状匹配,形成了可迁移的算法设计模式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务