遇见数据集

tripmatch-ai-daily-plan-alternatives

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

TripMatch AI Rich Daily Plan Alternatives 是一个公开的学术数据集,旨在通过大型语言模型(Gemma 3 或 Qwen 3)生成比原始旅行计划更丰富的每日计划替代方案。该数据集为 TripMatch AI 的升级版本,由教授分配任务产生。数据集包含 40 个样本(试点阶段),每个样本包括原始每日计划(daily_plan_original)和由 LLM 生成的丰富替代计划(daily_plan_alternative_rich),以及丰富的元数据,如目的地、持续时间、同伴、预算、节奏、主题、难度、推荐季节、主要想法、模型信息、生成参数、验证结果等。数据集的生成遵循严格的质量合同:替代计划必须保留原计划的关键属性(目的地、精确天数、同伴、预算、节奏、主题、难度、季节),与原始计划有显著差异,每天提供早上、下午、晚上和实用备注部分,详细程度至少是原计划的 2.2 倍,形成连贯的到达至离开行程,避免虚构实时价格、预订、可用性、营业时间、天气或安全保证,并通过自动结构、丰富度、多样性和相似性检查。该数据集适用于文本生成、旅行计划生成、LLM 比较和评估等任务。数据来源为 HuggingFace 上的 tripmatch-ai-dataset。生成的计划仅供旅行灵感参考,不构成预订或专业建议,用户需自行验证当前的可访问性、价格、法规、天气、可及性和官方安全指南。Gemma 的使用受 Google 的 Gemma 条款约束。

TripMatch AI Rich Daily Plan Alternatives is a public academic dataset designed to generate richer daily plan alternatives than the original travel plans using large language models (Gemma 3 or Qwen 3). This dataset is an upgraded version of TripMatch AI, produced from a professor-assigned task. It contains 40 samples (pilot phase), each including the original daily plan (daily_plan_original) and a rich alternative plan generated by the LLM (daily_plan_alternative_rich), along with rich metadata such as destination, duration, companions, budget, pace, theme, difficulty, recommended season, main idea, model information, generation parameters, validation results, etc. The dataset generation follows a strict quality contract: the alternative plan must retain the key attributes of the original plan (destination, exact number of days, companions, budget, pace, theme, difficulty, season), be significantly different from the original plan, provide morning, afternoon, evening, and practical notes for each day, have a level of detail at least 2.2 times that of the original plan, form a coherent arrival-to-departure itinerary, avoid fictional real-time prices, reservations, availability, opening hours, weather, or safety guarantees, and pass automatic structure, richness, diversity, and similarity checks. This dataset is suitable for tasks such as text generation, travel plan generation, LLM comparison and evaluation. The data source is the tripmatch-ai-dataset on HuggingFace. The generated plans are for travel inspiration only and do not constitute booking or professional advice; users should verify current accessibility, prices, regulations, weather, accessibility, and official safety guidelines. Use of Gemma is subject to Googles Gemma terms.

创建时间:
2026-08-15
原始信息汇总

数据集概述

TripMatch AI — Rich Daily Plan Alternatives 是一个公开的学术数据集,属于 TripMatch AI 项目的教授指定升级版本。该数据集的核心目标是通过在 GPU 上运行的 Gemma 3Qwen 3 模型,为原始旅行计划生成内容更丰富、结构更完整的替代每日行程。

基本信息

  • 名称: TripMatch AI Rich Daily Plan Alternatives
  • 许可证: cc-by-sa-4.0
  • 语言: 英语
  • 任务类别: 文本生成
  • 数据规模: 少于 1K 条样本(当前 pilot 配置含 40 条训练样本)
  • 标签: 旅行、合成数据、Gemma、Qwen、LLM、GPU

数据集配置

  • 唯一配置: pilot
  • 数据划分: 仅包含 train 划分,共 40 条示例,数据集大小为 227,004 字节,下载大小为 127,031 字节。

数据字段

数据集共包含 35 个字段,涵盖以下类别:

  • 标识与元数据: alternative_id、trip_id、source_dataset、source_config、source_revision
  • 行程属性: destination、country_or_category、duration_days、companions、budget、pace、route_type、primary_theme、secondary_theme、difficulty、recommended_season
  • 内容字段: main_ideas、daily_plan_original(原始计划)、daily_plan_alternative_rich(新生成的丰富替代计划)
  • 生成信息: alternative_model、model_family、prompt_version、prompt_techniques、generation_seed、generation_parameters、gpu_hardware、generation_seconds_batch_share
  • 质量控制: repair_attempted、validation_passed、validation_errors
  • 评估指标: original_word_count、alternative_word_count、richness_ratio、original_alternative_similarity、days_with_all_required_sections

质量要求

每个生成的替代计划必须满足以下条件:

  • 保留原始计划的目的地、精确时长、同行者、预算、节奏、主题、难度和季节
  • 与原始计划有显著差异
  • 每天包含上午、下午、晚间和实用提示四个板块
  • 详细程度至少是原始计划的 2.2 倍
  • 形成连贯的从到达至离开的完整行程
  • 避免虚构实时价格、预订信息、开放时间、天气或安全承诺
  • 通过自动化的结构、丰富度、多样性和相似度检查,必要时进行一次 LLM 修复

生成模型

  • google/gemma-3-4b-it
  • Qwen/Qwen3-4B-Instruct-2507

Pilot 阶段使用相同的 20 个分层采样的原始行程分别由两个模型生成,以便公平对比。经过质量与运行时间评估后,生产版本将包含 10,000 个原始行程,每个模型各生成 5,000 个替代计划。

数据来源

原始数据来源于 TripMatch AI Dataset

使用声明

生成的计划仅用于旅行灵感参考,不构成预订建议或专业咨询。用户需自行核实当前的开放情况、价格、法规、天气、无障碍设施及官方安全指南。使用 Gemma 模型需遵守 Google 的 Gemma 使用条款。

搜集汇总
数据集介绍
tripmatch-ai-daily-plan-alternatives 数据集图片
构建方式
该数据集以TripMatch AI原始旅行计划数据集为基座,汇集一万条涵盖全球目的地、行程时长、同行者构成、预算层级及旅行节奏等属性的原始行程记录。采用google/gemma-3-4b-it与Qwen/Qwen3-4B-Instruct-2507两款大语言模型,在GPU硬件环境下分别生成五千条内容更为丰满的替代性每日计划。生成过程遵循严格的质量契约:必须完整保留目的地、确切天数、同行者、预算、节奏、主题、难度与推荐季节等核心约束,同时与原始计划保持实质性差异,并为每日行程提供上午、下午、傍晚及实用备注四个完整板块。每份替代方案需通过自动化结构、丰富度、多样性与相似度校验,未达标者执行一次LLM修复尝试。
使用方法
研究者可通过Hugging Face数据集库直接加载full配置获取全部一万条记录,或按需选择gemma_generated或qwen_generated子集以聚焦单一模型的生成结果。pilot配置保留了四十条早期工程试验数据,适用于方法复现与流程验证。数据中的created_by_model字段可用于区分生成来源,original_alternative_similarity与richness_ratio等指标支持对替代方案与原计划的差异程度及内容丰度进行量化分析。该数据集主要服务于文本生成任务中的计划改写与丰富化研究,亦可作为LLM对比评估的基准资源。使用者须注意,生成内容仅为旅行灵感,不构成预订或专业建议,实际访问条件、价格、法规、天气、无障碍设施及官方安全指引均需另行核实。
背景与挑战
背景概述
行程规划作为智能旅游服务的核心环节,长期依赖人工经验或模板化生成,难以兼顾个性化约束与内容丰度。TripMatch AI Rich Daily Plan Alternatives数据集由学术机构在教授指导下构建,于2024至2025年间基于TripMatch AI原始数据集升级而成。该数据集以Gemma 3与Qwen 3两款大语言模型为生成引擎,在GPU环境下对一万条源行程分别生成更为翔实的替代日程,旨在为LLM驱动的行程改写与对照评估提供标准化基准。其核心研究问题在于:如何在严格保持目的地、时长、预算、节奏等硬性约束的前提下,实现内容显著扩充且语义多样化的日程再生成。该数据集为旅游推荐、受约束文本生成及大模型对齐研究提供了可复现的评测资源。
当前挑战
该数据集所面对的领域问题在于受约束的行程改写:生成模型须在保留原始行程全部关键属性的同时,产出在结构上与原文形成有意义差异的替代方案,这对可控文本生成与语义多样性之间的平衡提出了严苛要求。构建过程中的挑战同样多重:每一日必须完整覆盖上午、下午、晚间与实用提示四个板块,替代方案篇幅须达到原文的2.2倍以上,且需通过结构、丰度、多样性与相似度等多重自动化校验,必要时仅允许一次LLM修复。此外,需规避虚构实时价格、预订、开放时间与安全承诺等内容,同时协调两款异构模型的生成差异,确保数据质量与模型间可比性。
常用场景
经典使用场景
在个性化旅游行程生成与推荐研究领域,该数据集最为经典的使用场景是作为LLM生成式行程规划的监督微调与对比评估基准。研究者将daily_plan_original作为原始参考,把daily_plan_alternative_rich视为高质量目标输出,通过Gemma 3与Qwen 3两条生成路径构建成对样本,用于训练或评测模型在保持目的地、时长、同行者、预算、节奏与主题等约束条件下的可控文本生成能力。其逐日Morning、Afternoon、Evening与Practical note的结构化设计,使模型能够习得从抵达至离开的连贯行程编排逻辑,同时借助丰富度比率与相似度指标实现生成质量的可量化对比。
解决学术问题
该数据集直面旅游文本生成研究中长期存在的几项核心难题:其一,如何在大幅提升行程细节丰富度的同时,严格保留目的地、时长、预算与节奏等原始约束,避免生成内容偏离用户意图;其二,如何为LLM生成的开放式旅游文本建立可自动验证的结构、丰富度、多样性与相似度检查机制,并配合一次LLM修复流程来保障输出可靠性;其三,如何通过同一批分层源行程对Gemma与Qwen进行公平对照,控制模型间比较的混杂因素。这些设计为可控文本生成、约束满足与生成质量自动评估提供了可复现的学术基准。
实际应用
在实际应用层面,该数据集可支撑旅行灵感推荐系统、智能行程规划助手以及旅游内容平台的个性化攻略生成功能。行程规划引擎能够基于源描述与约束条件,调用其中蕴含的生成模式,为不同目的地、时长与旅行节奏的用户产出细节更丰富的逐日替代方案,从而提升行程的可读性与可执行参考价值。旅游平台亦可利用其结构化的字段体系,对用户行程进行自动扩写与多样化改写,缓解内容同质化问题。需要强调的是,生成计划仅作为旅行灵感,用户仍须自行核实实时价格、开放时间、天气与安全信息。
数据集最近研究
最新研究方向
在个性化旅行规划与生成式人工智能深度交融的浪潮中,TripMatch AI Rich Daily Plan Alternatives数据集正推动着大语言模型从行程要素的浅层罗列迈向日程文本的深度合成。当前前沿研究聚焦于利用Gemma 3与Qwen 3等紧凑模型生成结构完整、语义丰富且与原始行程形成显著差异的替代性每日计划,并借助丰富度比率、相似度约束与自动化校验机制保障输出质量。该资源呼应了学界对合成旅行数据可信度与多样性并重的关切,为可控文本生成、跨模型行为比较及行程推荐公平性评估提供了标准化基准,亦对旅游信息系统中负责任AI的落地具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务