遇见数据集

tripmatch-ai-plan-comparisons

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

TripMatch AI 计划比较数据集是 TripMatch AI 的扩展,由 Amit 教授指定。该数据集比较原始每日旅行计划与由大语言模型生成的更丰富的替代计划,并使用另一个大语言模型作为法官进行评判。所有判决以严格的JSON格式生成,Python仅用于编排、持久化和JSON模式验证,不参与评分或决策。跨模型评判机制确保法官不评判自身生成的计划:Gemma 3 生成的替代方案由 Qwen 3 评判,反之亦然。评估标准包括预算对齐、节奏对齐、持续时间可行性、伴侣适宜性、实际组织和目的地特异性。完整配置包含10,000个样本,重要字段包括原始每日计划(daily_plan_original)、替代每日计划(daily_plan_alternative)、创建模型(created_by_model)、法官模型(judge_model)、比较JSON(comparison_json)、总体胜者(overall_winner)、置信度(confidence)和JSON有效性(json_valid)。整体LLM决策结果显示:9,960个替代方案胜出,36个原始方案胜出,4个平局。数据集提供三个配置:full(10,000样本)、gemma_judge(5,000样本,由Gemma 3评判的Qwen 3替代方案)和qwen_judge(5,000样本,由Qwen 3评判的Gemma 3替代方案)。所有比较结果也以JSON和JSON Lines格式独立导出,便于直接检查。

The TripMatch AI Plan Comparison Dataset is an extension of TripMatch AI, specified by Professor Amit. This dataset compares original daily travel plans with richer alternative plans generated by large language models, using another large language model as a judge for evaluation. All judgments are generated in strict JSON format, with Python used only for orchestration, persistence, and JSON schema validation, not for scoring or decision-making. The cross-model evaluation mechanism ensures that the judge does not evaluate its own generated plans: alternative plans generated by Gemma 3 are judged by Qwen 3, and vice versa. Evaluation criteria include budget alignment, pace alignment, duration feasibility, companion suitability, practical organization, and destination specificity. The full configuration contains 10,000 samples, with key fields including original daily plan (daily_plan_original), alternative daily plan (daily_plan_alternative), created by model (created_by_model), judge model (judge_model), comparison JSON (comparison_json), overall winner (overall_winner), confidence (confidence), and JSON validity (json_valid). Overall LLM decision results show: 9,960 alternative plans win, 36 original plans win, and 4 ties. The dataset provides three configurations: full (10,000 samples), gemma_judge (5,000 samples, Qwen 3 alternatives judged by Gemma 3), and qwen_judge (5,000 samples, Gemma 3 alternatives judged by Qwen 3). All comparison results are also exported independently in JSON and JSON Lines formats for easy inspection.

创建时间:
2026-08-23
原始信息汇总

TripMatch AI Plan Comparisons 数据集详情

数据集概述

TripMatch AI Plan Comparisons 是一个用于旅行计划比较的英文文本生成数据集,基于 TripMatch AI 项目的扩展。该数据集通过 LLM(大语言模型)作为评判者,对原始每日旅行计划与更丰富的替代计划进行比较,并输出结构化的 JSON 格式评判结果。数据集采用 CC-BY-SA-4.0 许可证。

核心任务

  • 使用 LLM 作为评判者(LLM-as-a-judge)比较原始旅行计划与替代旅行计划
  • 评判过程通过 vLLM 结构化输出约束为严格 JSON 格式
  • Python 仅负责任务编排、持久化和 JSON Schema 验证,不参与评分、选择胜者或编写解释
  • 无效的评判内容会发送回同一 LLM 进行完整重新生成

交叉模型评判机制

  • Gemma 3 生成的替代计划由 Qwen 3 进行评判
  • Qwen 3 生成的替代计划由 Gemma 3 进行评判
  • 此设计防止模型评判自身生成的计划

评判标准

评判模型依据以下六个维度进行评估:

  1. 预算一致性(Budget Alignment)
  2. 节奏一致性(Pace Alignment)
  3. 时长可行性(Duration Feasibility)
  4. 同伴适配性(Companion Suitability)
  5. 实际组织性(Practical Organization)
  6. 目的地特异性(Destination Specificity)

数据集配置与规模

配置名称 样本数 数据大小 下载大小
full 10,000 136,505,004 字节 55,117,818 字节
gemma_judge 5,000 61,982,006 字节 23,015,747 字节
qwen_judge 5,000 74,522,998 字节 30,147,080 字节

所有配置均包含 train 数据划分。

评判结果分布

  • 9,960 个决策为替代计划获胜
  • 36 个决策为原始计划获胜
  • 4 个决策为平局

主要数据字段

计划信息字段

  • daily_plan_original:原始每日计划
  • daily_plan_alternative:替代每日计划
  • daily_plan_alternative_rich:更丰富的替代每日计划
  • destinationcountry_or_categoryduration_dayscompanionsbudgetpaceroute_typeprimary_themesecondary_themedifficultyrecommended_season

模型与生成字段

  • created_by_modelgenerator_modelgenerator_familyalternative_modelmodel_family
  • judge_modeljudge_family(用于评判的模型信息)
  • prompt_versionprompt_techniquesgeneration_seedgeneration_parametersgpu_hardware

评判结果字段

  • comparison_json:完整的 JSON 评判结果
  • overall_winner:总体获胜者
  • confidence:置信度
  • overall_explanation:总体解释
  • json_valid:JSON 是否有效
  • 六个维度的评分字段:原始分数、替代分数、获胜者及原因(例如 budget_alignment_original_scorebudget_alignment_alternative_scorebudget_alignment_winnerbudget_alignment_reason

验证与元数据字段

  • validation_passedvalidation_errorsrepair_attempted
  • original_word_countalternative_word_countrichness_ratiooriginal_alternative_similarity
  • source_datasetsource_configsource_revisionfull_run_id

可复现性文件

  • comparison_schema.json:严格的 JSON 契约
  • jobs/tripmatch_cross_model_judge_vllm.py:GPU LLM 评判与检查点
  • jobs/tripmatch_merge_comparisons.py:验证、数据集查看器发布及汇总指标

额外导出文件

数据集还提供独立的 JSON 文件供直接检查:

  • exports/all_comparisons.json:包含全部 10,000 个比较对象的 JSON 数组
  • exports/all_comparisons.jsonl:JSON Lines 格式
  • exports/manifest.json:包含行数、验证率、文件大小和 SHA-256 校验和

源数据集

本数据集的源数据来自:avihayamor/tripmatch-ai-daily-plan-alternatives

搜集汇总
数据集介绍
tripmatch-ai-plan-comparisons 数据集图片
构建方式
TripMatch AI Plan Comparisons 数据集源于对原始旅行计划与增强替代计划的系统性对比研究。该数据集通过跨模型评判机制构建,即由Gemma 3生成的替代方案交由Qwen 3进行评判,反之亦然,以此规避模型自我偏好偏差。评判过程严格遵循预定义的JSON Schema,由LLM输出结构化判定结果,包括六个维度的评分、胜负判定、置信度及解释;所有判定均通过vLLM结构化输出生成,并经Python进行JSON有效性校验,确保数据合规性。最终汇集10,000条对比记录,形成完整的训练集。
特点
该数据集具备鲜明的跨模型评审特征,每个样本包含原始及替代旅行计划的详细字段,覆盖预算对齐、节奏匹配、时长可行性、同伴适配性、组织实用性与目的地特异性六个核心评价维度。数据质量严格受控,所有判定均为JSON有效,且包含丰富的元数据如生成模型、评判模型、提示版本与硬件信息,支持对模型生成与评判过程的全面溯源。数据集提供full、gemma_judge与qwen_judge三种配置,便于按需研究,并附带总体胜负分布与各标准均分图表,直观呈现模型偏好。
使用方法
研究人员可直接加载该数据集用于文本生成、模型对比评估及旅行规划任务。用户可通过HuggingFace datasets库选择特定配置(如full)读取样本,利用daily_plan_original与daily_plan_alternative字段进行内容分析,依据overall_winner、confidence及各维度分数验证LLM判断逻辑。同时,数据集中提供的comparison_json字段保留了原始结构化判定,便于复现实验或作为微调数据。此外,导出的JSON与JSONL文件支持离线分析,可与manifest.json中的校验信息配合,确保数据完整性。
背景与挑战
背景概述
TripMatch AI Plan Comparisons数据集是Amit教授指导下TripMatch AI项目的扩展,旨在系统性地评估大语言模型在旅行规划生成中的质量。该数据集创建于2025年,由Amit及其团队构建,核心研究问题在于如何客观、可重复地比较由不同LLM生成的原始旅行计划与增强替代计划的优劣。通过引入跨模型评判机制,即Gemma 3生成的计划由Qwen 3评判,反之亦然,有效避免了模型自我偏好的偏差。该数据集包含10,000条比较记录,涵盖预算对齐、节奏匹配、时长可行性、同伴适配度、组织实用性及目的地特异性等多维度评估指标,为LLM在复杂任务上的表现提供了一种严谨的评估范式,对旅行规划生成领域及LLM作为评判者的研究具有重要参考价值。
当前挑战
该数据集所面临的挑战主要体现在领域问题解决与构建过程两方面。在领域层面,LLM生成的旅行计划往往缺乏结构一致性,难以在预算、行程节奏等关键维度上与用户需求精确对齐,现有的评估方法多依赖人工评分,成本高昂且主观性强。构建过程中,挑战在于确保评判的公平性与数据质量:需设计严格的JSON模式约束LLM输出,避免Python后处理干预决策;跨模型评判需精心配对不同模型家族,防止自我偏好;同时,面对数十个字段的复杂结构,需处理生成失败、格式错误及验证不通过等情况,并确保万条数据的生成、校验与发布流程稳定可复现,这些均对技术方案的严密性与工程执行力提出了极高要求。
常用场景
经典使用场景
TripMatch AI Plan Comparisons数据集在旅游智能规划领域具有独特价值,其核心应用场景聚焦于评估大型语言模型生成的旅行计划质量。该数据集通过交叉模型判断机制,利用Gemma 3与Qwen 3互为评审,对原始计划与丰富化替代计划进行多维度比较,涵盖预算贴合度、节奏一致性、行程可行性、同伴适配性、组织实用性与目的地针对性等关键指标。研究者可据此开展自动化旅行计划评估研究,探索不同模型在计划生成质量上的差异,并为构建更优的旅行规划系统提供数据支撑。
解决学术问题
该数据集解决了旅行规划领域中计划质量评估缺乏客观标准与可比性的学术难题。传统人工评估耗时费力且主观性强,而该数据集通过LLM-as-a-judge范式,实现了大规模、细粒度、可复现的计划质量自动化评价,提供了包含评分、理由、胜者及置信度的结构化判断结果。其交叉模型设计有效避免了自评偏差,为建立公正的模型比较框架提供了范例,推动了生成式旅行计划评估方法的发展,也为后续研究提供了基准测试资源。
衍生相关工作
该数据集衍生出了一系列相关研究与实践,包括生成式旅行计划的质量评估工具、跨模型评审流程的标准化方案,以及基于LLM的结构化输出验证与修复机制。其发布的比较模式可复用于其他生成任务的评估,如文本摘要或创意写作。此外,数据集中包含的10,000条完整判断记录为元评估研究提供了丰富语料,可进一步探索LLM评审的偏差、可解释性及与人类评审的一致性,推动AI生成内容评价体系的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务