遇见数据集

thesis-results

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是用于 MSc 论文(GSMA Open Telco AI Initiative)的加权单数字分数结果,旨在评估电信领域 RAG(检索增强生成)系统的性能。数据集包含两种评分方案:一是基于 105 个问题的完整评估集(55 个多项选择题、40 个判断题、10 个开放题),二是从 105 个问题中抽取的 84 个问题子集(40 个多项选择题、40 个判断题、4 个开放题),以匹配早期评估集的结构。每个评分方案对应两个文件:包含所有运行结果的加权分数文件和每个模型的最佳运行结果文件。每行记录包含模型 ID、显示名称、阶段(grid/no_reranker/baseline)、重新排序器标签、运行名称、加权分数百分比、问题数量、平均准确率和总成本。数据来源为 LiamDuero/telco-eval 数据集,通过 telcolens 工具中的 compute_weighted_scores.py 脚本计算。该数据集适用于电信 3GPP 标准相关问答系统的评估基准,支持不同模型和配置(如是否使用重新排序器)的性能比较。

This dataset is a weighted single-digit score result for an MSc thesis (GSMA Open Telco AI Initiative), aimed at evaluating the performance of RAG (Retrieval-Augmented Generation) systems in the telecommunications domain. The dataset includes two scoring schemes: a full evaluation set based on 105 questions (55 multiple-choice, 40 true/false, 10 open-ended) and a subset of 84 questions (40 multiple-choice, 40 true/false, 4 open-ended) extracted from the 105 questions to match the structure of an earlier evaluation set. Each scoring scheme corresponds to two files: a weighted score file containing all run results and a file with the best run results for each model. Each row contains model ID, display name, stage (grid/no_reranker/baseline), reranker label, run name, weighted score percentage, number of questions, average accuracy, and total cost. The data source is the LiamDuero/telco-eval dataset, computed using the compute_weighted_scores.py script in the telcolens tool. This dataset is suitable as an evaluation benchmark for question-answering systems related to 3GPP telecommunications standards, supporting performance comparison of different models and configurations (e.g., with or without rerankers).

创建时间:
2026-08-28
原始信息汇总

数据集概述:thesis-results

基本信息

  • 数据集名称:thesis-results
  • 许可证:other(自定义)
  • 语言:英语
  • 任务类别:问答(question-answering)
  • 标签:RAG、电信(telecom)、3GPP、评估(evaluation)、基准测试(benchmark)
  • 用途:存储作者硕士论文(GSMA Open Telco AI Initiative)中使用的加权单一评分结果

数据集内容

该数据集包含针对多个模型在电信/3GPP问答评估集上的加权评分结果,主要涉及两个评估集合:

1. 完整 105 题评估集

  • 构成:55 道多选题(mc)+ 40 道判断题(tf)+ 10 道开放式问题(open)
  • 文件对:weighted_scores.jsonweighted_scores_best_per_model.json

2. 84 题子集评估集

  • 来源:从上述 105 题中筛选出的 84 题子集(40 mc / 40 tf / 4 open),按难度优先和序列分层策略选取
  • 特点:与早期 final_3gpp_small.json 的题型结构(40/40/4)一致,但问题不同(实际重叠仅 76/84,开放式问题无重叠)
  • 注意:此评分不重新运行评估,而是从现有 105 题评估结果中筛选并重新聚合计算,无额外 API/GPU 成本
  • 文件对:weighted_scores_84from105.jsonweighted_scores_84from105_best_per_model.json

3. 试题文件

  • final_3gpp_84from105.json:实际用于上述 84 题评分的题目内容,与 LiamDuero/telco-qna-final 中的同名文件一致,复制至此以方便评分与题目对照

评分方法

加权评分公式如下:

weighted_score_pct = (1mc_correct + 1tf_correct + 5oe_correct) / (1mc_total + 1tf_total + 5oe_total) * 100

其中开放式问题权重为多选题/判断题的 5 倍,因其更能反映生成质量。该公式来源于 telcolens 仓库中 open_telco_rag/evaluation/results.py_weighted_score_pct() 方法,为每次真实评估运行的服务器端标准计算。

数据行字段说明

每条记录包含以下字段:

  • model_id:模型标识
  • model_display_name:模型显示名称
  • phase:阶段(grid / no_reranker / baseline
  • reranker_label:重排序器标签
  • run_name:运行名称
  • weighted_score_pct:加权得分百分比
  • n_questions:问题数量
  • mean_accuracy:平均准确率
  • total_cost:总成本

模型范围

评估涉及以下 6 个模型:

  • Gemma
  • TelecomGPT-R1
  • 4 个 OpenRouter 模型:DeepSeek V4 Pro 0813、GLM 5.3、Qwen3.8 27B、Mistral Small 4

排除说明otel-2.0-local 因确认存在故障(输出退化)而被排除。

数据来源与说明

  • 本数据集由 telcolens/liam/analysis_tools/compute_weighted_scores.py 构建,该脚本只读取不写入LiamDuero/telco-eval 数据集中的结果
  • 数据集的模型范围与 LiamDuero/telco-analysis 数据集一致(后者包含完整未加权指标,本数据集仅提供单一排名评分)
  • 部分运行结果尚未完成(少量 OpenRouter 无重排序器阶段、Gemma 在 105 题集上的基线测试),两个文件对仅包含实际已完成并推送的数据,待更多结果完成后可重跑相应脚本更新
搜集汇总
数据集介绍
thesis-results 数据集图片
构建方式
该数据集源自GSMA Open Telco AI Initiative下的硕士论文研究,旨在为电信领域的RAG系统评估提供量化基准。构建过程依托于telcolens代码库中的评估框架,从LiamDuero/telco-eval数据集拉取真实评估运行结果,并通过compute_weighted_scores.py脚本计算加权得分。针对105题完整集与84题子集分别生成评分文件,其中84题子集采用难度优先与系列分层抽样,确保与早期40/40/4题型结构一致。所有评估结果均来自实际运行,无额外API或GPU开销。
特点
该数据集的核心特征在于其加权单数评分机制,开放题权重为选择题的五倍,以更精准地反映生成质量。文件结构清晰,区分完整集与子集评分,并包含最佳模型表现记录。数据范围涵盖六种模型,包括Gemma、TelecomGPT-R1及多个OpenRouter模型,排除了已确认失灵的模型。评分逻辑与服务器端实现完全一致,确保科学性与可复现性,且问题集与评分数据独立存储,便于交叉验证。
使用方法
使用者可直接加载weighted_scores.json等文件,获取每个模型组合的加权得分、平均准确率与成本信息,用于对比不同配置(如基线、无重排序器等)的性能。子集评分文件可用于与历史评估集进行比较,考察评估集之间的一致性。该数据适合作为RAG系统在电信领域基准测试的参考,支持模型选择与调优决策。所有数据均为只读,可结合telcolens仓库进行结果复现与扩展。
背景与挑战
背景概述
thesis-results数据集诞生于GSMA Open Telco AI Initiative的硕士论文研究框架内,由研究者在电信领域检索增强生成(RAG)系统评估的探索中构建。该数据集聚焦于3GPP标准相关的问题解答任务,通过加权评分机制整合多项选择、真伪判断与开放式问答的多维度表现,旨在精准量化生成式AI在专业电信文献问答中的效能。数据集不仅提供了105题完整集的加权分数,还遴选出与早期评估形态对齐的84题子集,体现了对评估方法论连续性与可比性的考究。其构建依托于Telcolens仓库的自动化分析流水线,实现了从原始结果到最终排名的规范化处理,在电信AI社区中推动了RAG系统标准化评估的进程,为后续优化与基准比较提供了坚实的数据基石。
当前挑战
该数据集所解决的领域挑战在于电信领域尤其是3GPP文档的问答复杂度极高,涉及专业术语、上下文依赖及生成准确性要求,需超越传统精确匹配的评估范式,构建兼顾生成质量的加权评分体系。构建过程中的挑战尤为显著,包括需从庞杂的105题全集中提取并隔离出形态匹配的84题子集,此过程不仅要确保题目独立性和分布代表性,还需应对既有评估集题目重叠的潜在干扰,通过精确的序列分层抽样来规避。此外,数据集成涉及多个模型的多阶段运行(如网格搜索、无重排序器及基线配置),部分运行因资源限制或模型输出异常(如otel-2.0-local的退化)而缺失,需在数据不完整的条件下保证评分的真实性与可复现性,同时严格控制额外API或GPU开销,凸显了在资源约束下实现高效、可靠评估的工程挑战。
常用场景
经典使用场景
在检索增强生成(RAG)与电信标准文档问答的交叉领域,thesis-results数据集扮演着基准测试核心的角色。它精心设计了包含55道多选题、40道判断题及10道开放性问题的105题评估集,并提供了基于84题子集的二次评分,其中开放性问题的权重是其他题型的五倍,以凸显生成质量的评估深度。研究者常利用该数据集对大型语言模型在3GPP标准文档理解上的表现进行量化比较,涵盖了Gemma、TelecomGPT-R1及多种OpenRouter商业模型,系统性地分析不同检索重排序策略与模型架构对答案准确性的影响。该数据集以结构化JSON格式存储,附带每项得分与成本信息,为复现实验与基准测试提供了严谨的数据基础,成为RAG系统在垂直领域评估中不可或缺的标准化工具。
实际应用
实际应用中,thesis-results数据集和配套的评分逻辑可直接嵌入电信运营商的智能客服或内部知识检索系统,用于对基于3GPP标准构建的RAG应用进行上线前性能评估与迭代监控。产品团队借助此数据集可得出的单一加权分数,能够迅速对比不同模型与重排序配置下的端到端回答质量,进而做出成本与效果均衡的选型决策。同时,数据集公开的真实评分数据与完整的计算工具链,使开发人员能够复现评估流程,自动化的拉取与聚合脚本也简化了持续集成中的性能回归测试。在GSMA Open Telco AI倡议背景下,该数据集为跨组织间的模型效能交流提供了共同语言,有助于行业基准的形成,推动了开放电信AI生态的建设与实际落地。
衍生相关工作
该数据集的发布催生了一系列围绕电信领域RAG评估的衍生工作。后续研究基于其加权的84题子集框架,探究不同难度分布与题型比例对模型性能判定的敏感性,进一步优化了评估集的设计策略。部分工作借鉴其清晰分离的评分文件与原始问题库,构建了多任务学习基准,以联合优化检索相关性与答案生成质量。此外,该数据集记录的六模型多阶段评估数据,成为分析重排序器作用、模型规模效应及推理成本动态等议题的经验基础,相关分析被纳入多篇对比研究之中。更深远地,其开放式问题高权重的评估哲学,影响了新兴的生成式问答指标设计,促进了对生成内容忠实度自动化度量方法的探索,形成了致力于提升专业领域RAG系统可信度的连续研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务