遇见数据集

kaust-generative-ai/telco-gaia

收藏
Hugging Face2026-07-04 更新2026-07-22 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 pretty_name: Telco-GAIA task_categories: - question-answering language: - en - ar tags: - agents - benchmark - gaia - rag - telco - web-navigation size_categories: - n<1K configs: - config_name: questions data_files: - split: test path: suite/agent_inputs/questions.json --- # Telco-GAIA A GAIA-style benchmark for AI agents operating over a real telecom operator's website snapshot plus a synthetic customer database. **100 tasks** across 7 categories: Pricing, Miscellaneous, Images, Web Archives, PDF, PDF Visual, Database. Agents read `questions.json` + `environment.md`, browse the local website (`:8080`) and query the database API (`:8081`), and produce a GAIA-compatible `submission.json`. ## What's here | File | What | |---|---| | `suite/agent_inputs/questions.json` | The 100 tasks given to the agent (browsable in the viewer above) | | `suite/agent_inputs/environment.md` | Tool/resource description handed to the agent | | `suite/` | Docker harness to serve the website + DB: `Dockerfile`, `docker-compose.yml`, `nginx/` | | `website_snapshot.tar.gz` | Static website snapshot served at `:8080` (LFS) | | `synthetic_db.tar.gz` | Synthetic customer DB served at `:8081` (LFS) | **Ground truth + scorer** are held in a separate **gated** dataset, `kaust-generative-ai/telco-gaia-groundtruth` (answers, `evaluate.py`, `answer_matching.py`), to prevent contamination and eval gaming. Request access there to score submissions. ## Quick start ```bash # 1. get the files huggingface-cli download kaust-generative-ai/telco-gaia --repo-type dataset --local-dir telco-gaia cd telco-gaia # 2. start the environment (website :8080, DB API :8081) # The build auto-extracts website_snapshot.tar.gz / synthetic_db.tar.gz — # no manual unzip needed. cd suite && docker compose up --build -d # 3. run your agent against questions.json + environment.md -> submission.json # 4. evaluate: get access to the gated repo, then use its scorer + answers huggingface-cli download kaust-generative-ai/telco-gaia-groundtruth --repo-type dataset --local-dir gt python gt/evaluate.py --submission submission.json --ground-truth gt/ground_truth.jsonl --output results.json ``` ## License **CC BY-NC 4.0** — Creative Commons Attribution-NonCommercial 4.0 International (https://creativecommons.org/licenses/by-nc/4.0/). Free to use, share, and adapt for **non-commercial research** with attribution. The website snapshot and synthetic DB are a captured copy of a real telecom operator's public site, redistributed for research use only. All site content, page text, trademarks, and logos remain the property of their owner; this release transfers no trademark rights. If you are the rights holder and want content removed or changed, open a discussion here. Please cite Telco-GAIA (EMNLP 2026 Industry Track) — BibTeX to be added.

A GAIA-style benchmark for AI agents operating over a real telecom operators website snapshot plus a synthetic customer database. 100 tasks across 7 categories: Pricing, Miscellaneous, Images, Web Archives, PDF, PDF Visual, Database. Agents read questions.json + environment.md, browse the local website (:8080) and query the database API (:8081), and produce a GAIA-compatible submission.json.

提供机构:
kaust-generative-ai
搜集汇总
数据集介绍
kaust-generative-ai/telco-gaia 数据集图片
构建方式
Telco-GAIA数据集以GAIA基准风格为蓝本,精心构建于真实电信运营商网站快照与合成客户数据库之上。其核心技术路径为:代理系统通过读取结构化问题文件与工具环境描述文档,自主浏览本地托管的网页服务,并查询数据库应用编程接口,最终生成符合GAIA规范的提交文件。整套环境依托Docker容器编排技术部署,涵盖前端网站与后端数据库双服务端口,旨在模拟贴近真实的电信业务操作场景。
特点
该数据集以高度专业化与任务导向性著称,包含横跨定价、图片、PDF、数据库等7大类别共100项精编任务。其独特之处在于构建了一个静态网站快照与合成客户数据库的封闭测试环境,有效排除了网络波动与数据泄露的干扰。同时,数据集将评分标准与参考答案独立存放在门控仓库中,防止评估作弊与数据污染,极大提升了基准测试的公正性与科研严谨性。
使用方法
使用Telco-GAIA时,用户首先需通过HuggingFace命令行工具下载数据集至本地目录。随后启动Docker编排容器以激活网页与数据库服务环境。开发者基于问题文件与环境描述设计代理程序,使其在本地环境中自动执行任务并生成结果文件。最后,向门控仓库申请访问权限,获取评估脚本与标准答案,通过比对提交文件与基准数据完成性能量化评估,流程清晰且可复现。
背景与挑战
背景概述
Telco-GAIA是一个由沙特阿卜杜拉国王科技大学(KAUST)生成式AI团队于2025年创建的开源基准测试数据集,聚焦于评估AI代理在真实电信运营商网站与合成客户数据库环境中的操作能力。该数据集源自GAIA基准的范式,包含100项跨7个类别的任务(如定价、图像、PDF及数据库查询),旨在推动多模态网页导航与检索增强生成(RAG)技术的进步。通过模拟电信业务场景中的复杂查询与交互流程,Telco-GAIA填补了现有基准测试在领域特定代理评估方面的空白,对工业级AI系统的实用性与鲁棒性研究具有重要影响,尤其为自动化客服与网络运维等场景提供了标准化评测框架。
当前挑战
Telco-GAIA所解决的领域问题主要集中于AI代理在动态网页环境中的自主决策与多源信息整合能力,面临的核心挑战包括:第一,真实网站快照与合成数据库的异构数据格式(如PDF、图像与结构化查询)导致的信息提取一致性难题;第二,代理需在本地服务(:8080网站与:8081数据库API)间无缝切换,对工具调用与路径规划能力提出严苛要求;第三,任务设计需规避传统基准的过度简化,通过100项精细标注的子任务模拟电信业务中模糊查询、多步骤操作及跨平台依赖等现实难题。构建过程中,团队面临网站快照的版权合规风险(需使用CC BY-NC 4.0许可并剥离商标),同时需确保合成数据库的隐私保护与场景真实性平衡,且在Docker容器化部署中解决环境复现的稳定性挑战,以避免代理评估中的非确定性误差。
常用场景
经典使用场景
在人工智能代理(AI Agent)研究领域,Telco-GAIA被广泛用作评估多模态、多工具协同智能体在真实电信业务场景下表现的标准基准。该数据集精心设计了100项任务,涵盖资费查询、图像理解、网页归档、PDF解析与数据库检索等七大类别,要求智能体在模拟的电信运营商网站快照和合成客户数据库环境中,自主完成信息检索、推理与答案生成。这一设计使得研究者能够系统性地衡量智能体在复杂、动态的网页导航与数据查询任务中的综合能力,成为检验端到端智能体系统鲁棒性与实用性的理想测试平台。
解决学术问题
Telco-GAIA直面当前大语言模型在具身化、领域化应用中的核心挑战:如何使智能体在缺乏明确结构化API的生态系统中,自主完成跨模态、跨来源的信息整合。该数据集解决了学术研究中长期存在的“模拟环境与现实复杂度脱节”问题,通过复现电信运营商网站的网页嵌套、PDF格式多样性、图片文字混排等真实障碍,迫使模型必须突破纯文本问答的局限。其意义在于构建了一个可复现、防污染的评估范式,推动了检索增强生成(RAG)、网页导航代理和数据库交互代理等方向的交叉融合研究,为智能体从实验室走向行业应用提供了关键的验证桥梁。
衍生相关工作
基于Telco-GAIA的测试框架,学术界与工业界已衍生出多项重要工作。在方法论层面,研究者开发了专门的“网页结构感知”检索策略,优化智能体在嵌套式电信套餐页面中的导航效率;同时催生了针对多模态PDF解析的预训练增强技术,提升了模型对图表与文字交叠信息的理解能力。在评估工具链方面,社区贡献了兼容GAIA协议的自动化评分器,并扩展出面向医疗、金融等垂直领域的类似基准(如Fin-GAIA、Health-GAIA),形成了以Web导航+数据库查询为核心的标准评估族。该数据集还直接启发了多家云服务商推出“智能体即服务(AaaS)”的原型产品。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务