DeepWideSearch
收藏资源简介:
DeepWideSearch是一个用于评估信息搜索代理深度和广度能力的数据集。该数据集包含220个问题,涵盖15个不同领域,要求代理进行多跳检索路径的深度推理。数据集通过两种方法构建:Deep2Wide转换和Wide2Deep转换,并经过人类验证确保数据质量。DeepWideSearch旨在解决现实世界中同时需要深度推理和广泛信息收集的复杂任务。
DeepWideSearch is a dataset dedicated to evaluating the depth and breadth capabilities of information-seeking agents. This dataset comprises 220 questions spanning 15 distinct domains, requiring agents to conduct deep reasoning over multi-hop retrieval paths. It is constructed via two approaches: Deep2Wide transformation and Wide2Deep transformation, and underwent human validation to ensure data quality. DeepWideSearch is designed to tackle complex real-world tasks that demand both deep reasoning and extensive information gathering.
Marco-Search-Agent 数据集概述
数据集简介
Marco-Search-Agent 包含两个具有挑战性的智能体基准测试,揭示了当前AI系统在现实世界应用中的关键差距。
包含的基准测试
HSCodeComp
任务目标:从嘈杂的产品列表中预测10位协调制度(HS)编码
数据集规模:632个专家标注的产品
覆盖领域:27个HS章节,32个电子商务类别
核心挑战:分层规则包含模糊语言和隐式决策逻辑
性能对比:
- 人类表现:95.0%(10位准确率)
- 最佳AI表现(SmolAgent + GPT-5 VLM):46.8%
DeepWideSearch
任务目标:通过生成结构化表格(实体×属性)回答复杂查询
数据集规模:220个多跳、多属性问题(英文和中文)
输出特征:
- 平均每个答案包含414个信息单元
- 平均推理深度:4.21步
性能表现:最佳AI(WebSailor + Claude Sonnet 4)成功率仅为2.39%
数据集资源
| 数据集 | Huggingface地址 | GitHub数据路径 |
|---|---|---|
| HSCodeComp | https://huggingface.co/datasets/AIDC-AI/HSCodeComp | HSCodeComp/data/test_data.jsonl |
| DeepWideSearch | https://huggingface.co/datasets/AIDC-AI/DeepWideSearch | DeepWideSearch/data/ |
评估方法
- HSCodeComp:使用HSCodeComp/eval/test_llm.py评估10位HS编码预测
- DeepWideSearch:使用DeepWideSearch/scripts/batch_eval.sh进行评估
许可证
本项目采用Apache-2.0许可证
数据来源说明
数据集基于公开可访问的数据源构建:
- HSCodeComp使用真实电子商务平台的产品数据
- DeepWideSearch基于BrowseComp、BrowseComp-ZH和WideSearch数据集构建




