遇见数据集

Ko-widesearch

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Ko-WideSearch是一个专为评估网络代理能力设计的韩语广度搜索基准测试数据集。其核心任务要求代理穷举枚举一个封闭集合中的所有成员,并完整填充表格的每个属性单元格(例如,“列出第59届大钟奖的所有奖项类别并给出每位获奖者”)。数据集包含228个任务,根据复杂度分为三个难度等级:简单级(116个任务,涉及单一主键,属性主要位于成员页面)、中级(67个任务,涉及更宽的表格或跨来源属性)和困难级(45个任务,涉及多列、二维复合键和跨来源查询)。数据以JSONL格式存储,每条记录代表一个任务,包含明文字段(如任务ID、难度等级、主题类别等)和加密字段(如任务提示和标准答案,经过Canary-XOR混淆加密以防止网络爬虫抓取和训练集去重过滤,确保基准测试的公平性)。解密后的标准答案包括答案集、来源、列信息、评分规范等。该数据集适用于问答和表格问答任务,特别用于评估网络代理在韩语环境下进行广度信息检索、信息整合和结构化表格生成的能力。模型预期输出为一个单一的Markdown表格,列与解密后的列一致,需覆盖集合中的每个成员,并使用“/”表示确实缺失的单元格;评分基于单元格级别,考核集合成员资格和属性匹配度。

Ko-WideSearch is a Korean breadth-search benchmark dataset designed to evaluate web agent capabilities. Its core task requires agents to exhaustively enumerate all members in a closed set and fully populate each attribute cell of a table (e.g., List all award categories of the 59th Daejong Film Awards and provide each winner). The dataset contains 228 tasks, divided into three difficulty tiers based on complexity: easy (116 tasks, involving a single primary key with attributes mainly on member pages), medium (67 tasks, involving wider tables or cross-source attributes), and hard (45 tasks, involving multiple columns, two-dimensional composite keys, and cross-source queries). Data is stored in JSONL format, with each record representing a task. Records include plaintext fields (such as task ID, difficulty tier, category, number of columns in the answer table, and a public Canary string for decryption) and encrypted fields. The core task prompt (question) and standard answer (answer) are obfuscated using Canary-XOR encryption to prevent web crawling or inclusion in training set deduplication filters, ensuring benchmark fairness and leakage prevention. The decrypted answer field is a dictionary containing answer_set (standard answer rows), exclusions, sources, n_rows, columns, column_specs, key_columns, hardness_tier, as_of, and evaluation (scoring specifications). The dataset is suitable for question answering and table QA tasks, particularly for evaluating web agents ability in Korean-language breadth information retrieval, information integration, and structured table generation. The expected model output is a single Markdown table with columns matching the decrypted columns, covering every member in the set, and using / to denote genuinely missing cells. Scoring is based on cell-level evaluation, assessing set membership and attribute matching.

创建时间:
2026-06-22
原始信息汇总

数据集名称

Ko-WideSearch

数据集简介

Ko-WideSearch 是一个韩语广度搜索基准测试(breadth-search benchmark),旨在评估网络智能体(web agent)在韩语环境中执行穷举枚举封闭集合填充表格所有属性单元格任务的能力。数据集共包含 228 个任务,分为三个难度等级。

数据集语言

  • 韩语(ko)

数据集许可

  • CC-BY-4.0

数据集标签

  • 任务类别:问题回答(question-answering)、表格问题回答(table-question-answering)
  • 标签:网络智能体(web-agents)、广度搜索(breadth-search)、韩语(korean)、集合枚举(set-enumeration)、加密(encrypted)

数据集大小

  • 样本总数 < 1000(n<1K)

数据集拆分

拆分 样本数量 描述
easy 116 单一主键,属性大多在成员页面中
medium 67 表格更宽 / 跨来源属性
hard 45 多列,二维复合键,跨来源
总计 228

数据格式

每条记录为一个 JSON 对象。部分字段为明文,关键的 questionanswer 字段已加密。

字段 是否加密 描述
id 任务 ID(格式:kws-...
difficulty_tier 难度等级:easy / medium / hard
category 主题分类(如:娱乐/媒体、体育等)
n_cols 答案表格的列数
canary 公共金丝雀字符串(=解密密钥)
question 韩语任务提示
answer 所有标准答案字段的 JSON 包(解密后为字典)

解密 answer 后得到包含以下字段的字典:answer_set(标准答案行)、exclusions(排除项)、sources(来源)、n_rows(行数)、columns(列名)、column_specs(列规格)、key_columns(键列)、hardness_tier(难度等级)、as_of(截止时间)和 evaluation(评分规范)。

加密与解密

  • 加密方案:Canary-XOR 混淆,与 OpenAI BrowseComp 和 Forival/LiveBrowseComp 相同。
  • 加密方式:将 canary 字符串通过 SHA-256 哈希生成密钥,对明文 UTF-8 字节进行 XOR 操作,然后 Base64 编码。
  • 解密方法:提供 Python 示例代码,可本地解密。
  • 数据集中包含独立的 decrypt.py 脚本,可批量解密。

任务输出规范

每个问题的预期输出是一个 Markdown 表格,列名为解密后的 columns,需覆盖集合中的每一个成员,对于真正缺失的单元格用 / 表示。评分依据解密后的 evaluation 规范,进行基于单元格的匹配(集合成员 + 每个属性匹配)。

相关链接

  • 项目页面:https://minstar.github.io/Ko-widesearch/
  • 论文:Ko-WideSearch: A Korean Breadth-Search Benchmark for Web Agents

引用格式

bibtex @misc{kowidesearch2026, title = {Ko-WideSearch: A Korean Breadth-Search Benchmark for Web Agents}, author = {Jeong, Minbyul}, year = {2026}, url = {https://minstar.github.io/Ko-widesearch/} }

搜集汇总
数据集介绍
Ko-widesearch 数据集图片
构建方式
Ko-WideSearch是一个专为韩语Web智能体设计的广度搜索基准数据集,旨在评估智能体对封闭集合进行穷举枚举并填充表格属性单元格的能力。该数据集包含228个任务,依据难度划分为easy、medium和hard三个层级,其中easy层级包含116个任务,涉及单一主键且属性主要存在于成员页面;medium层级有67个任务,覆盖更宽泛的表格及跨来源属性;hard层级包含45个任务,涉及多列、二维复合键及跨来源数据。每个任务记录以JSON格式存储,包含任务ID、难度层级、类别、列数等元数据,关键字段question和answer采用canary-XOR混淆加密,以确保基准测试的公平性,防止泄露。
特点
该数据集的核心特色在于其广度搜索的评估范式,要求智能体不仅检索信息,还需系统性地枚举封闭集合中的所有成员,并精确填充每个属性单元格。任务内容涵盖娱乐、体育等多个类别,构建了从简单到复杂的难度梯度,能够全面检验智能体的信息检索、跨源整合及结构化输出能力。数据集的加密机制借鉴了OpenAI BrowseComp的混淆方案,通过公开密钥即可本地解密以进行评测,有效防止了QA对在网页爬取和训练集去重中的意外暴露,维护了基准测试的持续有效性。
使用方法
使用该数据集时,研究者可通过HuggingFace Datasets库加载数据,并利用提供的解密函数对加密字段进行还原。解密过程基于SHA-256哈希的canary密钥与XOR算法,首先对base64编码的密文进行解码,再将重复至密文长度的密钥与字节流逐位异或,最终得到明文的question与answer字段。解密后的answer包含gold行的answer_set、排除项、来源、列规范及评估准则等丰富信息。模型输出应符合Markdown表格格式,覆盖集合所有成员,且缺失单元格使用'/'标记,评分机制依据每个单元格的集合成员属性及属性匹配进行精确计分。
背景与挑战
背景概述
随着网络智能体(web agent)技术的发展,如何评估其在大规模信息检索与结构化数据填充方面的能力成为亟待解决的问题。Ko-WideSearch数据集于2026年由韩国研究者Minbyul Jeong提出,聚焦于韩语环境下的广度搜索(breadth-search)任务,旨在测试智能体在封闭集合中穷举枚举并填充表格所有属性单元格的表现。该数据集包含228个任务,按难度分为易、中、难三个层级,覆盖娱乐、体育等多个领域。通过加密问答对以防止数据泄露,Ko-WideSearch为韩语网络智能体研究提供了首个标准化基准,推动了多语言智能体评估体系的完善,对相关领域具有显著的学术与应用价值。
当前挑战
Ko-WideSearch所解决的核心领域挑战是网络智能体在广度搜索任务中的表现评估,特别是面对韩语复杂查询时,智能体需从多个异构网页中穷举所有目标条目并精确填充表格属性,这要求模型具备全面的信息抽取、跨源对齐与结构化输出能力。构建过程中,研究者面临三重挑战:一是设计涵盖不同枚举复杂度与属性多样性的任务集,确保难度梯度的合理性;二是采用canary-XOR混淆技术加密问答对,防止数据被网络爬虫或训练集去重过滤器捕获,维护基准的公平性;三是制定细粒度评估规范,支持单元格级别的集合成员判定与属性匹配评分,以实现对智能体性能的精准度量。
常用场景
经典使用场景
Ko-WideSearch数据集专为评估和推动Web智能体在广度搜索(breadth-search)任务中的表现而设计。其核心任务要求智能体在开放网络上进行穷举式枚举,即完整地找出某个封闭集合内的所有元素,并精确填充表格中的每一个属性单元格。例如,智能体需回答“列出第59届大钟奖的所有奖项类别及各自的获奖者”。该数据集涵盖228个精心构建的问答任务,依据难度分为简易、中等、困难三个层级,旨在系统性地考验智能体在复杂真实网络环境下的信息检索、跨源整合与结构化输出能力。作为首个专注韩语广度搜索的基准,它填补了非英语环境下Web代理评估的空白。
衍生相关工作
Ko-WideSearch的发布催生了多项重要相关研究工作。在方法论层面,研究者基于其任务特性提出了专门针对深度广度搜索的强化学习框架,通过改进智能体的探索策略来提升对封闭集合的枚举成功率。在模型评估领域,该基准已被整合进韩语大语言模型及Web代理的综合性评估套件中,作为衡量模型长文本理解与多步推理能力的关键一环。此外,它推动了对抗性环境下Web代理鲁棒性的研究,部分工作借鉴了其数据加密机制,探索如何构建更安全的、抗数据污染的训练和测试流程。同时,受其启发,一些跨语言的广度搜索基准数据集相继涌现,将穷举式枚举任务拓展至日语、中文等语言环境,形成了更加丰富的Web智能体评估生态。
数据集最近研究
最新研究方向
Ko-WideSearch的提出标志着韩语网络代理研究从简单的单轮问答迈向综合性广度搜索评估的新阶段。该基准聚焦于封闭集穷举枚举与表填充任务,通过三档难度梯度(简单/中等/困难)系统评估代理在跨源信息整合、复合键查询与属性补全等场景下的执行能力。为应对训练数据污染问题,其采用异或混淆加密机制保护问答对,延续了OpenAI BrowseComp等前沿基准的防泄漏设计理念。这一研究方向深刻呼应了多语言网络代理评测的热潮,尤其在韩语这种低资源语言环境中,为未来构建更鲁棒的自主信息获取系统提供了关键评估框架与可复现基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务