遇见数据集

t-tech/TRuST

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

TRuST 是一个俄语类 BrowseComp-Plus 的网络搜索基准,旨在评估语言模型和搜索代理的检索能力。它包含 324 个困难组合式短答案问题,覆盖俄语网络。该基准由人工标注者手动创建:每个问题都经过编写、验证,并链接到包含推导最终答案所需证据的黄金支持文档。基准旨在衡量模型在固定搜索索引中查找正确证据的能力,特别是在俄语和俄罗斯网络特定信息检索场景中。基准涵盖 8 个主题类别:商业与技术、体育、新闻与政治、科学与学术出版物、媒体与艺术、法规与法律、地理、历史与档案。还包括 5 种搜索挑战类型:多跳、结构化证据、时间追踪、实体消歧和比较推理,以测试检索器在俄罗斯网络上处理碎片化、嘈杂且结构不一致信息的能力。

TRuST is a Russian BrowseComp-Plus-like web-search benchmark designed to evaluate the retrieval abilities of language models and search agents. It contains 324 hard compositional short-answer questions over the Russian web. TRuST was created manually by human annotators: each question was written, verified, and linked to gold supporting documents that contain the evidence required to derive the final answer. The benchmark is designed to measure how well a model can find the right evidence in a fixed search index, especially in Russian-language and Runet-specific information-seeking scenarios. Benchmark covers a broad range of Russian-language information-seeking tasks across 8 topic categories: Business & Technology, Sports, News & Politics, Science & Academic Publications, Media & Art, Regulation & Law, Geography, History & Archives. The benchmark also includes 5 types of search challenges: Multihop, Structured evidence, Temporal Tracking, Entity Disambiguation, Comparative Reasoning, that reflect different retrieval failure modes and test whether a retriever can navigate fragmented, noisy, and inconsistently structured information on the Russian web.

提供机构:
t-tech
搜集汇总
数据集介绍
t-tech/TRuST 数据集图片
构建方式
TRuST基准的构建依托于一套严谨的人工标注与验证管线。首先,由15名标注员创作需要复杂网络搜索才能回答的组合式提问。随后,每道题目均经过答案验证以确保其拥有简短且明确的黄金标准答案。标注员进一步为每个任务链接包含答案所必需信息的黄金支持文档,并将这些文档解析为统一文本格式,用于固定检索索引的构建。遵循BrowseComp-Plus的设计,从搜索引擎结果页中采集额外的非黄金文档作为负样本,以丰富检索评估的难度。最后,借助GPT-5.4对任务的可解性与证据一致性进行质量审查,并使用Qwen3-Embedding-8B模型对所有解析后的文档进行嵌入,构建固定的检索索引,为基准评估奠定基础。
特点
该基准涵盖商业与技术、体育、新闻与政治等8大主题类别,并基于SealQA分类体系,精心设计了多跳推理、结构化证据提取、时序追踪、实体消歧与比较推理五种检索挑战类型。这些任务类型精准模拟了在俄语网络环境下,检索系统面对信息碎片化、命名不一致、区域性页面及法律政府文档等复杂场景时可能遭遇的典型失败模式。TRuST保留了BrowseComp风格任务中硬组合式简短答案的结构,每项任务均包含问题、简短黄金答案及其支持文档,能有效衡量模型在固定索引中定位正确证据的能力。
使用方法
使用TRuST进行评估时,需首先克隆完整仓库并通过解密脚本对加密的基准文件进行解密,以获取查询、答案集与相关映射文件。随后,将解密后的查询文件、证据相关性映射、固定检索索引及语料库等关键组件,按照指定路径映射至BrowseComp-Plus评估框架的对应目录中,并替换原有的评估与检索脚本。配置环境变量指向正确的语料库路径后,即可利用该框架运行检索评估,系统将基于固定的下游答案生成与评判流程,输出模型在俄罗斯网络检索场景下的表现指标。
背景与挑战
背景概述
TRuST(T-Tech Russian Search Test)是由T-Tech研究团队于2025年发布的俄语网络搜索基准数据集,旨在评估语言模型与搜索智能体在俄语网络环境下的检索能力。该数据集包含324个由人工标注员精心构造的复合型简短回答问题,覆盖商业与技术、体育、新闻政治、科学学术等八大主题类别,并借鉴SealQA分类体系定义了多跳推理、结构化证据、时间追踪、实体消歧与比较推理五种检索挑战类型。作为BrowseComp-Plus基准的俄语变体,TRuST聚焦于俄语网络特有的信息碎片化、命名不一致、区域性页面及官方文档等检索难题,为俄语信息检索与语言模型评估提供了关键测试平台,推动了多语言检索评估领域的发展。
当前挑战
TRuST所解决的领域核心挑战在于,现有检索基准多聚焦于英语场景,难以衡量模型在俄语及俄罗斯网络环境中的真实表现。俄语网络存在信息来源分散、实体命名与音译复杂、时间敏感信息更新滞后、结构化数据与法律文献混杂交织等问题,导致模型在跨文档证据整合、异名实体区分、时序信息定位及多候选属性比较等任务中频繁失效。在构建过程中,15名人工标注员需手动编写并验证需复杂网络搜索的复合问题,收集并解析支持文档与负样本,同时通过质量审核机制确保任务可解性与证据一致性,构建流程对人力投入与质量控制提出了极高要求。
常用场景
经典使用场景
TRuST数据集专为评估俄语环境下大语言模型与搜索代理的检索与推理能力而构建。其核心使用场景聚焦于复杂的短答案组合型搜索任务,要求模型在固定的检索索引中精准定位分散于多个俄语网页源中的证据。数据集的324个问题覆盖商业、科技、体育、新闻、科学、艺术、法律、地理与历史等多个领域,并设计了多跳推理、结构化证据提取、时序追踪、实体消歧及比较推理五种类型的检索挑战,全面模拟了Runet(俄语互联网)特有的信息碎片化、命名不一致、区域性内容与政府文档等检索困境。
实际应用
在产业应用层面,TRuST可有效服务于俄语互联网搜索产品质量的评估与优化。搜索引擎开发者可利用该基准检验检索系统对俄语中长尾查询的处理能力,特别是在处理包含多个隐含条件、依赖旧有网页存档或需区分同名不同实体(如机构、人物简称)的任务时的表现。此外,该数据集可指导构建基于LLM的搜索代理产品,如俄语智能问答系统、企业知识库检索工具及法律与法规文档的自动化查询系统,帮助这些应用克服俄语网络特有的数据噪声与结构不一致性。
衍生相关工作
TRuST的构建理念深受BrowseComp-Plus与SealQA等基准的启发,并在此基础上针对俄语场景进行了专门适配。其采用了BrowseComp-Plus的固定索引评估框架,使得后续研究者可在相同的检索条件下直接对比不同模型的俄语检索性能。该数据集的出现催生了一系列以俄语为中心的信息检索研究工作,包括针对多跳推理的俄语检索器优化、面向表格与列表的结构化证据提取模块开发,以及融合时序推理与实体消歧的混合检索策略探索。这些衍生研究共同拓展了跨语言检索增强生成(RAG)技术的边界,为构建更鲁棒的多语种搜索代理奠定了理论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务