遇见数据集

geo-ptbr

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

GEO-PTBR是首个巴西葡萄牙语生成引擎优化(Generative Engine Optimization, GEO)基准数据集。它包含525个巴西葡萄牙语查询,每个查询对应5个源文档(共2625个源文档),并提供了在三种生成引擎(gemini-3.5-flash-lite、claude-haiku-4-5、gpt-5.6-luna)上针对每种GEO技术的引用可见性变化测量结果。该数据集是论文《GEO-PTBR: A Brazilian-Portuguese Replication of Generative Engine Optimization and the Engine-Dependence of Its Effects》的配套产物。数据分为两个子集:queries(查询)和sources(源文档)。查询子集包含525条记录,字段包括:id(标识符,健康类以s开头,法律类以j开头,房地产类以i开头)、setor(行业:saude健康、juridico法律、imobiliario房地产)、query(用户向AI助手提出的真实查询文本)、tipo(类型:normal正常500条,pegadinha陷阱25条)。陷阱查询设计为无法从给定源文档回答,作为衡量幻觉的对照组。源文档子集包含2625条记录,每个查询5个源文档,每个源文档150-400词,采用五种网站风格之一。字段包括:id(源文档标识符,格式为<query_id>_s<位置>)、query_id(所属查询ID)、posicao(在引擎上下文中的位置1-5)、titulo(标题)、texto(正文)、origem(来源字符串,记录生成模型、网站风格和陷阱标记,如sintetico:grok-4.5;estilo:portal_juridico,涵盖39种不同网站风格)。陷阱查询的源文档带有显式标记pegadinha:nao_responde(125个源文档)。基准测试使用九种GEO技术(源自Aggarwal et al. 2024)对目标源文档进行改写,并测量引擎引用该源文档的变化。所有其他因素保持不变。主要发现:三种引擎在九种技术中只有四种效果方向一致,且这四种都是负面效果;其中一种技术(Technical Terms)在三种引擎上效果方向相反,且自举置信区间均不包含零。数据集适用于文本生成和问答任务,专门用于评估生成引擎优化效果。注意:源文档是合成生成的,并非真实抓取,未经领域专家验证,尤其是健康和法律文本不应视为准确信息。数据集采用CC-BY-4.0许可。

GEO-PTBR is the first Brazilian Portuguese Generative Engine Optimization (GEO) benchmark dataset. It contains 525 Brazilian Portuguese queries, each with 5 source documents (2625 total), and provides measurements of citation visibility changes for each GEO technique across three generative engines (gemini-3.5-flash-lite, claude-haiku-4-5, gpt-5.6-luna). It is the companion dataset to the paper GEO-PTBR: A Brazilian-Portuguese Replication of Generative Engine Optimization and the Engine-Dependence of Its Effects. The data is split into two subsets: queries and sources. The queries subset contains 525 records with fields: id (identifier, starting with s for health, j for legal, i for real estate), setor (sector: saude, juridico, imobiliario), query (real user query text), tipo (type: normal 500, pegadinha 25 trap queries). Trap queries are designed to be unanswerable from given source documents, serving as a hallucination control. The sources subset contains 2625 records, each query has 5 source documents of 150-400 words, each in one of five website styles. Fields include: id (format <query_id>_s<position>), query_id (query ID), posicao (position 1-5), titulo (title), texto (body), origem (source string recording generation model, website style, and trap marker, e.g., sintetico:grok-4.5;estilo:portal_juridico, covering 39 different website styles). Trap query source documents have explicit marker pegadinha:nao_responde (125 sources). The benchmark uses nine GEO techniques (from Aggarwal et al. 2024) to rewrite target source documents and measures changes in engine citation of that document, with all other factors constant. Key findings: only four of the nine techniques have consistent effect direction across three engines, all negative; one technique (Technical Terms) shows opposite effect direction across engines with bootstrap confidence intervals not containing zero. The dataset is suitable for text generation and question answering tasks, specifically for evaluating generative engine optimization effects. Note: source documents are synthetically generated, not crawled, and not verified by domain experts; health and legal texts should not be considered accurate. License: CC-BY-4.0.

创建时间:
2026-08-13
原始信息汇总

GEO-PTBR 数据集概述

基本信息

  • 名称:GEO-PTBR
  • 许可协议:CC-BY-4.0
  • 语言:葡萄牙语(巴西葡萄牙语)
  • 数据集规模:1K 至 10K 条记录
  • 任务类型:文本生成、问答
  • 标签:生成引擎优化(GEO)、信息检索、引用、葡萄牙语、LLM 评估

数据集用途

GEO-PTBR 是首个巴西葡萄牙语生成引擎优化(GEO)基准测试数据集。它包含 525 条葡萄牙语查询和 2,625 个源文档,并提供了在三种生成引擎上测量的各技术引用可见性结果。该数据集是论文《GEO-PTBR: A Brazilian-Portuguese Replication of Generative Engine Optimization and the Engine-Dependence of Its Effects》的配套成果,实验版本为 0.3.0

实验设计

针对每条查询及五个已检索的 PT-BR 源文档,使用来自 Aggarwal 等人(2024)的九种 GEO 技术对指定目标源进行改写,并测量引擎对该源的引用变化。相同的查询和相同的改写源分别输入 gemini-3.5-flash-liteclaude-haiku-4-5gpt-5.6-luna 三个引擎,唯一变量为回答的引擎。

核心发现

三个引擎仅在九种技术中的四种上对效应方向达成一致,且这四种技术均为负面效应。其中"技术术语"(Technical Terms)技术在各引擎间符号相反,且三种引擎的 bootstrap 置信区间均不包含零。

数据内容

data/queries.jsonl — 525 条查询

字段 说明
id 查询标识符(s* 健康、j* 法律、i* 房地产)
setor 领域:saudejuridicoimobiliario
query 查询内容,模拟真实用户向 AI 助手的提问方式
tipo normal(500 条)或 pegadinha(25 条)

各领域查询数量:房地产 174 条、法律 175 条、健康 176 条。

pegadinha("陷阱")查询在设计上无法由给定源文档回答,作为测量幻觉的对照组——其基线可见度必须为零且已确认为零。此类查询被排除在主结果之外并单独分析。

data/sources.jsonl — 2,625 个源文档

每条查询对应 5 个文档,每个文档 150–400 词,采用五种网站风格之一。

字段 说明
id 源标识符(<query_id>_s<position>
query_id 该源回答的查询
posicao 在引擎上下文中的位置(1–5)
titulo 源标题
texto 源正文
origem 来源信息:生成模型、网站风格和陷阱标记

origem 字段为机器可读格式,记录每个源的生成方式,例如 sintetico:grok-4.5;estilo:portal_juridico,涵盖 39 种不同的网站风格(法律门户、诊所博客、银行常见问题、专家专栏、开发者网站等)。属于陷阱查询的源文档带有显式的 pegadinha:nao_responde 标记(共 125 个)。

⚠️ 源文档为合成-真实风格,非抓取内容。它们被生成为类似真实的巴西葡萄牙语网页内容并已标注。这些内容未经领域专家验证,健康和法律的文本不应被视为准确信息。

results/ — 实验结果

包含各技术的可见度、相对改进(原始论文式 4)及 bootstrap 95% 置信区间、跨引擎一致性和 Spearman 相关性。results/por_engine/<engine>/ 存放各引擎的单独表格。

Spearman 相关性表包含精确置换 p 值(完整枚举 9! 种排序,因为 n=9 时渐近近似无效)。本研究中无显著相关性:5% 显著性水平的临界 |rho| 为 0.700,高于所有实测值。

每个表格并排报告两组查询结果:baseline_pos(主要结果;目标源具有正基线可见度的查询)和完整集合(敏感性分析)。这一区分很重要——混合两组数据会将中位数固定在零,可能使真实的负面效应被误读为无效应。

加载方法

python from datasets import load_dataset

queries = load_dataset("epicchi2103/geo-ptbr", "queries") sources = load_dataset("epicchi2103/geo-ptbr", "sources")

局限性

  • 固定上下文:结果度量的是源已被检索给定条件下的引用情况,不涉及爬取、索引、检索或流量。
  • 合成源文档:内容为合成生成,未经领域专家验证。
  • 单一变换遍数,跨引擎复用:三个引擎均接收由同一模型变换的源文档,这隔离了引用行为,但未检验另一模型是否会产生更好的改写效果。
  • gpt-5.6-luna 不支持自定义温度参数:其余两个引擎在温度 0.7 下运行。

引用格式

bibtex @misc{picchiotti2026geoptbr, author = {Picchiotti, Elio Suraci}, title = {GEO-PTBR: A Brazilian-Portuguese Replication of Generative Engine Optimization and the Engine-Dependence of Its Effects}, year = {2026}, note = {Dataset and code: AEO BR, Caracol Media --- https://aeobr.com.br}, }

由 AEO BR / Caracol Media(https://aeobr.com.br)制作,由 scripts/build_publish.py 于 2026-08-13 生成。

搜集汇总
数据集介绍
geo-ptbr 数据集图片
构建方式
GEO-PTBR是首个面向巴西葡萄牙语的生成引擎优化(GEO)基准数据集,其构建严格遵循科学对照原则。数据集中包含525条查询,每条查询对应五个已检索的葡萄牙语源文档,其中指定一个目标源文档,并依据Aggarwal等人(2024)提出的九种GEO技术对该源文档进行重写。为确保实验的可控性,所有查询与转换后的源文档均被提交至三个生成引擎(gemini-3.5-flash-lite、claude-haiku-4-5和gpt-5.6-luna)进行测试,唯一变量为引擎本身。源文档为合成数据,覆盖39种网站风格,并包含25条人为设计的“陷阱”查询,其源文档明确标记为无法回答,作为幻觉测量的对照。
特点
该数据集的核心特点在于其严谨的实验设计与丰富的上下文信息。每条查询均附带来源文档的详细元数据,包括来源位置、标题、正文及溯源字符串,溯源字符串可机器读取,清晰记录生成模型与网站风格。数据集中,2,625个源文档按五个领域(健康、法律、房地产)均匀分布,且每种技术效果均提供相对改进的置信区间及跨引擎一致性分析。特别地,数据集揭示了三种引擎仅在四种损害性技术上的效应方向一致,且一种技术(流畅性优化)在不同引擎间呈现符号反转,这些发现为生成引擎的优化提供重要实证。此外,数据集包含对照的“陷阱”查询,用于验证基线可见度为零,确保测量的可靠性。
使用方法
使用GEO-PTBR数据集时,研究者可通过HuggingFace的`datasets`库轻松加载查询与源文档两种配置。典型应用包括评估生成引擎对源文档的引用可见度影响,或比较不同GEO技术在不同引擎上的效果。数据集提供了预处理好的结果表格,涵盖技术级指标、相对改进、置信区间及Spearman相关性,便于直接进行统计分析。需注意,源文档为合成数据,适用于研究目的而非真实信息参考。使用时需遵循CC-BY-4.0许可,并引用相关论文。建议在分析时区分基线正可见度查询与完整查询集,以避免汇并导致的中位数零偏移问题。
背景与挑战
背景概述
GEO-PTBR是由AEO BR / Caracol Media的研究人员Elio Suraci Picchiotti于2026年创建的首个巴西葡萄牙语生成引擎优化(GEO)基准数据集。该数据集旨在系统评估生成式引擎(如AI驱动的搜索和问答系统)对网页内容的引用可见性,填补了GEO领域在非英语语言环境下的空白。其核心研究问题在于,通过应用九种GEO技术(源自Aggarwal等人2024年的工作)对目标源文档进行改写,并测量三种主流生成引擎(gemini-3.5-flash-lite、claude-haiku-4-5和gpt-5.6-luna)对改写后文档的引用变化,从而探索GEO效果是否依赖于具体引擎。数据集包含525个查询和2,625个源文档,覆盖健康、法律和房地产三个领域,并设计了25个“陷阱”查询作为幻觉测量的控制组。该数据集在GEO领域具有开创性意义,为跨语言、跨引擎的GEO研究提供了基准,尤其为葡萄牙语用户的生成式搜索优化提供了实证基础。
当前挑战
GEO-PTBR数据集面临的挑战主要体现在两个层面。首先,在领域问题层面,GEO研究的核心挑战在于生成式引擎的引用行为具有高度引擎依赖性,该数据集发现仅四种技术的效果在三种引擎上方向一致,且均为负面影响,而流畅性优化甚至在不同引擎间出现符号反转,这凸显了制定通用GEO策略的困难。其次,在数据集构建过程中,挑战包括:确保源文档的合成现实性(synthetic-realistic)而非直接抓取,并需明确标注以避免误导;设计“陷阱”查询作为控制组需保证其不可回答性且基线可见度为零;处理温度参数不一致(如gpt-5.6-luna不支持自定义温度)可能引入的偏差;以及源文档长度变化作为潜在混淆因素(长度变化范围-14.4%至+7.3%,且与可见度变化显著相关),这使得技术效果排序的解释需极为谨慎。此外,缺乏操作检查(即验证每种技术是否确实按其名称执行)也增加了结果解读的不确定性。
常用场景
经典使用场景
GEO-PTBR作为首个巴西葡萄牙语生成引擎优化(GEO)基准,其经典使用场景聚焦于评估在固定检索上下文下,针对同一查询对指定源文档施加九种GEO技术后,不同生成引擎(如Gemini、Claude、GPT系列)引用该源文档的可见性变化。研究者可借助此数据集系统性地比较技术效果在跨引擎间的异同,尤其关注技术方向的一致性与反转现象,从而深入探究GEO策略的引擎依赖性。该基准设计严谨,包含525个查询与2625个源文档,并精心设置‘陷阱’查询作为幻觉测量对照,为可复现、可扩展的GEO效果评估提供了标准化平台。
实际应用
在实际应用层面,GEO-PTBR为内容营销、品牌可见度管理和数字公关策略提供了直接的决策依据。医疗、法律、房地产等垂直领域的网站运营者,可参照数据集中各行业查询的测试结果,调整其内容生成策略,优化文本以更契合生成引擎的引用偏好。例如,健康类门户和律师事务所博客可借鉴分析报告,识别在主流引擎上有效的非伤害性技巧,规避可能导致负面效果的操作。此外,该数据集的价值亦延伸至生成引擎本身的质量评估——通过观察引擎对不同优化技巧的响应,可间接探查其引用算法特性,辅助引擎迭代优化。
衍生相关工作
GEO-PTBR的发布为后续研究开辟了多条衍生路径,催生了一系列经典工作。研究者可在此基础上扩展多语言基准构建,对比不同语言文化背景下GEO效果的异同;亦可深入探讨源文档长度、风格等混淆因素对技术排名的影响,该数据集已初步揭示长度与可见性的强正相关,为因果推断研究提供了起点。此外,跨引擎的Spearman相关性分析结果(无显著排序一致)启发了对生成引擎引用机制差异性的探索,可能推动自适应GEO策略的设计。未来工作也可能建立基于该数据集的生成引擎优化竞争排行榜,激励社区持续改进优化方法,形成一个活跃的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务