Analisis critico de los resultados de búsqueda de Google: estudio de la influencia del algoritmo en la percepción de la realidad
收藏资源简介:
La investigación se basa en un universo de análisis conformado por los 10 primeros resultados de búsqueda, para 10 términos de consulta, ejecutados por 30 personas en sesiones sucias en Google, y 1 persona en 2 sesiones controladas y limpias con diferentes características entre sí. El universo de análisis totaliza 3200 resultados de búsqueda, 3000 de sesiones sucias y 200 de sesiones limpias. Cada uno de los resultados de búsqueda remiten a una URL/fuente. La unidad de análisis es la URL/fuente a la que remiten los resultados. Se clasifican por término de consulta, por posición/rango en la página de 10 resultados, y por caso (sesiones sucias sin control (Caso 1) o sesiones limpias controladas (Casos 2 y 3). Las fuentes externas de datos son 30 participantes que aceptan realizar las tareas de búsqueda en Google y son seleccionados de acuerdo con su cumplimiento con los siguientes criterios: uso habitual de celular con tecnología Android y cuenta de Gmail activada en el dispositivo; Chrome como navegador por defecto; Google como buscador por defecto y Gmail como servicio de correo electrónico con el cual proveer identidad para poder acceder a descargas de cualquier AP. Todas las sesiones sucias usan entonces el mismo navegador (Chrome, por defecto en los celulares), se ejecutan desde plataforma celular, y en el buscador Google geolocalizado para Argentina. Las sesiones limpias las ejecuta la investigadora en Google con un IP simulado de Perú a través de una red virtual, y en DuckDuckGo. Definición de casos de búsqueda: Ø CASO 1: Búsqueda ejecutada por personas reales (30) con las siguientes características comunes: -Búsqueda en Google, plataforma celular, navegador Chrome, con cuenta de Google abierta (Sesión sucia: cuenta de Gmail, datos recopilados de historial de navegación e historial de búsquedas y sesión abierta, geolocalización activada). -Las 30 personas están geolocalizadas en La Plata, Buenos Aires, Argentina -Los mismos 10 términos de búsqueda. Ø CASOS 2 y 3: Búsqueda ejecutada por 1 sola persona (la investigadora), con las siguientes características distintivas, definidas como caso 2 y caso 3: Ø CASO 2: Búsqueda en Google, plataforma celular, navegador Chrome, sin cuenta de Google, desde un IP de Perú (Sesión limpia: sin cuenta de Gmail abierta, datos recopilados de historial de navegación e historial de búsquedas y sesión abierta eliminados, geolocalización activada). -Los mismos 10 términos de búsqueda. Ø CASO 3: Búsqueda en DuckDuckGo, plataforma celular, navegador Chrome, sin cuenta de Google (Sesión limpia: sin cuenta de Gmail abierta, datos recopilados de historial de navegación e historial de búsquedas y sesión abierta eliminados, geolocalización activada). -Los mismos 10 términos de búsqueda. Términos de consulta Ø 2 términos de consulta controvertidos para los cuales hay dos posturas: matrimonio homosexual y pena de muerte, siguiendo a Gezici y otros, a Lemuth, a Leferink y a Krafft y otros, que buscan probar si ciertos temas controvertidos tienen más probabilidades de generar un resultado de búsqueda más seleccionado que temas más normales y no controvertidos partiendo de la hipótesis (en Leferink) de que la personalización tiene más influencia en las consultas controvertidas que en las no controvertidas. Ø 2 términos de consulta de eventos recientes: guerra Ucrania Rusia; persecuciones en Venezuela, siguiendo a Jiang, son términos de consulta para los cuales hay mucha publicación. Ø 2 términos de consulta de cola larga: tratamiento con hongos psilocybe, Operación lanza de Neptuno, siguiendo a Carreras Lario, a Jiang y a Neil, son términos de consulta que se han buscado poco. Ø 2 términos de consulta asociados a los servicios que brinda la empresa del buscador: correo electrónico y correo electrónico sin rastreadores, siguiendo a Edelman y Lockwood, son términos en los que el sesgo de contenido propio es factible de medir. Ø 2 términos comerciales de alta competencia empresarial: destinos turísticos; marcas de zapatillas deportivas, siguiendo a Carreras Lario y a Jiang.
本研究的分析样本池由10个查询词对应的前10条搜索结果构成,共计3200条搜索结果:其中30名参与者在谷歌(Google)平台开展的脏会话(dirty sessions)产生3000条结果,另有1名研究者在2组受控且无追踪的干净会话(clean sessions)中生成200条结果,两组干净会话存在差异化设置。总分析样本池共计3200条搜索结果,其中脏会话结果3000条,干净会话结果200条。 每条搜索结果均对应一个URL/来源。本研究的分析单元为搜索结果指向的URL/来源,将按照查询词、搜索结果在页面中的排名位置(共10个结果位)以及实验分组进行分类:分组包括无控制的脏会话(案例1)、受控干净会话(案例2与案例3)。 本研究的外部数据源为30名符合以下筛选标准的参与者:日常使用搭载安卓(Android)系统的手机、设备中已激活Gmail账户;默认浏览器为Chrome;默认搜索引擎为谷歌(Google),且使用Gmail作为身份验证服务以获取任意应用程序(AP)的下载权限。所有脏会话均使用手机端默认的Chrome浏览器,通过谷歌(Google)阿根廷本地化搜索引擎发起。而干净会话则由研究者通过虚拟专用网络(Virtual Private Network,VPN)模拟秘鲁IP地址,分别在谷歌(Google)与DuckDuckGo平台上完成。 ### 实验分组定义 1. **案例1**:由30名真实参与者发起的搜索,具备以下共同特征:使用谷歌(Google)搜索引擎、手机平台、Chrome浏览器,且登录了谷歌账户(脏会话特征:已开启Gmail账户,将记录浏览历史、搜索历史与会话数据,且启用了地理定位功能);30名参与者的地理位置均为阿根廷布宜诺斯艾利斯省拉普拉塔市;统一使用10个预设查询词。 2. **案例2与案例3**:由同1名研究者发起的搜索,二者具备差异化特征,分别对应案例2与案例3: - **案例2**:使用谷歌(Google)搜索引擎、手机平台、Chrome浏览器,未登录谷歌账户(干净会话特征:未开启Gmail账户,未记录浏览历史、搜索历史与会话数据,且启用了地理定位功能);统一使用10个预设查询词。 - **案例3**:使用DuckDuckGo搜索引擎、手机平台、Chrome浏览器,未登录谷歌账户(干净会话特征:未开启Gmail账户,未记录浏览历史、搜索历史与会话数据,且启用了地理定位功能);统一使用10个预设查询词。 ### 预设查询词分类 本次研究共使用10个预设查询词,分为5类: 1. **争议性查询词(2个)**:针对同一议题存在两种对立立场的话题,即「同性婚姻」与「死刑」。本研究参考Gezici等人、Lemuth、Leferink与Krafft等人的研究设计,旨在验证争议性话题是否比普通非争议性话题更容易产生高曝光度的搜索结果,核心假设源自Leferink的研究:相较于非争议性查询,个性化算法对争议性查询的搜索结果影响更强。 2. **近期事件查询词(2个)**:「俄乌战争」与「委内瑞拉迫害事件」。参考Jiang等人的研究,这类查询词具备高搜索热度与大量公开报道。 3. **长尾查询词(long-tail query,2个)**:「裸盖菇素治疗」与「海王星长矛行动」。参考Carreras Lario、Jiang与Neil等人的研究,这类查询词的搜索量较低。 4. **与搜索引擎服务商业务相关的查询词(2个)**:「电子邮件」与「无追踪器电子邮件」。参考Edelman与Lockwood的研究,这类查询词可用于量化搜索引擎自身内容的偏向性。 5. **高商业竞争度的商业查询词(2个)**:「旅游目的地」与「运动鞋品牌」。参考Carreras Lario与Jiang等人的研究。



