LOBSTER (Language-Of-study Bias in ScienTific pEer Review)
收藏资源简介:
LOBSTER是由科克大学等机构构建的首个系统性研究NLP同行评审中语言偏见的标注数据集,包含529条从EMNLP和ACL会议评审中提取的片段,标注了负面偏见、正面偏见或无偏见。数据集通过两阶段采样策略确保覆盖多样化的语言和贡献类型,并采用多专家标注流程保证质量。该数据集旨在量化非英语论文面临的评审偏见,尤其关注不合理跨语言泛化要求等常见模式,为促进公平评审实践提供基准工具。
LOBSTER is the first annotated dataset for systematically studying linguistic bias in NLP peer review, constructed by University College Cork and other institutions. It contains 529 excerpts extracted from the review records of EMNLP and ACL conferences, annotated with negative bias, positive bias, or no bias. The dataset adopts a two-stage sampling strategy to ensure coverage of diverse linguistic styles and contribution types, and employs a multi-expert annotation workflow to guarantee annotation quality. This dataset aims to quantify review bias faced by non-English papers, with particular focus on common patterns such as unreasonable cross-lingual generalization requirements, providing a benchmark tool for promoting equitable peer review practices.
LOBSTER 数据集概述
数据集简介
LOBSTER(Language-Of-study Bias in ScienTific pEer Review)是首个用于检测NLP同行评审中语言研究偏见的人工标注数据集。该偏见指审稿人根据论文所研究的语言(而非其科学价值)进行不同评价的倾向。
核心任务
数据集支持三个分类任务:
- 偏见分类(主要任务):根据论文标题、摘要和评审片段,将评审片段分类为“负面偏见”、“正面偏见”或“未检测到偏见”。
- 贡献类型分类:对每篇论文的贡献焦点进行分类(例如,建模、NLP应用、数据与基准测试)。
- 研究语言检测:使用六类分类法确定每篇论文的语言学范围(例如,单语言、指定多语言等)。
数据规模与构成
标注层统计
| 标注层 | 记录数 | 描述 |
|---|---|---|
| 语言偏见 | 534 | 评审片段的偏见标签(其中529条具有标注者共识,5条因需要更深的主题专业知识而无法标注) |
| 贡献类型 | 100 | 论文贡献类别 |
| 研究语言 | 100 | 论文所研究的语言 |
语料库覆盖范围
| 会议 | 论文数 | 评审数 | 标注片段数 |
|---|---|---|---|
| EMNLP 2023 | 2,020 | 6,449 | 375 |
| EMNLP 2024 | 1,063 | 1,425 | 103 |
| ACL 2025 (Dec–Feb) | 2,187 | 3,756 | 56 |
| ARR 2024 (Apr–Jun) | 464 | 499 | — |
| COLING/NAACL 2025 | 410 | 498 | — |
| EMNLP 2025 (Jun–Aug) | 1,762 | 3,018 | — |
| 总计 | 7,906 | 15,645 | 534 |
偏见标签分布 (n=534)
| 标签 | 数量 |
|---|---|
| 未检测到偏见 | 439 |
| 负面偏见 | 73 |
| 正面偏见 | 17 |
| 不明确/需要上下文 | 4 |
| 无多数意见 | 1 |
模型基准测试结果
在529条具有共识标注的数据上进行三分类(负面偏见、正面偏见、未检测到偏见)评估,主要模型性能如下(Macro F1):
- Gemini 3.1 Pro: 87.37
- Grok 4.1 Fast: 79.75
- GPT 5.2: 78.29
- Claude Opus 4.6: 74.96
- DeepSeek V3.2: 66.89
- Llama 4 Maverick 17B: 63.94
数据格式与获取
- 标注数据(黄金标准):位于
dataset/annotations/目录下的JSONL文件(需解压密码为lobster的annotations.zip文件)。 - LLM评估数据:位于
dataset/llm_evaluation/目录下(需解压llm_evaluation.zip),按任务组织。 - LLM预测数据:位于
dataset/llm_predictions/目录下(需解压llm_predictions.zip),按会议组织。 - 完整评审语料库:原始评审语料库(15,645条评审)不随LOBSTER重新分发。需从原始来源下载:
- NLPEERv2(覆盖EMNLP 2023/2024):https://tudatalib.ulb.tu-darmstadt.de/items/d4a4061b-e4e3-4b1e-a90d-d48a3d69e3c0
- ARR Data Collection Initiative(覆盖ACL 2025, ARR 2024, COLING/NAACL 2025, EMNLP 2025):https://tudatalib.ulb.tu-darmstadt.de/items/4266a71b-1d5c-40bf-8923-7beec1c5263e
关键研究发现
- 非英语论文面临的偏见率比纯英语论文高出约40倍。
- 在所有会议中,负面偏见持续超过正面偏见。
- 正面偏见集中在多语言论文中:指定多语言论文的偏见评审中约39%为正面偏见,而单一非英语论文为31%,英语论文仅为4%。
- 识别出四种负面偏见的子类别,其中不合理的跨语言泛化要求是最主要的形式。
- 偏见模式是结构性的,在所检查的所有六个会议中持续存在。
许可信息
本项目(代码和数据)采用知识共享署名-非商业性使用 4.0 国际许可协议(CC BY-NC 4.0)进行许可:https://creativecommons.org/licenses/by-nc/4.0/

- 1Are Non-English Papers Reviewed Fairly? Language-of-Study Bias in NLP Peer Reviews科克大学; 慕尼黑大学; 慕尼黑机器学习中心; 鲁汶大学; 埃尔朗根-纽伦堡大学 · 2026年



