ID10M-JAM
收藏资源简介:
ID10M-JAM是一个用于评估大型语言模型(LLMs)在误导性上下文信号下识别习语能力的对抗性基准数据集。该数据集扩展自ID10M,通过引入对抗性增强的上下文,故意偏向于潜在习语表达(PIE)的错误(字面或比喻)解释,同时对人类读者保持明确性。每个原始句子生成3个“困难变体”,其中添加的上下文旨在挑战模型对虚假相关性和误导性线索的鲁棒性。数据集包含英语和德语两种语言,以JSON文件形式提供,每个条目代表原始句子的一个对抗性变体。英语部分包含178个原始句子和534个变体,德语部分包含137个原始句子和411个变体。每个样本包含多个字段,如原始句子、潜在习语表达、真假习语标签、变体编号、变体句子、分词结果、BIO标签等。数据集适用于习语识别、语言模型鲁棒性评估等任务。
ID10M-JAM is an adversarial benchmark dataset designed to evaluate the ability of large language models (LLMs) to recognize idioms under misleading contextual signals. The dataset extends ID10M by introducing adversarially augmented contexts that deliberately bias towards incorrect (literal or figurative) interpretations of potential idiomatic expressions (PIEs) while remaining unambiguous to human readers. Each original sentence generates 3 difficult variants, where the added context aims to challenge the models robustness against spurious correlations and misleading cues. The dataset is available in both English and German, provided as JSON files, with each entry representing an adversarial variant of the original sentence. The English portion contains 178 original sentences and 534 variants, while the German portion contains 137 original sentences and 411 variants. Each sample includes multiple fields such as the original sentence, potential idiomatic expression, true/false idiom label, variant number, variant sentence, tokenization results, BIO tags, etc. The dataset is suitable for tasks such as idiom recognition and language model robustness evaluation.
数据集概述
基本信息
- 数据集名称: ID10M-JAM
- 数据集类型: 对抗性基准测试集
- 任务类别: 令牌分类(token-classification)
- 语言: 英语(en)、德语(de)
- 许可证: CC BY-NC-SA 4.0(数据集)、Apache-2.0(代码)
- 数据集规模: 1K < n < 10K
数据集描述
ID10M-JAM 是一个用于评估大语言模型在误导性上下文信号下进行习语识别能力的对抗性基准数据集。该数据集基于 ID10M 数据集构建,通过引入对抗性增强上下文,有意使模型对潜在习语表达产生错误(字面义或比喻义)理解偏向,但同时对人类读者保持无歧义。每个原始句子对应 3 个“困难变体”,通过在句子前添加额外上下文来挑战模型对虚假相关性和误导性线索的鲁棒性。
数据集来源
- 代码仓库: ID10M-JAM GitHub仓库
- 论文: 预印本(已接收;ACL 2026 Findings)
- 原始数据集: ID10M(Tedeschi等人,2022)
数据集结构
数据集以 JSON 文件形式提供(如 english.json、german.json),每个条目对应一个原始句子的单个对抗变体。数据集统计信息如下:
- 英语: 178 个原始句子,534 个变体
- 德语: 137 个原始句子,411 个变体
每个样本包含以下字段:
sentence:来自 ID10M 的原始句子,包含潜在习语表达PIE:被评估的目标表达式(字符串或令牌列表)true_idioms:句子中的习语表达列表(若为字面义则为空)is_figurative:布尔标签,指示 PIE 是否用作习语(真)或字面义(假)variant_number:当前原始句子的对抗变体索引variant_sentence:完整的对抗样本(上下文 + 原始句子)tokens:变体句子的令牌化版本tags:对应每个令牌的 BIO 标签(B-IDIOM、I-IDIOM、O)tag_ids:BIO 标签的数值编码version:内部版本标识符
注意:
- 每个原始句子出现 3 次。
- PIE 始终指原始句子中的表达,而非添加的上下文。
- 对抗性上下文被前置到原始句子之前。
- 生成的上下文中不引入额外的习语。
数据集创建
- 策划理由: 旨在对抗性上下文条件下对大语言模型进行压力测试。
- 源数据: 基于 ID10M 数据集,经过人工筛选和修正。变体由大语言模型生成、自动验证并经过人工精炼。
- 标注过程: 标注人员验证了流畅性、正确含义和无歧义性。仅保留具有 ≥3 个有效变体的样本。完整的标注指南请参见项目仓库。
使用建议
- 建议与标准基准测试集搭配使用。
- 用于评估模型的鲁棒性,而非直接性能。
引用
如果研究中使用了 ID10M-JAM,请引用相关论文(具体 BibTeX 和 APA 引用格式待补充)。
数据集卡片作者
Kai Golan Hashiloni 等人(Intellexus 项目)
联系方式
如有问题或贡献,请联系:kai.golanhashiloni@post.runi.ac.il




