遇见数据集

almanbench

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

AlmanBench 是一个标准德语到 Alman 方言的翻译基准数据集。Alman 是一种简化的德语方言,旨在消除语法性别和格变位,其规范定义在 alman.ai 网站。该基准测试用于衡量模型能否将规范中的完整规则集应用于真实的德语文本:每个数据项是一个标准德语句子,参考输出是规范允许的所有 Alman 翻译版本的集合。数据集包含 1,029 个公开测试样本,并维护了约 200 个未公开的保留样本,用于检测训练数据污染。数据样本分为四个层级:自然文本层(600 项,包含经典文学和当代德语)、目标规则层(216 项,手动编写以覆盖罕见规则)、防护层(120 项,用于防止过度纠正错误)和精选层(93 项,手动翻译以演示核心规则)。每个样本包含唯一标识符、层级、分组、集合标识、标准德语源句、规范 Alman 翻译、所有可接受的翻译列表、覆盖的规则ID列表、语体、是否为防护项、防护族、是否使用古旧正字法、译者注释、来源元数据以及污染检测标识等字段。该数据集适用于机器翻译模型的能力评估,特别是对规则化方言翻译任务的性能测试。数据来源多样,包括公共领域经典文学作品、CC BY-SA 4.0 许可的维基百科文章、CC BY 2.0 FR 许可的 Tatoeba 句子以及 CC BY-SA 4.0 许可的手动编写内容。Alman 翻译参考也以 CC BY-SA 4.0 许可发布。

AlmanBench is a benchmark dataset for translation from standard German to the Alman dialect. Alman is a simplified German dialect designed to eliminate grammatical gender and case declension, with its specification defined on the alman.ai website. This benchmark is used to measure whether models can apply the full set of rules from the specification to real German texts: each data item is a standard German sentence, and the reference output is the set of all Alman translation versions allowed by the specification. The dataset contains 1,029 publicly available test samples and maintains approximately 200 unpublished reserved samples for detecting training data contamination. The data samples are divided into four tiers: natural text tier (600 items, including classical literature and contemporary German), target rule tier (216 items, manually written to cover rare rules), guard tier (120 items, used to prevent overcorrection errors), and curated tier (93 items, manually translated to demonstrate core rules). Each sample includes fields such as unique identifier (id), tier, bin, set, standard German source sentence (source), canonical Alman translation (canonical), list of all acceptable translations (accepted), list of covered rule IDs (covers), register, guard flag (guard), guard family, archaic orthography flag (orthography_archaic), translators note (note), source metadata (meta), and contamination detection identifier (canary). This dataset is suitable for evaluating the capabilities of machine translation models, particularly for performance testing on rule-based dialect translation tasks. Data sources are diverse, including public domain classical literary works, CC BY-SA 4.0 licensed Wikipedia articles, CC BY 2.0 FR licensed Tatoeba sentences, and CC BY-SA 4.0 licensed manually written content. The Alman translation references are also released under the CC BY-SA 4.0 license.

创建时间:
2026-07-17
原始信息汇总

数据集概述

AlmanBench 是一个用于评估从标准德语(Standard German)到 Alman 方言翻译能力的基准测试数据集。

  • 语言:源语言为标准德语(de),目标语言为 Alman 方言(de-AL)。
  • 任务类别:机器翻译。
  • 标注来源:专家生成。
  • 大小:约 1,029 条数据(1K < n < 10K),另有一个约 200 条的非公开保留集。
  • 许可证:混合来源许可(mixed-source-licenses),具体各子集许可不同。

数据组成

数据集包含四个层级(Tier),共 1,029 条公共测试样本:

层级 (Tier) 数量 说明
naturalistic 600 真实文本,一半为经典文学作品(1500-1955),一半为当代德语(Wikipedia、Tatoeba、人工撰写)。
targeted 216 手工撰写,确保罕见规则至少有 25 个观察样本。
guards 120 过度纠正陷阱,包含八种类型,测试模型是否会错误修改 Alman 中保留的词汇。
curated 93 手工翻译的核心示例,每个规格规则至少对应一个样本。

字段说明

每条记录包含以下字段:

字段 类型 描述
id string 稳定的样本 ID,如 almanbench/canonical/01002
tier string 所属层级:naturalistic, targeted, guards, curated
bin string 层级内的细分类别,如 naturalistic-modern/wikipedia
set string 分布标识,公共集始终为 public
source string 标准德语的输入句子。
canonical string 规范的 Alman 翻译(accepted 列表中的第一项)。
accepted list of strings 规格允许的所有 Alman 翻译形式。
covers list of strings 该样本涉及的规格规则 ID 列表。
register string 语域:canonical(历史文学)或 modern(现代)。
guard bool 是否为过度纠正陷阱样本。
guard_family string or null 陷阱家族名称(仅 guard 样本有值)。
orthography_archaic bool 源文本是否使用旧正字法。
note string or null 翻译者的说明注释。
meta string JSON 格式的源文本出处信息(作品、文章、Tatoeba ID 等)。
canary string 污染检测标识,每行相同。

数据格式与加载

数据集以 JSONL 格式存储于单个文件 data/almanbench.jsonl,可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset ds = load_dataset("osolmaz/almanbench", split="test")

评估指标

  • Acceptance:主要指标,计算模型输出与 accepted 集合的标准化精确匹配率。
  • Compliance:辅助指标,通过词法分析器检测模型输出中是否保留 Alman 方言应消除的标准德语形式。

结果示例

以下是部分模型在完整公共集(1,029 条)上的表现(2026 年 7 月评估):

模型 Acceptance Compliance
Claude Fable 5 94.1% 99.8%
GPT-5.6 Sol 93.5% 99.7%
DeepSeek V4 Flash 89.7% 99.8%
GPT-5.6 Luna 87.7% 98.4%
Gemma 4 31B IT 64.8% 94.8%

完整排行榜及分项结果可查看基准测试页面(https://alman.ai/almanbench/),单样本结果发布在数据集 osolmaz/almanbench-results(https://huggingface.co/datasets/osolmaz/almanbench-results)。

许可详情

  • 经典文学作品(naturalistic-canonical):公共领域,来源于 TextGrid、Deutsches Textarchiv 和 Project Gutenberg。
  • 德语 Wikipedia(naturalistic-modern/wikipedia):CC BY-SA 4.0。
  • Tatoeba(naturalistic-modern/tatoeba):CC BY 2.0 FR。
  • 手工撰写样本(authored, targeted, guards, curated):原创内容,CC BY-SA 4.0。
  • Alman 参考翻译:原创翻译,CC BY-SA 4.0。
  • 衍生作品:Wikipedia 衍生内容保持 CC BY-SA 协议。

污染防护策略

每条数据包含污染检测标识(canary GUID: 8b1a4c9e-almanbench-4f2d-9c7a-3e5b6d8f0a12),禁止该数据集出现在训练语料中。非公开保留集用于检测模型训练污染,通过比较公共集与保留集的结果差异来量化污染程度。

搜集汇总
数据集介绍
almanbench 数据集图片
构建方式
AlmanBench是一项专为衡量模型将标准德语转换为Alman方言能力而设计的基准测试。Alman是一种简化德语方言,旨在消除语法性别和格屈折变化,其规则体系已详述于alman.ai。该数据集由1,029个标准德语语句构成,每条语句的参考答案是该规范所允许的所有Alman翻译集合。为确保评估的公正性与防污染,另有约200个私有测试集被严格保密,从未公开。数据集构建涵盖四种类型:自然主义文本(600项,源自经典文学与当代德语语料)、针对性项目(216项,针对罕见规则)、过度纠正陷阱(120项,检验模型是否在无需改变处错误修改)以及精选示例(93项,每项对应特定规则)。这种分层结构确保了规则覆盖的全面性与评估的严谨性。
特点
AlmanBench的显著特征在于其精细的评估维度与透明的防污染机制。每一条目均包含丰富元数据,如稳定性标识符、层级分类、规范翻译及所有可接受答案列表,并标注了所涉及的规范规则ID,使得模型输出可被精确匹配与合规性检查。基准采用双重指标:接受率衡量输出是否属于可接受集合,合规率则通过内置的lint工具检测模型是否保留Alman方言本应消除的标准德语表面形式,从而更全面地评估模型对规则组的应用能力。此外,数据集内嵌了污染金丝雀标识,便于从训练语料库中筛除,并鼓励通过公开与私有测试集的性能差异来量化污染影响,确保基准的长期有效性。
使用方法
使用AlmanBench进行模型评估极为便捷。用户可通过Hugging Face Datasets库加载公开测试集,命令为`load_dataset("osolmaz/almanbench", split="test")`。更为完整的运行流程建议使用配套的alman评测框架,在终端执行`uv run inspect eval alman/bench/task.py --model openai/gpt-5-codex`即可自动完成推理、评分与合规性检查。评估时需注意,接受率基于标准化精确匹配,且对大小写敏感;历史来源中的古旧拼写必须在输出中保留。每次评估的结果将记录在公开的leaderboard及详尽的逐项结果数据集中,便于社区复现与对比分析,从而持续追踪模型在德语方言翻译任务上的进步。
背景与挑战
背景概述
AlmanBench是由研究者Onur Solmaz于2026年创建的一项标准德语至Alman方言翻译基准测试集。Alman是一种去除语法性别与格屈折的简化德语方言,其规则体系在alman.ai上正式定义。该基准旨在评估模型能否将完整的规则集应用于真实的德语散文,涵盖经典文学、当代维基百科及Tatoeba语料等多源文本。通过包含1029条公开样本与约200条私有保留样本,AlmanBench在机器翻译与方言处理领域开辟了新的评估维度,尤其关注模型对语言简化规则的精确泛化能力,而非简单的表面形式匹配。其设计与结果已对多语言生成模型的公平性与可控性评估产生了显著影响。
当前挑战
AlmanBench所应对的核心领域挑战在于,机器翻译模型往往忽视语法性别和格屈折的消除任务,而倾向于生成标准德语输出,因此需要基准来严格检验模型对形式简化规则的执行能力,包括处理来自历史语料的古旧拼写与现代德语交互规则。在构建过程中,团队面临多重难题:自然主义分组的600条样本需平衡经典文学与当代文本以确保覆盖度;针对性的216条样本用于提升稀有规则的观测频率至最少25次;引入120条过度修正陷阱以检验模型避免错误应用表面形式剥离的能力;此外,93条策展样本需确保每条规范规则至少对应一条设计目标,同时维护私有保留集以监控训练数据污染,这些均体现了精细化的工程挑战。
常用场景
经典使用场景
在自然语言处理领域,AlmanBench作为一项从标准德语向简化方言Alman翻译的基准测试,其经典应用场景在于评估大语言模型对复杂语言转换规则的掌握程度。该数据集精心构建了1,029个测试项,涵盖自然语篇、针对性规则测试、过度校正陷阱及核心示范四个层次,要求模型不仅完成词汇层面的翻译,还需精确应用Alman规范中消除语法性别和格变化的完整规则集。研究者利用这一基准,能够系统性地检验模型对语言简化规则的理解深度与泛化能力,从而在可控条件下测量其语言工程素养。
实际应用
在实际应用层面,AlmanBench为构建面向语言简化和可控文本生成的工业级系统提供了不可或缺的验证标准。例如,在开发面向语言障碍人士或二语学习者的自动文本简化工具时,该基准能够确保系统生成的简化版本严格遵循预定义语法规则,避免产生不符合规范的错误表达。此外,在跨语言信息传递和本地化服务中,AlmanBench可指导模型将复杂的德语文本转化为结构一致、无冗余变化的Alman形式,提升机器翻译系统在特定受限领域的可靠性与可预测性,从而直接服务于需要高度语言标准化的商业场景。
衍生相关工作
围绕AlmanBench衍生了一系列卓有成效的学术探索。最为突出的当属其官方发布的公开与私有两套评测集设计,这一架构开创性地为检测训练数据污染和模型记忆效应提供了可量化方案,激励了后续关于测试集隔离与隐私保护的基准设计方法。同时,该数据集的四种分层结构——自然语篇、针对性规则、陷阱测试和核心示范——启发了诸多研究者在复杂语言转换任务中构建分层评测体系。此外,其规范定义与评测框架被后续工作借鉴,用于设计其他方言或人工语言的翻译基准,推动了语言工程中形式化规范评估方法论的普及与深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务