遇见数据集

almanbench-results

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

AlmanBench results 数据集是 AlmanBench(标准德语到 Alman 语翻译基准)的模型评估结果集合。该数据集存储了被评估模型对基准测试项目中每个项目的逐行回答,以及支撑公开排行榜的聚合数据。每个数据行对应一个模型对一个基准项目的响应,包含源句子(标准德语)、可接受的 Alman 语翻译版本、模型输出、任何暴露的推理过程、两个评分(接受度和合规度)、令牌计数以及完整的运行溯源信息(如运行ID、执行ID、案例集ID、评分修订版)。数据集特别包含 `reasoning_effort` 列,直接记录请求的推理工作量,无需从模型标签推断。当前版本(v0.1)包含 17,493 行数据,覆盖了 17 个不同模型在包含 1,029 个项目的公共测试集上的评估结果。接受度是主要评估指标,衡量模型输出与项目许可的所有翻译版本之间的标准化精确匹配程度;合规度是一个保守的检查器,用于标记 Alman 语消除的标准德语表面形式。数据集适用于机器翻译模型评估、基准测试分析、模型行为研究以及跨模型性能比较等任务。数据结果仅在同一个基准版本内具有可比性。数据集遵循严格的污染控制政策,禁止其内容出现在训练语料库中。

The AlmanBench results dataset is a collection of model evaluation results for AlmanBench, a benchmark for translating Standard German to Alman language. It stores line-by-line responses from evaluated models for each item in the benchmark project, along with aggregated data that supports the public leaderboard. Each row corresponds to a models response to a benchmark item, including the source sentence (Standard German), acceptable Alman language translation versions, model output, any exposed reasoning processes, two scores (acceptability and compliance), token counts, and full run traceability information (e.g., run ID, execution ID, case set ID, score revision). The dataset notably includes a `reasoning_effort` column that directly records the requested reasoning effort without inference from model labels. The current version (v0.1) contains 17,493 rows, covering evaluation results from 17 different models on a public test set of 1,029 items. Acceptability is the primary evaluation metric, measuring the normalized exact match between model output and all permitted translation versions of an item; compliance is a conservative checker for flagging Standard German surface forms eliminated by Alman language. The dataset is suitable for tasks such as machine translation model evaluation, benchmark analysis, model behavior research, and cross-model performance comparison. Data results are comparable only within the same benchmark version. The dataset adheres to a strict contamination control policy, prohibiting its content from appearing in training corpora.

创建时间:
2026-07-17
原始信息汇总

数据集概览

AlmanBench resultsAlmanBench(标准德语到 Alman 方言翻译基准测试)的逐样本模型结果数据集。该数据集记录了各评估模型对每个基准测试项的原始回答、评分、推理过程及完整运行信息,并汇总了公开排行榜背后的聚合数据。

基本信息

  • 数据集名称:AlmanBench results
  • 语言:德语(语言代码 de,子变体 de-AL
  • 许可证:其他(混合来源许可证)
  • 标签:基准测试、德语、翻译、评估结果
  • 样本规模10K < n < 100K(单表包含 18,522 行)
  • 配置:默认配置,数据文件为 data/results-v0.1.parquet(分割名 v0_1

数据结构与内容

每条记录代表一个模型对一个基准测试项的作答,包含以下关键列:

  • 源句子(Source sentence)
  • 可接受的翻译(Accepted renderings)
  • 模型输出(Model output)
  • 暴露的推理过程(Exposed reasoning)
  • 两个评分:Acceptance(接受率)与 Compliance(合规率)
  • Token 计数
  • 完整运行来源信息(运行 ID、执行 ID、案例集 ID、评分修订版本号)
  • reasoning_effort 列记录请求的推理努力级别

文件布局

路径 说明
data/results-v0.1.parquet 所有模型的核心数据表(18,522 行,每模型每项一行),可通过 datasets 库加载并在数据查看器中浏览
v0.1/<model-id>/results.jsonl 按运行分组的逐行结果,采用发布格式(JSON Lines)
v0.1/<model-id>/result.json 运行聚合结果,包含层级与集合细分、Token 总量、预估成本及生成配置
v0.1/<model-id>/manifest.json 运行清单,含 Prompt 哈希和执行身份(仅适用于当前管道执行的任务)
leaderboard.json 所有模型在该案例集上的聚合结果,用于驱动排行榜页面
almanbench-result.schema.json 每行结果的 JSON Schema 定义

当前结果(v0.1)

评估于 2026 年 7 月,使用系统提示中指定的规范。API 模型使用记录的推理努力级别;托管提供商模型通过 Hugging Face Inference Providers 运行。每个模型在全部 1,029 项公开测试集上运行一次。Acceptance 是主要评价指标

模型 路由 Acceptance Compliance
GPT-5.5 xhigh OpenAI API 94.8% 99.9%
GPT-5.6 Sol max OpenAI API 94.4% 99.9%
Claude Fable 5 high Anthropic API 94.1% 99.8%
GPT-5.6 Sol xhigh OpenAI API 93.5% 99.7%
DeepSeek V4 Flash HF Inference Providers, Novita 89.7% 99.8%
Inkling max HF Inference Providers, Together 89.2% 99.8%
GPT-5.6 Luna xhigh OpenAI API 87.7% 98.4%
GPT-5.6 Terra xhigh OpenAI API 87.5% 99.8%
Kimi K2.7 Code HF Inference Providers, Novita 87.0% 99.3%
DeepSeek V4 Pro HF Inference Providers, Novita 85.3% 99.8%
Claude Sonnet 5 xhigh Anthropic API 83.3% 95.4%
MiniMax M3 HF Inference Providers, Novita 79.6% 98.2%
Claude Opus 4.8 max Anthropic API 74.8% 91.1%
Nemotron 3 Ultra HF Inference Providers, Together 74.6% 98.4%
Qwen3.6 35B A3B HF Inference Providers, Scaleway 74.3% 97.0%
Gemma 4 31B IT HF Inference Providers, Novita 64.8% 94.8%
MiMo V2.5 Pro HF Inference Providers, DeepInfra 64.2% 88.5%
Ternary Bonsai 27B HF Inference Providers, Together 48.2% 90.4%

评价指标

  • Acceptance(主要指标):对测试项完整许可翻译集的归一化精确匹配。评分区分大小写,历史来源中的古旧拼写必须保留。
  • Compliance(辅助指标):保守的语法检查,标记 Alman 已淘汰的标准德语表面形式。不相关但语法正确的答案仍可通过,因此仅作为下限指标。

数据版本管理

结果仅在同一基准版本内可比。在 v0.1 版本中,接受集维护会就地更新参考标准,已存储的运行会重新评分(必要时在受影响行上重新运行)。每行记录其评分的 case_set_idscoring_revision。未来版本会创建新目录和新 parquet 文件,旧版本保持不变发布。

使用示例

python from datasets import load_dataset

rows = load_dataset("osolmaz/almanbench-results", split="v0_1") sol = rows.filter(lambda r: r["model_id"] == "gpt-5.6-sol-xhigh") misses = sol.filter(lambda r: not r["correct"])

出处与污染政策

运行通过 bench-run 管道(Inspect AI、模型注册、导出器)执行,每行记录确切的 scoring_revision(可复现评分的仓库提交)。基准数据中的源句子和可接受翻译可能污染模型,AlmanBench 数据禁止出现在训练语料中。规范金丝雀 GUID:8b1a4c9e-almanbench-4f2d-9c7a-3e5b6d8f0a12

引用信息

bibtex @misc{almanbench2026, title = {AlmanBench: A Standard German to Alman Translation Benchmark}, author = {Solmaz, Onur}, year = {2026}, howpublished = {url{https://alman.ai/almanbench/}} }

搜集汇总
数据集介绍
almanbench-results 数据集图片
构建方式
AlmanBench-results数据集是基于AlmanBench翻译基准测试的逐样本模型结果汇聚而成。该基准测试聚焦于标准德语到Alman方言的翻译任务。数据集的构建方式为:首先从osolmaz/almanbench基准数据集中获取每个测试项的源句与可接受的译法,随后针对多个模型(涵盖OpenAI API、Anthropic API、Hugging Face推理提供商等不同渠道)进行独立推理,记录各模型对每一条测试项的输出内容、暴露的推理过程、接受度与合规性两项评分、令牌计数以及完整的运行溯源信息(包括运行ID、执行ID、案例集ID和评分修订版本号)。所有结果整合为一个Parquet格式的大表,并辅以逐模型的JSON Lines文件和聚合摘要,形成层次分明的数据存储结构。
特点
该数据集的核心特色在于其精细化的逐行记录粒度与完备的溯源机制。每一行不仅承载模型输出的原始文本,还包含其与标准译法集合的匹配情况,从而实现了对翻译质量的精确量化评估。接受度作为主要指标,衡量模型输出与全部许可译文集合的归一化精确匹配率;合规性则作为辅助门槛,检测模型是否错误保留了标准德语表层形态。此外,数据集通过记录case_set_id和scoring_revision字段,确保不同评分版本下的结果具有可追溯性和可比性。所有模型输出均以原始形式提供,便于研究者进行二次分析与交叉验证。
使用方法
数据集可通过Hugging Face Datasets库便捷加载,使用load_dataset('osolmaz/almanbench-results', split='v0_1')即可获取包含18,522条记录的数据表。研究者可基于model_id字段对特定模型的输出进行过滤,例如筛选gpt-5.6-sol-xhigh模型的所有结果。进一步的细致分析可通过filter方法实现,如定位模型回答未被接受的实例。Parquet文件支持大数据量下的高效查询,而逐模型的JSON Lines文件则便于与传统脚本工具链对接。数据集的领导者榜单文件(leaderboard.json)可直接用于渲染公开排行榜页面。使用时应严格遵守反污染策略,包含标记值8b1a4c9e-almanbench-4f2d-9c7a-3e5b6d8f0a12的数据不得用于训练语料。
背景与挑战
背景概述
AlmanBench-results数据集诞生于2026年,由研究员Onur Solmaz及其团队构建,旨在系统评估大语言模型将标准德语翻译为Alman方言的能力。Alman方言作为德语的一种独特地域变体,在词汇、句法和拼写方面与标准德语存在显著差异,而现有机器翻译基准大多聚焦于标准语言对,忽视了低资源或非标准化语言现象的评测需求。该数据集通过收录18种前沿模型的逐项回答、接受率与合规性分数,构建起首个面向Alman方言翻译的标准化评估框架。其影响力体现在三个层面:为方言机器翻译提供了可重复的评测基线,揭示了当前模型在处理非标准语言变体时的性能上限,并推动了翻译质量评估从单一语法正确性向方言文化契合度的多维延伸。
当前挑战
AlmanBench所解决的核心领域挑战在于,标准德语与Alman方言之间的翻译并非简单的词汇替换,而是涉及音系演变、形态简化、历史拼写保留及习语转换等多重非线性映射,传统基于平行语料统计的翻译模型往往因缺乏方言注释而失效。在数据集构建过程中,主要面临三大困难:一是Alman方言的参考译文需要同时涵盖口语化表达、历史文献原文与当代用法,导致标准答案集合的枚举工作极为繁琐;二是同一输入句可能存在多个等价的Alman译法,且评分需兼顾大小写敏感性与古老拼写原貌,对自动评估指标的设计提出高要求;三是需确保评测数据不会出现在训练语料中,为此引入了BIG-bench公约的蜜罐标识符以阻断数据泄露,但长期维护无污染评估集仍需持续的治理机制。
常用场景
经典使用场景
AlmanBench-results数据集作为德语方言翻译基准测试的权威结果库,其经典应用场景在于系统化评估大语言模型在标准德语至Alman方言转换任务上的表现。研究者通过加载该数据集中包含的每一样本模型输出、接受率与合规性评分等细粒度指标,可对GPT-5.5、Claude Fable 5等前沿模型的翻译能力进行横向对比。该数据集记录了超过18,000条逐项结果,覆盖1,029条测试样本,为方言翻译领域的模型性能基准化提供了标准参照。
解决学术问题
该数据集精准回应了低资源语言变体翻译评估中缺乏标准化基准的学术困境。通过引入接受率作为核心指标并辅以合规性评分,它解决了传统机器翻译评测中忽略方言特有词汇与语法结构的问题。AlmanBench-results使得研究者能够量化模型在保留历史拼写和文化语境方面的表现,推动了对语言模型方言敏感性的系统性研究。其公开的评分修订版本机制保障了评估结果的可复现性,为翻译质量评估方法论树立了新标杆。
衍生相关工作
AlmanBench-results衍生了一系列重要研究工作,包括基于该结果集开发的方言翻译模型优化策略,如针对性微调方法(针对低接受率类别的增强训练)与混合路由系统(根据样本复杂度动态选择最佳模型)。后续工作还构建了方言翻译困难度分类器,通过分析结果中不同模型的错例模式自动识别翻译难点。这些衍生成果进一步拓展了基准测试的价值,推动了低资源语言变体翻译领域从评估到改进的完整研究闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务