遇见数据集

INSAIT-Institute/rit-arc-challenge

收藏
Hugging Face2026-06-22 更新2026-07-22 收录
官方服务:

资源简介:

ARC-Challenge Multilingual是一个多语言基准测试数据集,源自“Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets”项目。该数据集重新组织了来自INSAIT-Institute/multilingual-benchmarks集合的每种语言版本,包含乌克兰语、爱沙尼亚语、土耳其语、罗马尼亚语、斯洛伐克语、希腊语和立陶宛语等语言配置。数据集包含小学科学问题,这些问题通常需要多步推理和背景知识,用于评估多语言语言模型的性能。每个语言配置都保留了原始数据集的拆分名称和模式,字段包括id、question、choices和answerKey。数据集旨在简化跨语言基准比较,同时将每种语言隔离为独立的配置。使用时应考虑机器翻译数据的局限性,如语言歧义和文化背景敏感性。

ARC-Challenge Multilingual is a multilingual benchmark dataset from the Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets project. It reorganizes per-language datasets from the INSAIT-Institute/multilingual-benchmarks collection into one repository with configs for Ukrainian, Estonian, Turkish, Romanian, Slovak, Greek, and Lithuanian. ARC-Challenge contains grade-school science questions that typically require multi-step reasoning and background knowledge. Each config preserves the split names and schema of the source dataset, with fields including id, question, choices, and answerKey. The dataset is intended for multilingual benchmark evaluation and analysis, facilitating cross-language model comparisons while keeping languages isolated as separate configs. Caveats include sensitivity to machine translation issues such as ambiguity and cultural context.

提供机构:
INSAIT-Institute
搜集汇总
数据集介绍
INSAIT-Institute/rit-arc-challenge 数据集图片
构建方式
ARC-Challenge Multilingual数据集源于RiTranslation项目,旨在通过高效自动化翻译流程将英文科学推理基准扩展到多语言场景。其构建依托于INSAIT-Institute发布的单语言数据集,经重新组织整合为一个统一的数据集仓库。具体而言,每个语言子集对应一个独立配置(config),如乌克兰语(ukr)、爱沙尼亚语(et)、土耳其语(tr)等,各配置均保留原始ARC-Challenge数据集的字段结构(包括id、question、choices、answerKey)及训练、验证、测试三阶段划分。数据集采用Parquet格式存储,通过Hugging Face的load_dataset接口按语言配置加载,确保不同语言的数据隔离与便捷调用。
特点
该数据集的核心特色在于其多语言覆盖与高保真度翻译质量。针对ARC-Challenge中需要多步推理与背景知识的科学问题,RiTranslation框架引入了自检查(Self-Check)、最佳N选(Best-of-N)、通用自我改进(USI)及T-RANK多轮排序等测试时计算策略,显著提升翻译准确性,进而增强多语言大模型评估的可靠性。数据集包含希腊语、爱沙尼亚语、拉脱维亚语、罗马尼亚语、斯洛伐克语、土耳其语及乌克兰语七种语言,将英文科学问答迁移至东欧与南欧语言环境,为跨语言推理能力评估提供了对齐的评测基准。
使用方法
使用ARC-Challenge Multilingual数据集时,可借助Hugging Face的datasets库灵活加载。首先通过load_dataset('INSAIT-Institute/rit-arc-challenge', config_name)指定目标语言配置,如加载乌克兰语子集时执行load_dataset('INSAIT-Institute/rit-arc-challenge', 'ukr')。若需查看所有可用语言配置,可调用get_dataset_config_names('INSAIT-Institute/rit-arc-challenge')。数据集保留了原始ARC-Challenge的题目、选项与答案键字段,可直接用于多语言模型推理任务的评估与对比分析。建议注意机器翻译评估数据的内在局限,结合具体语言的文化语境谨慎解读结果。
背景与挑战
背景概述
ARC-Challenge数据集源于Allen Institute for AI推出的AI2推理挑战(ARC),旨在评估人工智能系统在小学科学知识层面的多步推理与常识理解能力。该数据集最初聚焦于英语场景,但其蕴含的复杂逻辑与领域知识使其成为检验模型泛化能力的重要标尺。2025年,由INSAIT研究所的Hanna Yukhymenko、Anton Alexandrov和Martin Vechev主导的RiTranslation项目通过自动化翻译流水线,将该基准扩展至乌克兰语、爱沙尼亚语、土耳其语等七种中欧与东欧语言,形成了多语言版本的ARC-Challenge。这项研究不仅推动了低资源语言评估基准的构建,更揭示了机器翻译质量对跨语言模型评测的深远影响,为多语言自然语言处理领域提供了标准化工具与实证依据。
当前挑战
该数据集的核心挑战在于应对机器翻译引入的语义失真与语言特异性问题。自动翻译可能无法保留科学问题中的文化隐喻或语境依赖,导致跨语言评测结果的可比性受损。此外,构建过程中需平衡翻译质量与效率,RiTranslation团队探索了Self-Check、Best-of-N及T-RANK排序等方法以优化译文的准确性与一致性,但翻译错误、歧义消解及数据污染风险依然存在。同时,不同语言间的句法差异(如斯拉夫语族的屈折变化或波罗的语族的格系统)要求翻译流程具备高度适配性,而缺乏人类校验的自动化处理可能进一步放大误差。这些因素共同构成了多语言基准评测中数据可靠性与模型公平性之间的核心张力。
常用场景
经典使用场景
ARC-Challenge Multilingual数据集作为一项面向多语言场景的科学推理基准,其经典用途在于评估语言模型在基础教育阶段科学知识问答上的多步骤推理能力。该数据集涵盖乌克兰语、爱沙尼亚语、土耳其语、罗马尼亚语、斯洛伐克语、希腊语和立陶宛语七种语言,每一子集均保留了原版ARC-Challenge的题目结构与答案形式。研究者和开发者可借助该基准,在统一框架下横向对比不同语言模型对科学常识的掌握与推理表现,从而深刻洞察模型在多语言环境下的知识迁移与逻辑演绎水准。
实际应用
在实际应用层面,该数据集可广泛服务于多语言教育科技产品的智能评估与优化。例如,教育机构可利用该基准检验自动辅导系统在不同语言环境下回答科学问题的准确性,改善跨国线上学习平台的问答质量。机器翻译与多语言问答系统的开发团队亦可借鉴该数据集,诊断翻译后内容在科学逻辑保留上的缺陷,并迭代模型以提升对复杂科学问题的跨语言理解与应答能力,最终赋能全球多语种教育资源的公平分配。
衍生相关工作
围绕ARC-Challenge Multilingual,科研社区已衍生出一系列重要工作。该数据集源自RiTranslation自动化翻译框架,该框架系统研究了Self-Check、Best-of-N、Universal Self-Improvement及T-RANK多轮排序等测试时计算策略,显著提升了翻译质量与多语言评测可靠性。此外,该数据集被整合至INSAIT-Institute的多语言基准集合之中,常被后续研究用作对比多语言大模型推理能力的标准工具。这些衍生工作共同推动了多语言评估方法的革新,并为跨语言知识理解系统的演进奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务