遇见数据集

nanochat-jp-eval-bundle

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

nanochat-jp-eval-bundle 是一个日语评估数据集捆绑包,专为 nanochat-jp(nanochat 的日语分支)设计。该数据集将现有的公开日语基准转换为 nanochat 评估代码可直接读取的格式,并附带配置文件一并发布。评估分为两个体系:CORE 和 Chat。CORE 面向基础模型(预训练后),采用 few-shot 的似然比较(多项选择)或连续生成(语言建模)进行评分,任务定义在 core.yaml 中,包含 6 个任务:JAQKET(2,000 样本,语言建模,10-shot)、COPA-ja(500 样本,2 选 1,0-shot)、Global-PIQA parallel(103 样本,4 选 1,10-shot)、Global-PIQA nonparallel(100 样本,2 选 1,10-shot)、JCommonsenseQA(1,118 样本,5 选 1,10-shot)、JSQuAD(4,420 样本,语言建模,10-shot)。Chat 面向 SFT 或 RL 后的聊天模型,使用 few-shot 示例作为 user/assistant 轮次,对生成结果评分,包含 5 个任务:JMMLU(7,097 样本,4 选 1,4-shot)、JamC-QA(2,309 样本,4 选 1,4-shot)、PFGen(50 样本,基于 n-gram/关键词的流畅性、准确性、有用性平均,20-shot)、YOMI-Bench 生成(2,880 样本,生成一致,3-shot)、YOMI-Bench 分类(5,760 样本,选项标签似然比较,4-shot)。当所有 5 个 Chat 任务结果齐全时,可计算以随机基线为中心的平均值 ChatCORE。数据集包含 dev 文件(jamcqa_dev.jsonl,32 样本)用于兼容性。许可证方面,由于集成了多个不同来源的基准,数据集整体采用混合许可证(other),每个文件继承原典的许可证(如 CC BY-SA 4.0、BSD 2-Clause、Apache-2.0 等)。该数据集仅限评估使用,禁止混入训练数据,转换后的评分可能与官方基准不可直接比较。

nanochat-jp-eval-bundle is a Japanese evaluation dataset bundle designed for nanochat-jp (the Japanese branch of nanochat). This dataset converts existing public Japanese benchmarks into a format directly readable by nanochat evaluation code and releases them with configuration files. The evaluation is divided into two systems: CORE and Chat. CORE targets base models (after pre-training) and uses few-shot likelihood comparison (multiple choice) or continuous generation (language modeling) for scoring. Tasks are defined in core.yaml, including 6 tasks: JAQKET (2,000 samples, language modeling, 10-shot), COPA-ja (500 samples, 2-choice, 0-shot), Global-PIQA parallel (103 samples, 4-choice, 10-shot), Global-PIQA nonparallel (100 samples, 2-choice, 10-shot), JCommonsenseQA (1,118 samples, 5-choice, 10-shot), JSQuAD (4,420 samples, language modeling, 10-shot). Chat targets chat models after SFT or RL, uses few-shot examples as user/assistant turns, and scores generation results. It includes 5 tasks: JMMLU (7,097 samples, 4-choice, 4-shot), JamC-QA (2,309 samples, 4-choice, 4-shot), PFGen (50 samples, average of n-gram/keyword-based fluency, accuracy, and usefulness, 20-shot), YOMI-Bench generation (2,880 samples, generation consistency, 3-shot), YOMI-Bench classification (5,760 samples, option label likelihood comparison, 4-shot). When all 5 Chat task results are available, the average ChatCORE centered on a random baseline can be computed. The dataset includes a dev file (jamcqa_dev.jsonl, 32 samples) for compatibility. Regarding licenses, due to integration of multiple benchmarks from different sources, the overall dataset adopts a mixed license (other), with each file inheriting the original sources license (e.g., CC BY-SA 4.0, BSD 2-Clause, Apache-2.0, etc.). This dataset is for evaluation only, and mixing into training data is prohibited. The converted scores may not be directly comparable with official benchmarks.

提供机构:
tohoku-nlp
创建时间:
2026-08-16
原始信息汇总

nanochat-jp-eval-bundle 数据集详情

数据集概述

  • 语言:日语(ja)
  • 任务类型:多项选择、问答、文本生成
  • 用途:为 nanochat 的日语分支 nanochat-jp 提供的日语评估数据包(eval bundle),将现有公开日语基准转换为 nanochat 评估代码可读的格式,并附带配置文件。
  • 许可协议:混合来源许可(other),整体不设单一开源许可,各文件继承原典数据集各自的许可。

评估体系

数据集包含两套评估系统:

  • CORE:面向基础模型(预训练刚完成),通过 few-shot 的似然比较(多项选择)或持续生成(语言建模)打分,任务及 shot 数在 core.yaml 中定义。
  • Chat:面向 SFT / RL 后的聊天模型,将 few-shot 示例作为 user/assistant 轮次输入,对生成结果进行打分,任务注册于 nanochat-jp 的 chat_eval_common.py 中。

CORE 评估任务

任务 文件 格式 shot 数 数量 随机基线
JAQKET world_knowledge/jaqket.jsonl 语言建模 10 2,000 0%
COPA-ja commonsense_reasoning/copa_ja.jsonl 多项选择(2选) 0 500 50%
Global-PIQA(平行) commonsense_reasoning/global_piqa_parallel.jsonl 多项选择(4选) 10 103 25%
Global-PIQA(非平行) commonsense_reasoning/global_piqa_nonparallel.jsonl 多项选择(2选) 10 100 50%
JCommonsenseQA commonsense_reasoning/jcommonsenseqa.jsonl 多项选择(5选) 10 1,118 20%
JSQuAD reading_comprehension/jsquad.jsonl 语言建模 10 4,420 0%

Chat 评估任务

任务 文件 评分方式 shot 数 数量 随机基线
JMMLU jmmlu/jmmlu.jsonl 生成文本中的最后一个 A–D 标签 4(同一科目) 7,097 25%
JamC-QA jamcqa/jamcqa.jsonl 生成文本中的最后一个 A–D 标签 4(同一类别) 2,309 25%
PFGen pfgen/pfgen.jsonl n-gram / 关键词的流畅性、正确性、有用性平均 20 50 0
YOMI-Bench(生成) yomi_bench/generation.jsonl 读音、韵律生成一致性 3 2,880 0
YOMI-Bench(分类) yomi_bench/classification.jsonl 选择标签的似然比较 4 5,760 37.5%
  • jamcqa/jamcqa_dev.jsonl(32件)当前评估不加载,仅为兼容历史评估而随附。
  • 5个任务全部完成后,以随机基线为中心计算平均得到 ChatCORE 指标。

数据来源与许可

任务 来源 许可
JAQKET(v2.0 test) kumapo/JAQKET(原典:AI王) CC BY-SA 4.0
COPA-ja nlp-titech/copa-japanese BSD 2-Clause
Global-PIQA(平行 / 非平行日语部分) mrlbenchmarks/global-piqa-parallel、同 nonparallel CC BY-SA 4.0
JCommonsenseQA、JSQuAD yahoojapan/JGLUE CC BY-SA 4.0
JMMLU nlp-waseda/JMMLU CC BY-SA 4.0(不含 CC BY-NC-ND 的 JMMLU_NC_ND 科目)
JamC-QA sbintuitions/JamC-QA CC BY-SA 4.0
PFGen pfnet-research/pfgen-bench Apache-2.0
YOMI-Bench benchmark-release/YOMI-Bench CC BY-SA 4.0

core.yamleval_meta_data.csv 的格式源自上游 nanochat(和 Mosaic Eval Gauntlet)。

重要注意事项

  • 仅供评估使用,不得混入训练数据。
  • 转换过程中已调整了提示格式、shot 数和打分方式以适配 nanochat 评估代码,因此不能与各基准的官方分数直接比较
  • 数据多源自网络文本,内容准确性以原典为准。
搜集汇总
数据集介绍
nanochat-jp-eval-bundle 数据集图片
构建方式
nanochat-jp-eval-bundle 数据集是专为 nanochat-jp 项目构建的日语评估套件。它将现有公开日语基准转换为 nanochat 评估代码可直接读取的格式,并附带配置文件。评估分为 CORE 和 Chat 两个体系:CORE 面向预训练基础模型,采用 few-shot 似然比较(多项选择)或续写(语言建模)进行评分;Chat 面向经过 SFT 或 RL 的对话模型,以 few-shot 示例作为 user/assistant 对话轮次,对生成结果进行评分。该套件包含 JAQKET、COPA-ja、Global-PIQA、JCommonsenseQA、JSQuAD 等 CORE 任务,以及 JMMLU、JamC-QA、PFGen、YOMI-Bench 等 Chat 任务,共计数千至数万个样本。
特点
该数据集具有以下显著特点:其一,双轨评估体系兼顾基础模型与对话模型,前者侧重事实知识与常识推理,后者强调生成质量与指令跟随。其二,任务覆盖广泛,包括世界知识、常识推理、阅读理解、多选问答、文本生成等多种形式,且多数任务具有明确的随机基线(如25%、50%),便于对比。其三,基于公共基准转换,严格遵循原始许可(如CC BY-SA 4.0、Apache-2.0等),并明确标注各文件来源。其四,被明确定位为评估专用,禁止混入训练数据,确保评测公平性。
使用方法
使用该数据集时,需结合 nanochat-jp 的评估框架。CORE 任务通过 few-shot 似然比较或续生成进行评分,配置在 core.yaml 中定义;Chat 任务则通过生成文本中的末位标签(如 A-D)或 n-gram 匹配进行评分,任务注册于 chat_eval_common.py。用户可直接加载 JSONL 文件,并按指定 shot 数设置示例。需注意,转换过程可能使评分方式与官方基准略有差异,故结果不宜直接与官方公开分数对比。数据集附带许可证信息,使用时须遵守各文件的原节点条件。
背景与挑战
背景概述
nanochat-jp-eval-bundle数据集由日本东北大学自然语言处理实验室(Tohoku NLP Group)于2024年创建,旨在为nanochat-jp日语对话模型提供统一的评估基准。该数据集整合了多个公开的日语自然语言处理基准,如JAQKET、COPA-ja、JCommonsenseQA等,并按照nanochat的评估格式进行转换,涵盖多种任务类型,包括多项选择、问答和文本生成。其核心研究问题在于构建一个标准化、可复现的评估流程,以衡量基础模型和对话模型在不同能力维度上的表现。该数据集的发布促进了日语大语言模型的公平比较,为相关研究提供了重要参考,影响了后续日语评估基准的设计与开发。
当前挑战
该数据集面临的挑战主要体现在两方面:其一,所解决的领域问题——日语大语言模型评估缺乏统一标准,不同基准的提示格式、评分方法各异,导致结果难以直接比较,该数据集通过格式转换和设置随机基线中心化评分(如ChatCORE)来部分缓解,但转换过程可能引入偏差,且与官方基准分数不完全一致;其二,构建过程中的挑战——整合多个来源的基准时需处理不同许可证的兼容性,最终数据集不设单一许可证,并需明确标注各文件来源;此外,为适配nanochat评估代码,需重新设计few-shot示例的提供方式,并确保转换后的数据不损害原始评测的效度。
常用场景
经典使用场景
nanochat-jp-eval-bundle数据集专为日语语言模型的系统评测而设计,其核心使用场景涵盖基础模型(预训练后)与对话模型(SFT/RL后)的两大评估体系。对于基础模型,该数据集通过few-shot的似然比较(多项选择)或持续生成(语言建模)形式,精准评估模型在日语世界知识、常识推理、阅读理解等维度的能力,例如JAQKET任务检测语言模型对开放式问题的知识覆盖,而COPA-ja和JCommonsenseQA则考验模型在因果关系与常识推断上的表现。对于对话模型,数据集以few-shot用户/助手交互范式,结合生成内容评分,衡量模型在回答多选知识问题(JMMLU)、日语语境理解(JamC-QA)、流畅性(PFGen)以及诗歌阅读与韵律生成(YOMI-Bench)等任务上的综合对话质量,从而为日语LLM的研发提供标准化、可复现的评测基准。
衍生相关工作
该数据集衍生了多项关键的后续工作与研究方向。其设计思路汲取自上游的nanochat(以及Mosaic Eval Gauntlet),并将日语基准统一整合,激发了针对日语评测流程的标准化探索,例如后续研究者可能基于此评估包扩展更多日语任务或新语言版本。同时,ChatCORE得分的提出为对话模型的综合评估提供了新指标,推动了以综合均值衡量模型能力的学术讨论。该数据集也被用于训练后的模型反馈循环,衍生了基于评测结果的数据筛选与微调策略研究。此外,由于各基准来源于不同项目(如JMMLU、YOMI-Bench),数据集的发布促进了跨基准的元分析,为日语NLP领域提供了可复用的评测基础设施,并为未来多语言、多任务统一评测框架的建立奠定了实践基础。
数据集最近研究
最新研究方向
nanochat-jp-eval-bundle数据集的最新研究方向聚焦于为日语大语言模型构建统一、可复现的评估体系,其核心创新在于将多种既有基准(如JAQKET、JMMLU、YOMI-Bench)转化为nanochat评估框架兼容的格式,并区分面向预训练基座模型的CORE评测与面向对话微调模型的Chat评测。该设计顺应了当前大模型评估从单一任务准确率向多维度能力(如世界知识、常识推理、阅读理解、生成流畅性)与对齐质量并重的趋势,尤其通过引入像YOMI-Bench这样涵盖语言韵律生成与分类的任务,触及了日语特有的语言特性评估,彰显了区域语言模型评测的精细化发展方向。此数据集的格式化尝试,旨在提升跨模型评测的可比性与效率,为日语LLM的快速迭代与性能验证提供了重要基座,其混合许可证的整合策略亦为后续多源评测数据集的合规构建树立了范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务