遇见数据集

imabari_wiki_rl_v3

收藏
Hugging Face2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

Imabari Wiki RL v3数据集是一个专为日语强化学习设计的合成数据集,基于本地知识源数据集`ikedachin/imabari_wiki_cpt_v3`构建。它旨在支持RLHF、RLAIF、GRPO、PPO等强化学习训练流程,以及奖励建模、基于证据的问答评估和本地知识问答对齐等任务。数据集包含1024个日语多项选择题问答示例,其中训练集922个,验证集102个。每个示例结构丰富,包括问题、带标签的选项、正确答案标签和文本。其核心特色是同时提供“盲答”(不基于证据生成的答案)和“基于证据的答案”,并附有支持证据文本。此外,每个样本还包含难度评级、RL训练适用性标签、拒绝原因、QA生成模型信息以及ChatML格式的对话消息。该数据集主要用于优化语言模型在事实准确性、证据利用、答案校准和多项选择推理方面的能力,而非简单的答案模仿。用户可通过过滤`rl_suitability`为“accepted”的样本来获取适用于RL训练的数据子集。需要注意的是,数据集为合成生成,可能包含事实错误、幻觉或过时信息,且反映了源数据的覆盖偏差,不建议用于高风险决策或作为绝对事实来源。

The Imabari Wiki RL v3 dataset is a synthetic dataset specifically developed for Japanese-language reinforcement learning applications, constructed upon the local knowledge source dataset `ikedachin/imabari_wiki_cpt_v3`. It is designed to support reinforcement learning training pipelines including RLHF, RLAIF, GRPO, and PPO, as well as tasks such as reward modeling, evidence-based question answering (QA) evaluation, and local knowledge QA alignment. The dataset comprises 1,024 Japanese multiple-choice QA examples, with 922 samples in the training split and 102 in the validation split. Each example features a comprehensive structure, containing the question, labeled options, correct answer label, and corresponding text. Its core distinctive feature is the provision of both "blind answers" (answers generated without leveraging supporting evidence) and "evidence-based answers", accompanied by supporting evidence texts. Additionally, each sample includes a difficulty rating, RL training suitability label, rejection reason, QA generation model information, and ChatML-formatted conversation messages. This dataset is primarily intended to optimize language models' capabilities in factual accuracy, evidence utilization, answer calibration, and multiple-choice reasoning, rather than simple answer imitation. Users can acquire the data subset suitable for RL training by filtering samples where the `rl_suitability` field is set to "accepted". Notably, the dataset is synthetically generated and may contain factual errors, hallucinations, or outdated information, and reflects the coverage bias of the source data. It is not recommended for high-risk decision-making or as an absolute factual source.

创建时间:
2026-06-14
原始信息汇总

数据集概述

数据集名称: Imabari Wiki RL v3 Dataset (今治 Wiki RL v3 データセット)

许可证: cc-by-sa-4.0

语言: 日语 (ja)

数据集大小: n<1K (训练集 922 个样本,验证集 102 个样本)

任务类别: 问答 (question-answering)、文本生成 (text-generation)、文本分类 (text-classification)

数据集标签: 强化学习 (rl)、RLHF、RLAIF、GRPO、PPO、奖励建模、问答、选择题、日语、今治、爱媛、本地知识、合成数据、基于证据的问答、ChatML


数据集详情

该数据集是基于源数据集 ikedachin/imabari_wiki_cpt_v3 创建的日语强化学习数据集。它包含基于源数据集中本地知识的选择题问答示例。每个示例包含问题、答案选项、正确答案标签、正确答案文本、盲答、基于证据的答案、支持性证据、难度、RL 适用性以及聊天风格的 messages

该数据集专为日语语言模型的强化学习样式训练和评估而设计,适用于 RLHF、RLAIF、GRPO、PPO、奖励建模、基于证据的问答评估和本地知识问答对齐等场景。不同于纯 SFT 数据集,它旨在作为提示、候选答案、参考标签、基于证据的答案和面向奖励的评估信号的来源。

主要特征:

  • 日语选择题问答数据集
  • 为强化学习样式训练和评估设计
  • 基于 ikedachin/imabari_wiki_cpt_v3 的本地知识
  • 包含标签为 A、B、C、D 的答案选项
  • 包含正确答案标签和正确答案文本
  • 包含盲答和盲答置信度
  • 包含基于证据的答案和支持性证据
  • 包含难度标签
  • 包含 RL 适用性标签
  • 包含不适合示例的拒绝原因
  • 包含聊天风格的 messages
  • 包含 QA 生成模型的名称
  • 每个记录通过 chunk_index 与原始源数据块关联

数据来源:

  • 源数据集: ikedachin/imabari_wiki_cpt_v3 (https://huggingface.co/datasets/ikedachin/imabari_wiki_cpt_v3)
  • 自身: ikedachin/imabari_wiki_rl_v3
  • QA 生成模型: Qwen3.5-35B-A3B-GPTQ-Int4

数据集结构

每个记录以 JSON Lines 格式存储,包含以下字段:

字段名 类型 描述
id string 示例 ID
chunk_index integer 种子数据集中源数据块的索引
title string 源数据块的标题或主题
question string 选择题问题
choices list 答案选项,每个选项包含 labeltext
correct_label string 正确答案标签,如 A、B、C 或 D
correct_answer string 正确答案文本
blind_answer string 未使用证据时生成的答案,可能不正确
blind_confidence string 盲答的置信度标签
grounded_answer string 使用证据生成或验证的答案
evidence string 用于确定基于证据答案的支持性证据
difficulty string 示例的难度标签
rl_suitability string 对 RL 训练的适用性标签
rejection_reason string 如示例不适合,则提供拒绝原因
qa_generator string 用于生成 QA 样本的模型
messages list 聊天格式的提示和答案

数据划分:

  • 训练集 (train): 922 个样本
  • 验证集 (validation): 102 个样本
  • 总下载大小: 1,402,592 字节
  • 总数据集大小: 1,793,829 字节

示例记录: json { "id": "19395", "chunk_index": 1, "title": "成人式", "question": "2018 年現在、名古屋市 16 区の成人式会場について、小学校の学区毎に主に学校施設を使用して行われているのはどの区の数か。", "choices": [{"label": "A", "text": "10 区"}, {"label": "B", "text": "12 区"}, {"label": "C", "text": "14 区"}, {"label": "D", "text": "16 区"}], "correct_label": "B", "correct_answer": "12 区", "blind_answer": "10", "blind_confidence": "中", "grounded_answer": "12", "evidence": "参照情報「成人式に関する現状と課題」の記述「名古屋市 16 区のうち、東区・中区・昭和区・熱田区を除く 12 区では、小学校の学区毎に、主に学校施設を使用して成人式を行っとるんや」に基づき、対象となる区は 12 区であることが確定します。", "difficulty": "borderline", "rl_suitability": "accepted", "rejection_reason": "", "qa_generator": "Qwen3.5-35B-A3B-GPTQ-Int4", "messages": [ {"role": "user", "content": "2018 年現在、名古屋市 16 区の成人式会場について、小学校の学区毎に主に学校施設を使用して行われているのはどの区の数か。

A. 10 区 B. 12 区 C. 14 区 D. 16 区

正しい選択肢をA、B、C、Dから1つ選んでください。"}, {"role": "assistant", "content": "B. 12 区"} ] }


数据用途

直接用途:

  • 日语语言模型的强化学习
  • RLHF / RLAIF 实验
  • GRPO、PPO 或其他基于奖励的优化工作流
  • 奖励模型训练或奖励信号设计
  • 选择题问答评估
  • 基于证据的问答评估
  • 盲答与基于证据的答案对比
  • 本地知识问答对齐
  • 日语问答模型评估
  • 区域聊天机器人优化
  • 将 CPT/RAG 样式源数据转化为 RL 训练数据的实验
  • 评估合成 QA 生成和评分流程

推荐的使用模式:

  • 基于提示的 RL 训练: 使用 questionchoices 作为提示,根据 correct_labelcorrect_answer 给予奖励。
  • 基于证据的 QA 训练: 使用 questionchoicesevidence 作为输入,训练模型生成 grounded_answer
  • 奖励建模: 使用正确和错误的选项构建偏好对,将匹配 correct_label 的响应视为首选。
  • GRPO / PPO 训练: 使用选择题作为rollout提示,根据与 correct_labelcorrect_answer 的精确匹配进行评分。
  • 数据过滤: 仅使用 rl_suitabilityacceptedrejection_reason 为空的示例,并可通过 difficulty 进行分层。

不适用场景:

  • 作为医疗、法律、金融或灾难响应等高风险应用唯一的事实来源
  • 未经核实的官方行政指导
  • 实时的旅游或公共服务信息
  • 将合成证据视为始终完整或权威
  • 将方言式表达视为语言上权威的今治方言
  • 将数据集用作完全经核实的今治百科全书
  • blind_answer 用作正确答案
  • blind_confidence 视为校准的概率
  • 未经检查便将 rl_suitability 视为客观质量保证

数据创建

选择依据: 为向本地知识语言模型提供包含本地实体、地名、文化背景、历史信息和区域特定表达的 RL 训练数据,使其不仅能模仿答案,还能通过奖励优化答案正确性、证据使用、校准和选择题推理。

源数据: 来自 ikedachin/imabari_wiki_cpt_v3 的数据块。

生成流程:

  1. ikedachin/imabari_wiki_cpt_v3 中检索一个数据块
  2. 基于该数据块生成一个选择题
  3. 生成答案选项
  4. 确定正确答案标签和正确答案文本
  5. 在不使用证据的情况下生成或记录一个盲答
  6. 使用证据生成或验证一个基于证据的答案
  7. 添加支持基于证据答案的证据
  8. 分配难度和 RL 适用性标签
  9. 添加元数据,如 id、title、chunk_index 和 qa_generator
  10. 将结果转换成聊天格式的 messages

QA生成模型: Qwen3.5-35B-A3B-GPTQ-Int4


评估与奖励信号

数据集包含多个可用于评估或奖励设计的字段:

  • correct_label: 可用于精确匹配评分。
  • correct_answer: 可用于答案文本匹配。
  • blind_answer: 可作为基线响应。
  • grounded_answer: 可作为证据感知的答案。
  • evidence: 可用于检验答案是否基于证据。
  • difficulty: 可用于课程学习或分层评估。
  • rl_suitability: 可用于过滤 RL 训练的示例。
  • rejection_reason: 可用于排除不合适的示例。

一个简单的奖励函数可对匹配 correct_label 的响应给予正奖励,否则给予负奖励。更高级的奖励函数还可检查答案是否与证据一致。


局限性与风险

局限性:

  • 合成数据,可能包含幻觉
  • 生成的问题或选项可能包含事实错误
  • 源数据可能已过时
  • 证据可能不完整
  • 盲答可能不代表稳定的模型基线
  • 基于证据的答案仍可能包含错误
  • 方言式表达可能不准确代表真实今治方言
  • 数据集是区域性的,可能不会提高通用 QA 能力
  • rl_suitability 取决于数据集创建标准
  • 在此数据集上优化的模型可能学会利用精确匹配奖励格式
  • 模型可能只学会用标签回答而不解释推理过程
  • 如果包含证据进行训练,模型可能过度依赖证据样式提示

偏差:

  • 反映了源数据的覆盖范围和偏差,知名地点、历史人物、寺庙、旅游景点、行政主题和公共设施可能被过度代表
  • 生成的问题、选项、盲答和基于证据的答案可能包含 QA 生成模型导致的风格或事实偏差
  • 难度和 RL 适用性标签可能反映了评分和过滤过程的假设

推荐:

  • 训练前检查样本
  • 仅使用 rl_suitabilityaccepted 的示例
  • 检查具有非空 rejection_reason 的示例
  • 使用 difficulty 进行课程学习或评估子集划分
  • 使用 correct_label 进行精确匹配评分
  • 使用 evidence 进行基于证据的奖励设计
  • 在保留的本地知识问题上评估模型
  • 结合 RAG 或外部事实核查进行事实性应用
  • 评分前规范化答案格式
  • 避免仅依赖标签精确匹配来判断最终模型质量

引用

如果您使用此数据集,请引用此数据集和源数据集:

@misc{ikedachin_imabari_wiki_cpt_v3, title = {Imabari Wiki CPT v3}, author = {ikedachin}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/ikedachin/imabari_wiki_cpt_v3}}, note = {Source dataset. Licensed under CC BY-SA 4.0.} } @misc{ikedachin_imabari_wiki_rl_v3, title = {Imabari Wiki RL v3 Dataset}, author = {ikedachin}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/ikedachin/imabari_wiki_rl_v3}}, note = {Derived from ikedachin/imabari_wiki_cpt_v3. Licensed under CC BY-SA 4.0.} }

搜集汇总
数据集介绍
imabari_wiki_rl_v3 数据集图片
构建方式
本数据集源于ikedachin/imabari_wiki_cpt_v3所蕴含的丰富地方性知识,旨在为日语言模型的强化学习提供高质量的评测与训练素材。其构建流程严谨而系统,首先从源数据集中提取文段,基于文段内容生成包含四个选项的多选题,并精确标注出正确答案及其对应标签。为探索模型对证据的依赖程度,系统在无证据条件下生成盲目回答,并记录其置信度;随后基于给定证据生成有据回答,同时附上支撑推理的证据文本。每条样本最终被赋予难度等级与强化学习适配性标签,并封装为符合ChatML格式的对话消息,从而形成一个结构完整、意图明确的强化学习数据集。
特点
该数据集具备鲜明的结构特征与实验导向性。其核心特色在于为每一条选择题同时提供了盲目回答与有据回答,使得研究者能够对比模型在有无证据支持时的表现差异,从而深入分析模型的推理忠实度与事实校准能力。所有样本均标注了难度与RL适配性,并包含明确的拒绝理由,便于用户根据实验需求进行精细化筛选。此外,数据集中的对话式消息字段可直接作为强化学习中的提示输入,而正确答案标签则能无缝用作奖励信号,使得该数据集天然适配RLHF、GRPO、PPO等多种强化学习范式,为地方知识驱动的日语言模型对齐研究提供了坚实的数据基础。
使用方法
使用此数据集时,研究者可借助Hugging Face的datasets库快速加载,并依据实验目标灵活调整数据格式。在强化学习训练中,可直接将messages字段中的用户消息作为策略模型的输入,以正确答案标签或完整正确答案作为奖励评分的基准,构建精确匹配奖励函数。对于基于偏好的奖励建模任务,可将正确选项与错误选项构造为偏好对,结合盲答置信度与难度标签作为辅助特征。用户还可利用RL适配性字段对数据进行过滤,仅保留accepted样本,或根据难度标签设计课程学习策略。此外,证据字段可用于设计基于事实一致性的奖励信号,从而引导模型在生成回答时更加依赖可靠信息,避免空洞的猜测行为。
背景与挑战
背景概述
大语言模型的强化学微调(RLHF/RLHIF)技术近年来在提升模型输出与人类偏好对齐方面展现出显著潜力,然而现有强化学习数据集多聚焦于通用领域指令遵从或简单问答任务,缺乏对高度地域化知识体系的覆盖。在此背景下,2026年由研究者ikedachin发布的Imabari Wiki RL v3数据集应运而生,该数据集基于同一作者构建的Imabari Wiki CPT v3语料,通过Qwen3.5-35B模型自动生成包含盲答与有据回答的日语多选问答样本,旨在为区域语言模型提供从CPT/RAG数据向强化学习训练信号转化的桥梁,推动针对日本今治地区本土知识的奖励建模、GRPO/PPO优化及有据问答评估研究。
当前挑战
该数据集面临的核心挑战在于双重不确定性交织:一方面需解决地域化AI模型在缺乏深度地方知识标注数据时难以通过强化学习提升事实验证能力这一领域难题,尤其在多选推理中需区分模型盲目猜测与真正基于证据的推理行为;另一方面,构建过程依赖合成数据生成管线,面临答案源自大模型的幻觉风险、证据文本可能不完整、盲答与有据答案的置信度标签难以校准,以及RL适性标注受评分流程主观性影响等问题。此外,数据集规模较小(训练集922例)且高度区域特异,可能限制模型泛化能力并诱发对精确匹配奖励格式的过拟合,需谨慎设计奖励函数与评估协议以避免奖励破解行为。
常用场景
经典使用场景
该数据集最经典的使用场景是作为日本语言模型在强化学习框架下的训练与评估基准,尤其适用于RLHF、RLAIF、GRPO和PPO等基于奖励机制的优化流程。每个样本包含盲答与有据答的对比结构,使得模型在强化学习过程中不仅能够学习选择正确答案,更能通过根椐文本来提升事实性和证据利用能力。研究者可以将其作为多选问答的提示源,利用正确标签和根椐信息构建精确匹配或根椐感知的奖励函数,从而在区域知识对齐和选择式推理任务中实现模型行为的精细化调控。
实际应用
在实际应用中,该数据集可用于构建面向日本地方城市(如今治市、爱媛县)的智能问答系统、区域聊天机器人和旅游导览助手。通过强化学习调优,模型能够在回答中准确融入地方性实体、地名、节日和行政信息,提升对话系统的本土化回答质量。同时,该数据集也可服务于根椐地面问答系统的开发,使模型在具备参考文本时自动校准回答,减少幻觉现象,适用于区域行政服务、文化遗产数字化以及本地化教育辅导等对事实性要求较高的场景。
衍生相关工作
该数据集衍生了多个经典工作方向,包括基于根椐信息的奖励模型训练方法、多选问答格式下的GRPO策略优化实验,以及盲答与有据答对比分析研究。研究者利用其`rl_suitability`和`difficulty`字段构建课程学习或分层评估策略,并通过`evidence`字段开发根椐一致性奖励函数,推动了区域知识强化学习的可解释性研究。此外,该数据集催生了将结构化地方语料转化为强化学习训练数据的流程设计,为后续`ikedachin`系列中的CPT到RL的数据链工作提供了基础方法论和标准化评估范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务