遇见数据集

imabari_wiki_qa_v4_validated

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Imabari QA v4 — Validated 是一个用于监督微调(SFT)的日语问答数据集。该数据集由两个独立构建且经过验证的变体合并而成:程序化验证数据集(4,146个样本)和人工验证数据集(4,078个样本)。源语料库为 ikedachin/imabari_wiki_cpt_v3,QA生成模型为 Qwen3.8-27B-NVFP4。合并后的数据集共包含8,224个样本,其中训练集7,401个样本,验证集823个样本(约9:1比例)。数据字段包括:qa_id(唯一UUID)、question(问题)、thinking(生成的推理过程)、answer(最终答案)、eval(QA评估值)、qa_generator(生成模型标识)、messages(ChatML格式的SFT对话字段)、source_files(源文件列表)、id(原始文档ID)和chunk_index(原始数据块索引)。数据集主要特点包括:日语问答、涵盖今治市和爱媛县等地域知识、合成推理数据、两种验证方法(程序化和人工)的整合、支持多种SFT格式(Chat SFT、推理SFT等)。预期用途包括日语LLM监督微调、指令微调、推理SFT、LoRA/QLoRA、区域特化LLM、区域知识问答、合成QA/推理研究、数据验证研究以及不同验证方法效果的对比实验。需要特别注意:本数据集的“验证”标记仅表示每个样本通过了至少一种验证方法(程序或人工),并非同时通过两者;数据为合成数据,可能包含幻觉、事实错误、推理错误、偏见和生成模型特定模式;程序化验证和人工验证标准不同,整体数据集验证标准不均匀;数据集不应用于医疗、法律、金融、防灾等高风险领域作为唯一信息源。数据集基于CC BY-SA 4.0许可发布。

Imabari QA v4 — Validated is a Japanese question-answering dataset for supervised fine-tuning (SFT). It is created by merging two independently constructed and validated variants: a programmatically validated set (4,146 samples) and a human-validated set (4,078 samples). The source corpus is ikedachin/imabari_wiki_cpt_v3, and the QA generation model is Qwen3.8-27B-NVFP4. The merged dataset contains 8,224 samples, split into 7,401 training samples and 823 validation samples (approximately 9:1 ratio). Data fields include: qa_id (unique UUID), question, thinking (generated reasoning process), answer (final answer), eval (QA evaluation score), qa_generator (generator model identifier), messages (ChatML-formatted SFT conversation field), source_files (list of source files), id (original document ID), and chunk_index (original chunk index). Key features include: Japanese Q&A, local knowledge of Imabari City and Ehime Prefecture, synthetic reasoning data, integration of two validation methods (programmatic and human), and support for multiple SFT formats (Chat SFT, reasoning SFT, etc.). Intended uses include supervised fine-tuning of Japanese LLMs, instruction tuning, reasoning SFT, LoRA/QLoRA, region-specific LLMs, local knowledge Q&A, synthetic QA/reasoning research, data validation research, and comparative experiments on different validation methods. Important notes: The validated label only indicates that each sample passed at least one validation method (programmatic or human), not both; the data is synthetic and may contain hallucinations, factual errors, reasoning errors, biases, and generative model-specific patterns; programmatic and human validation standards differ, leading to uneven validation criteria; the dataset should not be used as a sole information source in high-risk domains such as medical, legal, financial, or disaster prevention. The dataset is released under the CC BY-SA 4.0 license.

创建时间:
2026-09-09
搜集汇总
数据集介绍
imabari_wiki_qa_v4_validated 数据集图片
构建方式
在日语大语言模型监督式微调数据资源建设的背景下,该数据集以今治市及爱媛县地域知识问答为核心,整合了程序化验证与人工复核两条独立质量管控路径所产出的合成推理数据。其底层语料源自今治维基持续预训练语料库,由Qwen3.8-27B-NVFP4模型生成问答与推理轨迹,分别经程序确定性校验与人工审阅后,将两个验证变体以并集方式合并为统一数据集。合并后的样本总量为8224条,其中程序验证数据4146条、人工验证数据4078条,训练集与验证集按约九比一的比例划分。
特点
该数据集呈现出多维度质量管控融合的鲜明特征。其内容涵盖今治市与爱媛县的地方性知识,问答与推理均由合成方式生成,并保留了完整的思维链轨迹。数据以ChatML格式组织,助手回复采用思考标签包裹推理过程后接最终答案的结构,便于直接用于推理式监督微调。每条样本附带唯一标识、生成模型、评估分值、来源文件及分块索引,具备良好的可追溯性。尤为值得关注的是,数据集的验证标签表示样本经由程序验证或人工验证之一,而非同时通过双重验证,这一并集属性为比较不同验证策略的互补效果提供了实证基础。
使用方法
该数据集主要服务于日语大语言模型的监督微调与指令微调任务,尤其适用于推理增强型对话微调、低秩适配及量化低秩适配等参数高效微调场景。研究者可通过Hugging Face数据集加载接口直接调用,训练与验证划分可直接用于模型训练与评估。消息字段支持标准Chat格式的监督微调流程,而独立的推理与答案字段则便于开展推理轨迹分析或仅使用最终答案的训练变体。此外,该数据集的设计支持围绕原始合成数据与验证数据、程序验证与人工验证、单一验证与合并验证等多组对照实验,用以探究数据质量管控对模型性能的实际影响。
背景与挑战
背景概述
随着大语言模型在日语语境下的应用不断深化,面向特定地域的知识问答与推理能力成为评测模型本地化水平的重要维度。Imabari QA v4 — Validated数据集正是在此背景下构建的日语监督微调语料,由研究者ikedachin创建并发布于Hugging Face平台。该数据集以今治市及爱媛县的地方知识为核心,源自Wikipedia语料库ikedachin/imabari_wiki_cpt_v3,经由Qwen3.8-27B-NVFP4模型合成问答与推理轨迹,并整合程序化验证与人工审核两条质量管控路径,共收录8,224条样本。其核心研究问题在于探讨不同验证机制对合成推理数据质量的保障效果,以及验证数据的规模扩展对监督微调性能的影响,为地域特化语言模型的构建与合成数据质量研究提供了可比较的实验基础。
当前挑战
该数据集所面对的领域问题在于日语地域知识问答的稀缺性与合成数据质量参差不齐之间的矛盾,如何在有限的本土语料中生成兼具事实准确性与推理连贯性的问答对,构成其根本挑战。构建过程中的难点则集中于验证机制的设计与统一:程序化验证依赖确定性规则,能够高效筛查格式与结构异常,却难以捕捉语境层面的细微偏差;人工审核虽可识别规则之外的语义不当与不自然表达,但其成本高昂且一致性受限。二者判定标准与覆盖范围的异质性,使得整合后的数据集难以保证完全均一的验证基准,加之合成数据固有的幻觉、事实错误与生成模型偏见风险,以及方言风格表达的真实性无法得到充分保证,均为该数据集的实际使用与后续研究带来不容忽视的制约。
常用场景
经典使用场景
在低资源地域知识与日语言语理解的研究脉络中,该数据集最为典型的应用场景在于面向日本今治市与爱媛县的地方性知识问答监督微调。其以今治维基语料为根基,整合程序化验证与人工复核两路合成推理样本共计八千二百二十四条,并以ChatML格式的messages字段直接承载思维链与最终答案,使研究者能够在开放域问答与推理式指令微调任务中,对模型进行端到端的日语能力塑造与地域知识注入。
实际应用
在实践层面,该数据集可服务于面向地方治理、观光导览与社区服务的日语对话系统构建,尤其适用于需要处理今治市及爱媛县地域性表述的问答与推理场景。其messages字段与独立的thinking、answer字段支持Chat SFT、推理SFT、LoRA与QLoRA等多种训练范式,亦便于仅取最终答案进行常规问答训练,或对思维链展开分析与消融实验,具备良好的工程适配弹性。
衍生相关工作
围绕该数据集已形成一组彼此关联的经典工作,包括作为源语料的imabari_wiki_cpt_v3、作为原始合成问答与推理数据集的imabari_wiki_qa_v4,以及分别侧重程序化验证与人工复核的两个分支版本。该整合版本正是在这些工作的基础上,通过统一不同验证路径所得数据,拓展了可用于训练的策展式合成推理资源,并为后续比较原始数据与验证数据、单一验证与联合验证等研究提供了直接可用的对照素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务