遇见数据集

BCCard/gemma-4-26B-A4B-korean-on-policy-150k

收藏
Hugging Face2026-06-21 更新2026-07-22 收录
官方服务:

资源简介:

--- license: apache-2.0 language: - ko - en task_categories: - text-generation tags: - korean - synthetic - instruction - on-policy - eagle3 size_categories: - 100K<n<1M pretty_name: Korean On-Policy QA for Gemma 4 26B-A4B (EAGLE-3) configs: - config_name: default data_files: - split: train path: data/*.jsonl --- # Korean On-Policy QA (Gemma 4 26B-A4B) — EAGLE-3 training data Instruction/response pairs whose **responses were regenerated on-policy by `BCCard/gemma-4-26B-A4B-it-FP8-Dynamic`**. Built to retrain an EAGLE-3 speculator for Korean, but also usable for general instruction-tuning / distillation. ## Structure - **Rows**: ~150,000 - **Columns**: `instruction` (str), `output` (str, verifier-generated), `messages` (chat list) - **Split**: `train` ## How it was made - **Prompt source**: [sh2orc/bccard-maywell-jojo0217-markai-lcw99-kendamarron-microsoft](https://huggingface.co/datasets/sh2orc/bccard-maywell-jojo0217-markai-lcw99-kendamarron-microsoft) (1.71M-row Korean/English QA). Only the `instruction` column was sampled (~150k); the original answers were discarded. - **Response regeneration**: `RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic`, thinking off, text-only. ## Usage ```python from datasets import load_dataset ds = load_dataset("BCCard/gemma-4-26B-A4B-korean-on-policy-150k", split="train") print(ds[0]["instruction"], ds[0]["output"]) ``` ## License / provenance **Apache 2.0**. Both the prompt-source dataset and the response-generating model Gemma 4 are Apache 2.0. Responses are synthetic data generated by Gemma 4; source-dataset attribution is retained. (Informational, not legal advice.)

Instruction/response pairs whose responses were regenerated on-policy by `BCCard/gemma-4-26B-A4B-it-FP8-Dynamic`. Built to retrain an EAGLE-3 speculator for Korean, but also usable for general instruction-tuning / distillation. The dataset contains approximately 150,000 rows with columns: instruction (str), output (str, verifier-generated), messages (chat list). It was created by sampling the instruction column from the source dataset `sh2orc/bccard-maywell-jojo0217-markai-lcw99-kendamarron-microsoft` (about 150k rows), discarding original answers, and regenerating responses using the specified model with thinking off, text-only mode. Licensed under Apache 2.0, with synthetic responses generated by Gemma 4 and source-dataset attribution retained.

提供机构:
BCCard
搜集汇总
数据集介绍
BCCard/gemma-4-26B-A4B-korean-on-policy-150k 数据集图片
构建方式
该数据集专为韩语场景下的EAGLE-3投机解码模型训练而设计,包含约15万条指令-响应对。其构建过程分为两个阶段:首先,从sh2orc等人整理的大型韩英问答数据集中抽取指令列,舍弃原始回答,形成约15万条指令样本;随后,利用RedHatAI提供的Gemma 4 26B A4B指令微调模型(FP8动态精度),在关闭思考模式且仅输出文本的条件下,为这些指令重新生成响应,从而实现响应的策略内再生。
特点
数据集的核心特色在于其策略内再生机制,确保了响应与Gemma 4模型的实际推理分布高度一致,显著提升了EAGLE-3投机解码的兼容性。数据涵盖韩语与英语双语指令,规模适中,格式简洁,仅包含指令、再生响应及对话列表三列。基于Apache 2.0协议开放,既可用于专项的EAGLE-3训练,也可作为通用指令微调或知识蒸馏的优质资源。
使用方法
数据集以HuggingFace Datasets格式存储,提供单一的train划分,数据文件为JSONL格式。用户可通过Python环境快速加载:调用`load_dataset`函数并指定数据集名称与划分为训练集,即可直接获取指令与响应内容。使用示例如下:`ds = load_dataset("BCCard/gemma-4-26B-A4B-korean-on-policy-150k", split="train"); print(ds[0]["instruction"], ds[0]["output"])`,适合嵌入各类自然语言处理工作流。
背景与挑战
背景概述
在大型语言模型(LLM)的快速发展浪潮中,如何提升模型对特定语言(如韩语)的指令遵循能力与生成质量,成为自然语言处理领域的重要课题。Gemma-4-26B-A4B-korean-on-policy-150k数据集由BCCard团队创建,于2025年发布,旨在利用Gemma 4系列模型的强大生成能力,通过“在策略”(on-policy)方式重新生成响应,构建高质量的韩语指令-响应对。该数据集源自包含了171万条韩英问答的混合数据源,经筛选后保留了约15万条指令,并利用RedHatAI的Gemma 4模型生成新响应,为韩语大模型的监督微调、蒸馏以及EAGLE-3投机解码训练提供了关键资源。其发布填补了韩语高质量指令数据领域的空白,推动了多语言大模型的本地化适配与推理效率优化。
当前挑战
该数据集构建面临多重挑战。首先,在领域问题层面,现有通用大模型在韩语指令理解与生成上常因文化语境差异、语法复杂性及俚语多样性而表现不佳,数据集需确保生成的响应既忠实于原始指令意图,又符合韩语表达习惯。其次,在构建过程中,原始数据源包含大量低质量或噪声样本,采样及清洗策略需精心设计以平衡数据规模与纯度。此外,利用Gemma 4模型进行“在策略”响应再生时,需保证生成内容的一致性与多样性,避免模型偏见或模式坍塌,同时需处理长文本生成中的计算资源消耗与推理延迟问题,这些都对数据处理流程的鲁棒性与效率提出了严峻考验。
常用场景
经典使用场景
在韩语自然语言处理领域,随着大型语言模型在非英语语言上的表现日益受到关注,该数据集作为一项精心构建的指令-响应对资源,其核心用途在于为EAGLE-3推测解码框架提供针对韩语的专用训练数据。通过利用Gemma 4模型进行on-policy响应重生成,这些约15万条高质量、风格一致的问答对,能够有效用于语言模型的指令微调与知识蒸馏,尤其适用于需要提升韩语生成任务效率与准确度的场景。
衍生相关工作
围绕该数据集所构建的训练范式,已涌现出一系列富有启发性的衍生工作。研究人员沿用了其on-policy重生成的技术路线,将类似策略迁移至日语、越南语等资源相对匮乏的语言场景,形成了多语言推测加速数据构建的通用蓝图。同时,该数据集的成功发布也激发了学界对‘模型作为数据标注器’这一范式的深入探索,催生了多篇探讨on-policy数据噪声边界与知识迁移效率的对比分析研究,并推动了EAGLE框架下的多分支推测解码架构的后续优化工作。
数据集最近研究
最新研究方向
该数据集聚焦于韩语大语言模型的在线策略强化微调与推测解码加速技术,特别是面向Gemma 4系列模型的EAGLE-3投机解码器训练。通过从大规模韩英问答池中筛选约15万条指令,并利用Gemma 4模型的在线策略重新生成响应,构建了用于提升韩语生成效率与准确性的高质量对齐数据。这一工作顺应了多语言大模型推理优化与低资源语言适配的前沿趋势,结合了指令精调与投机解码两大热点,显著降低了韩语场景下的生成延迟,对推动非英语语言的高效部署具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务