遇见数据集

formosa-nlu-synth-v1

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

FormosaNLU Synth 是一份以正體中文(台灣,zh-TW)為主的口語自然語言理解(NLU)合成訓練資料集,涵蓋 60 種意圖(intent)與 55 種槽位類型(slot type)。資料由本機 open-weight 教師模型(Qwen3.6:27b)生成,經 deterministic F1–F6 過濾器與不同家族的獨立評審(F7)稽核後,發布 3,754 筆訓練樣本。每筆資料包含 id、utterance(utt)、intent 標籤、槽位跨度(slots)、風格(style,如 massive_like 或 tw_colloquial)、生成配方(recipe)、教師模型、提示版本、種子樣本 ID、生成參數與過濾分數等欄位。資料來源為 Amazon Science MASSIVE 的 zh-TW 子集,經每意圖約 20 筆種子取樣(共 1,176 筆)後,由教師模型生成 11,264 筆原始數據,經層層過濾最終保留 3,754 筆。下游評估顯示,在完全未參與生成或訓練的 MASSIVE zh-TW 測試集(2,974 筆)上,使用 Gemma 4 E4B QLoRA 模型,過濾後的合成資料相較僅使用真實資料在意圖準確率上平均提升 +4.14 個百分點(95% CI [+2.60, +5.59]),精確匹配提升 +3.86 個百分點(95% CI [+2.75, +4.92]),並在 Phi-4-mini-instruct 模型上複製出類似結果。資料集適合用於正體中文意圖分類與槽位填充研究、合成資料過濾與蒸餾、低資源增強、NLU 管線與穩健性實驗。限制包括:種子資料源自翻譯型 MASSIVE,無法代表所有自然台灣口語;合成記錄可能保留教師偏差或未偵測的品質問題;穩健性測試為確定性探針,非真實 ASR 輸出;不應用於醫療、法律、金融或安全決策。資料集採用 CC BY 4.0 授權。

FormosaNLU Synth is a synthetic training dataset for spoken Natural Language Understanding (NLU) primarily in Traditional Chinese (Taiwan, zh-TW), covering 60 intents and 55 slot types. The data is generated by a local open-weight teacher model (Qwen3.6:27b), filtered through deterministic F1–F6 filters and audited by independent reviewers from different families (F7), resulting in 3,754 training samples. Each sample includes fields such as id, utterance (utt), intent label, slot spans, style (e.g., massive_like or tw_colloquial), generation recipe, teacher model, prompt version, seed sample ID, generation parameters, and filtering scores. The data source is the zh-TW subset of Amazon Science MASSIVE, with approximately 20 seed samples per intent (1,176 total) used to generate 11,264 raw samples from the teacher model, which are then progressively filtered to retain 3,754 samples. Downstream evaluation on the MASSIVE zh-TW test set (2,974 samples), which was not involved in generation or training, shows that using Gemma 4 E4B QLoRA with the filtered synthetic data improves intent accuracy by an average of +4.14 percentage points (95% CI [+2.60, +5.59]) and exact match by +3.86 percentage points (95% CI [+2.75, +4.92]) compared to using only real data, and similar results were replicated on the Phi-4-mini-instruct model. The dataset is suitable for research on Traditional Chinese intent classification and slot filling, synthetic data filtering and distillation, low-resource augmentation, NLU pipelines, and robustness experiments. Limitations include: seed data originates from translated MASSIVE, which cannot represent all natural Taiwanese spoken language; synthetic records may retain teacher biases or undetected quality issues; robustness tests are deterministic probes, not real ASR outputs; and it should not be used for medical, legal, financial, or safety decisions. The dataset is licensed under CC BY 4.0.

创建时间:
2026-07-29
原始信息汇总

FormosaNLU Synth 数据集概述

基本信息

  • 语言:正體中文(台灣,zh-TW
  • 许可证:CC BY 4.0
  • 任务类别:文本分类、词元分类(意图识别、槽位填充)
  • 数据规模:1K < n < 10K,共 3,754 笔训练数据
  • 标签体系:涵盖 60 种 intent 与 55 种 slot type
  • 数据风格:包含 massive_liketw_colloquial 两种语料风格

数据内容与结构

  • 文件组成
    • data/train.jsonl:3,754 行训练数据
    • schema.json:JSON Schema 定义
    • release_manifest.json:来源 artifact、SHA-256、笔数与版本信息
  • 每条记录字段
    • id:稳定 synthetic sample ID
    • utt:正體中文(台灣)utterance
    • intent:MASSIVE intent label
    • slots{type, value} slot spans
    • stylemassive_liketw_colloquial
    • recipe:synthetic recipe
    • teacher_model:生成模型
    • prompt_version:prompt recipe version
    • seed_sample_id:来源 MASSIVE seed identifier
    • generation_params:frozen generation parameters
    • filter_scores:F5/F6 contamination 与 similarity evidence

数据来源与生成流程

  • 上游种子数据:Amazon Science MASSIVE zh-TW,每 intent 约 20-shot,共 1,176 笔
  • 生成模型qwen3.6:27b,本地 Ollama、open-weight
  • 生成规模
    • 原始生成:11,264 笔
    • F1–F6 过滤后:3,760 笔
    • F7 发布:3,754 笔
  • 过滤机制:包含 schema、label/slot span、script/language、duplicate、seed-copy、Test contamination、embedding outlier 与 independent judge audit;F7 random stratum 观察漏检率为 6.0%(样本仅 50 笔)

下游评估证据

第一轮(Gemma 4 E4B QLoRA)

在 2,974 行的 MASSIVE zh-TW Test 上,三个 paired seeds(42–44)显示:

  • Intent accuracy:filtered 相比 real-only 平均提升 +4.14 ± 1.39 个百分点
  • Exact match:平均提升 +3.86 ± 0.73 个百分点
  • Robustness:seed-42 filtered adapter 在 ASR-noise、colloquial、lexical 三种 probes 上的 intent accuracy、slot F1、exact match 均高于 real-only
  • 统计检验:5,000 次 hierarchical paired bootstrap 后,intent accuracy 95% CI [+2.60, +5.59],exact match 95% CI [+2.75, +4.92];每个 seed 的 McNemar tests 经 Holm correction 后均 p ≤ 0.00017

第二轮(Phi-4-mini-instruct 复制)

Metric Gemma Δ [95% CI] Phi Δ [95% CI]
Intent accuracy +4.14 [+2.60, +5.59] +5.09 [+1.83, +9.02]
Exact match +3.86 [+2.75, +4.92] +4.71 [+1.36, +7.59]

判准(两个 family 均需正向平均提升且 CI 下界大于零)通过,显示效益不是单一 student model 的特性

Robustness probe 复制

在 8,922 笔扰动 probe 上,两个 family 各三个 seed 的 paired delta(百分点):

Metric Gemma Δ ± SD Phi Δ ± SD
Intent accuracy +3.63 ± 1.72 +6.22 ± 3.46
Exact match +3.58 ± 2.05 +6.98 ± 3.29

十项全部为正,但强度不同;Phi 的五项 mean 均大于各自 SD,Gemma 仅两项如此。作者声明十个正数不等于十个已确立的效果。

未达标的指标

  • json_valid_rate 未通过预设门槛(Gemma 侧 CI 跨越零)
  • Phi 的 exact_match_seed_42 在 Holm 校正后 p = 0.141 不显著

适用场景

  • 正體中文 intent classification/slot filling 研究
  • Synthetic-data filtering、distillation 与 low-resource augmentation
  • NLU pipeline、schema-constrained output 与 robustness 实验

限制与不适用场景

  • zh-TW seed 源自翻译型 MASSIVE,无法代表所有自然台湾口语
  • Synthetic records 可能保留 teacher bias 或未偵测品质问题
  • F7 随机层漏检率为 6.0%,但样本仅 50 笔,置信区间很宽
  • Robustness 为 deterministic probes,非真实 ASR log
  • 不应将 intent/slot predictions 用于医疗、法律、金融或安全决策
  • 未发布 MASSIVE Test/validation,使用者需自行依 MASSIVE 授权取得评估资料

授权与引用要求

  • 数据集使用 CC BY 4.0,上游 MASSIVE zh-TW 同样为 CC BY 4.0
  • 使用或再发布时需:标柱 MASSIVE 与 FormosaNLU Synth;链接 CC BY 4.0;说明经 synthetic generation 与 filtering 修改
  • 引用格式:
    • MASSIVE:Jack FitzGerald et al. ACL 2023
    • FormosaNLU Synth:kuotunyu. "FormosaNLU Synthetic Data Distillation for Traditional Chinese (Taiwan) NLU, version 1.0.0. 2026."(完整代码、决策记录与实验报告见 GitHub 仓库

可重现性说明

release_manifest.json 提供发布档 SHA-256、原始 release artifact SHA-256、Git source commit 与确切笔数;完整生成、过滤与评估程序位于 GitHub 仓库中。

搜集汇总
数据集介绍
formosa-nlu-synth-v1 数据集图片
构建方式
在低資源語言理解的研究脈絡下,該資料集以Amazon Science MASSIVE zh-TW為上游種子,按意圖分層抽樣約二十例、共取得一千一百七十六筆初始樣本;繼而於本機Ollama環境部署開源權重教師模型qwen3.6:27b,以凍結之生成參數與提示版本進行口語化合成,產生一萬一千二百六十四筆候選語句。為確保品質,候選資料歷經確定性F1–F6過濾器,涵蓋結構與標籤跨度驗證、腳本與語言判別、重複與種子抄襲偵測、測試污染檢核及嵌入離群值篩除,再交由不同模型家族的獨立評審執行F7稽核,最終釋出三千七百五十四筆訓練資料。
特点
此語料以正體中文(台灣)口語風格為核心,覆蓋六十種意圖與五十五種槽類型,並以一行一筆的JSONL格式儲存。每筆紀錄除語句、意圖與槽跨度外,另附風格標記、合成配方、教師模型、提示版本、種子樣本識別碼、凍結生成參數,以及F5/F6污染與相似度證據分數,構成可供追溯的完整後設資訊。資料之效益經兩個學生模型家族及三種隨機種子的配對實驗驗證,並在抗噪、口語化與詞彙擾動探針上呈現一致的正向增益,惟其結論範圍限於既有訓練契約與評估設定。
使用方法
使用者可透過Hugging Face datasets函式庫以一行程式碼載入,取得訓練切分並檢視其筆數。資料適用於正體中文之意圖分類與槽填充研究,亦可用於合成資料過濾、知識蒸餾與低資源擴增之方法學探討,以及結構約束輸出與穩健性實驗。由於上游種子源自翻譯型MASSIVE,且合成紀錄可能殘留教師偏誤,實驗設計宜自行依MASSIVE授權取得評估資料並留意標註漏檢風險;相關預測不宜逕用於醫療、法律、金融或安全等決策場景。
背景与挑战
背景概述
伴随多语言自然语言理解研究的纵深推进,正体中文(台湾)口语NLU资源长期匮乏,既有语料多源于翻译型数据集,难以反映本地语言实态。FormosaNLU Synth于2026年面世,由研究者kuotunyu主导构建,以Amazon Science MASSIVE zh-TW为种子,借助本机开源权重教师模型蒸馏生成,涵盖60种意图与55种槽位类型,经确定性过滤与独立评审后发布3,754笔训练样本。该数据集直面低资源语言合成数据的质量与泛化难题,在MASSIVE zh-TW测试集上展现出可观的下游增益,为合成数据过滤、蒸馏与鲁棒性研究提供了可复现的实证基准。
当前挑战
意图分类与槽位填充任务本身面临口语多样性、标注边界模糊及跨领域迁移等固有困难,而正体中文台湾口语更因翻译型种子语料的代表性局限,难以覆盖真实语言变体。构建过程中,合成数据需在教师模型偏差、标签一致性、脚本与语言合规、重复与种子复制、测试污染及嵌入离群等多重风险间取得平衡,F1至F7过滤漏斗虽将逾万笔生成样本压缩至三千余笔,但F7随机层漏检率达6.0%且样本仅50笔,区间宽泛。鲁棒性评估依赖确定性探针而非真实ASR日志,M19等消融实验仅单种子描述性比较,无法支撑配方级因果论断,跨模型族复制虽通过预注册判准,仍局限于特定训练契约,不宜过度外推。
常用场景
经典使用场景
在正體中文(台灣)自然語言理解的研究脈絡中,意圖分類與槽位填充長期受制於高品質標註語料之匱乏,FormosaNLU Synth 遂以 MASSIVE zh-TW 為種子,透過本地開源教師模型生成涵蓋六十種意圖與五十五種槽位型別之口語語料,並經確定性過濾與獨立評審稽核,構築出貼近台灣口語風格之合成訓練集。其最經典之使用場景,在於以參數高效微調方式,將此合成語料與真實種子語料配對,於未參與生成或訓練之 MASSIVE zh-TW 測試集上執行意圖分類與槽位填充之受控實驗,藉以量測合成資料對於低資源語言之增益幅度,並檢驗模型於口語、噪聲與詞彙擾動下之穩健性。
衍生相关工作
此資料集之發布衍生出多項經典工作,包括以 Gemma 4 E4B 與 Phi-4-mini-instruct 為學生模型之 QLoRA 配對實驗,證實合成語料於兩個模型家族均帶來正向平均提升,並通過預先登記之穩健性判準;M19 等量組成消融則以留一配方方式檢視各生成配方之邊際貢獻,雖未達可偵測門檻,仍為配方層級因果推論提供描述性證據。此外,公開之 LoRA 適配器、技術報告與 Zenodo 典藏紀錄,連同釋出清單中之 SHA-256 與版本資訊,共同構成可追溯、可複製之研究資產,後續研究可據此延伸至其他語言變體或任務領域之合成資料蒸餾。
数据集最近研究
最新研究方向
面向正體中文(台灣)口語理解的低資源困境,FormosaNLU Synth 以合成資料蒸餾為核心進路,透過本機開放權重教師模型生成涵蓋 60 類意圖與 55 類槽位的語料,並以確定性過濾與跨家族獨立評審建構可稽核的資料管線。前沿研究聚焦於合成資料的品質篩選與汙染控制、跨學生模型的可複製增益驗證,以及在 ASR 噪聲、口語化與詞彙變異等擾動下的穩健性探針評估。該資料集以配對實驗與階層式自助法量化過濾後語料對意圖準確率與精確匹配的挹注,並透過留一配方消融檢視各合成策略的邊際貢獻,為台灣華語 NLU 的資料擴增、蒸餾與穩健性研究提供可重現的基準與方法論參照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务