遇见数据集

HSK-graded Chinese Sentence Dataset

收藏
github2026-07-15 更新2026-08-02 收录
官方服务:

资源简介:

HSK分级中文句子数据集:包含句子、拼音、英文翻译、逐词注释、官方语法点标签以及正常/慢速音频。按照官方HSK 3.0标准分级,确保每个级别无超纲词汇,并覆盖该级别词汇表。包含4354个句子,覆盖HSK 1-6级,以及8708个MP3音频文件。

HSK Graded Chinese Sentences Dataset: This dataset comprises sentences, Hanyu Pinyin, English translations, word-by-word annotations, official grammar point tags, and both normal and slow-speed audio files. It is graded in accordance with the official HSK 3.0 standard, ensuring no out-of-level vocabulary for each level and covering the official vocabulary list of the corresponding level. The dataset contains 4354 sentences spanning HSK Levels 1 through 6, alongside 8708 MP3 audio files.

创建时间:
2026-07-09
原始信息汇总

数据集概述

hsk-sentences-audio 是一个面向中文学习者的HSK分级句子数据集,提供带拼音、英文翻译、逐词注释、官方语法点标签以及常速/慢速双速音频的完整结构化句子记录,可直接用于闪卡、跟读、听力练习或间隔重复学习(SRS)应用。


规模与分级

数据集涵盖HSK 3.0(GF0025-2021)官方标准下的六个等级(1–6级),共 4,354 个句子,并附带 8,708 个MP3音频文件(每句常速+慢速各一个,总计约170 MB)。

等级 句子数 词汇覆盖率 超纲词数
HSK 1 281 94% (478/506词) 0
HSK 2 538 100% (750/750词) 0
HSK 3 727 99% (950/953词) 0
HSK 4 801 98% (956/972词) 0
HSK 5 965 98% (1045/1059词) 0
HSK 6 1042 99% (1112/1123词) 0
总计 4354 0
  • 所有句子严格仅使用当前等级及以下等级的词汇,超纲词为0
  • 每个等级中未被覆盖的少量词为不能独立成句的黏着语素(如“员/者”),其合成词均已包含。

数据结构

每条记录包含以下字段(示例来自 dist/sentences.json):

  • id:句子唯一标识(如 hsk1-0002
  • hsk_level:所属HSK等级
  • topic:主题分类,共18个主题(问候、家庭、时间、食物、交通、健康等)
  • sentence_type:句型(陈述、疑问、祈使)
  • chinese:简体中文句子
  • traditional:繁体中文句子
  • pinyin:拼音(含轻声、多音字、儿化处理)
  • pinyin_numbered:带声调数字的拼音
  • translation.en:英文翻译
  • tokens:逐词注释,包含词语、拼音和英文释义
  • grammar_tags:官方语法点ID(如 1-09 表示程度副词,完整语法点登记表见 data/grammar_points.json
  • audio:常速和慢速音频文件路径
  • audio_meta:音频生成信息(引擎 CosyVoice2-0.5B、音色 zh-female-studio、许可证 Apache-2.0、采样率 24000)

使用方式

  1. 在线浏览:可通过实时数据集浏览器查看,或离线双击 dist/index.html。支持按等级、主题、句型、语法点四个维度筛选,并可点击播放音频。
  2. 开发集成:访问开发者设置页(或离线 dist/setup.html),可一键导出SQL(SQLite/PostgreSQL/MySQL)、CSV及Anki导入文件,并提供Swift/TypeScript/Kotlin数据模型及LLM提示词生成器。
  3. 程序化读取:直接读取 dist/sentences.jsondist/audio/ 目录即可。
  4. 包管理安装
    • npm:npm install hsk-sentences-audio(JavaScript/TypeScript)
    • PyPI:pip install hsk-sentences-audio(Python)

质量保证

  • 分级验证scripts/hsk_validate.py):逐词对照官方词表检查超纲词(目标为0)和覆盖率,结果可复现。
  • 语法点注册表:包含全部413个等级1–6的官方语法点(ID/等级/类别/例句),其中70个有自动检测规则,并有回归测试保护。
  • 拼音处理:基于pypinyin结合CC-CEDICT批量校正(轻声、儿化)及人工覆盖层,确保文本与音频拼音一致。
  • 分词:jieba(关闭HMM)+ HSK词表重切分,自动拆分错误合并,并配备异常表。
  • 音频合成:使用CosyVoice2-0.5B本地合成,工作室女声参考音色,裁剪起始瞬态并做淡入处理。合成语音需在应用中进行披露(符合行业惯例)。
  • 复审流程:构建时自动标记多音字/词典外词汇,人工确认后修正写入 data/overrides.json,永久生效。

数据贡献

可编辑 data/sentences/hsk<level>.yaml 文件添加句子,每句仅需提供中文、英文翻译和语法标注三个字段;拼音、繁体、分词、注释、主题、句型、语法标签和音频均由流水线自动生成,运行验证器确认无超纲词即可。


许可证

  • 代码:MIT
  • 数据集(dist/:CC-BY-SA 4.0(注释和逐词拼音含CC-CEDICT衍生内容)
  • 音频:Apache-2.0(由CosyVoice2合成)
搜集汇总
数据集介绍
HSK-graded Chinese Sentence Dataset 数据集图片
构建方式
该数据集以HSK 3.0官方标准为基石,严格遵循《国际中文教育中文水平等级标准》(GF0025-2021)进行构建。构建流程从官方词表与语法点文本出发,经由文本管道自动化生成拼音、分词、词级注释及语法标签,并辅以人工复核与异常修正机制。语音部分采用CosyVoice2模型本地合成,为每句生成常速与慢速双版本MP3,并经过起音去噪后处理。全部4354个句子均按等级精确控制词汇范围,确保零超纲词汇,并通过可复现的校验脚本验证覆盖度与合规性。
特点
数据集覆盖HSK 1至6级全部官方等级,共4354条句子,每条记录集成简体/繁体、拼音(含数字调)、英文翻译、逐词注释、官方语法点标签及双速音频,形成自洽的结构化数据单元。特色在于严格的等级纯净性:所有句子仅使用本等级及以下词汇,且系统性覆盖各等级词表,这一特性可由仓库内置验证器机械核查。此外,数据附带18个主题分类与四类句类标注,便于多维度检索;音频由Apache-2.0许可的CosyVoice2合成,可自由再分发,适合直接嵌入闪卡、跟读及间隔重复学习应用。
使用方法
使用者可通过多种途径便捷调用。即时浏览可访问在线数据浏览器或本地HTML文件,支持按等级、主题、句类及语法点的联动筛选与音频播放。程序化集成可选用npm或PyPI包,如JavaScript端调用loadSentences与filterSentences快速获取特定等级与主题的句子及音频URL;Python端则通过iter_sentences与audio_url实现同等功能。开发者还可利用设置页面一键导出SQL、CSV及Anki导入文件,并获取Swift、TypeScript、Kotlin数据模型及LLM提示词,以加速应用开发。数据直接存储于dist/sentences.json与dist/audio/目录,便于原始读取与自定义处理。
背景与挑战
背景概述
HSK-graded Chinese Sentence Dataset由开发者no7z创建,旨在为中文学习者提供一套严格遵循官方HSK 3.0标准(GF0025-2021)的分级句子资源。该数据集涵盖HSK 1至6级共4354个句子,每句均配有拼音、英文翻译、逐词注释、官方语法点标签及常速和慢速双速音频(共8708个MP3文件)。其核心研究问题在于如何构建一个可验证的、零超纲词的中文教学数据集,以支持词汇、语法和听力的系统性学习。该数据集通过npm、PyPI和Hugging Face等多渠道分发,并配套交互式浏览器和验证工具,为中文教育技术领域提供了标准化、可复现的数据基础设施,对智能语言学习应用开发具有重要影响力。
当前挑战
该数据集面临多重挑战。领域问题方面,中文词汇的语境依赖性和多音字、轻声、儿化等语音现象使得准确拼音标注和词级切分极为困难;同时,确保每级句子仅使用本级及以下词汇(零超纲词)并系统覆盖该级词表,需要精细的词汇等级校验。构建过程中,词表覆盖未达100%的级别存在无法单独成句的黏着语素(如“员”、“者”),需通过复合词间接覆盖;语法点自动检测规则需持续回归测试以防误判;TTS音频合成需平衡自然度和资源消耗,且合成语音的披露要求亦需遵守。这些挑战推动了数据验证机制和音频后处理流程的持续优化。
常用场景
经典使用场景
该数据集为汉语学习者提供了一套按HSK 3.0标准严格分级的句子资源,每个句子均包含简体/繁体、拼音、英文翻译、词级注释、语法点标注及双速音频。其最经典的使用场景是构建语言学习应用,如抽认卡程序、跟读训练系统、听力练习平台和间隔重复学习(SRS)工具。数据集设计为即取即用的数据层,学习者可直接按等级、主题、句型或语法点检索句子,并配合音频进行听、说、读、写训练。其完备的结构化记录和跨平台支持(npm、PyPI、Hugging Face)使其成为开发交互式汉语学习产品的理想起点。
衍生相关工作
该数据集衍生的工作覆盖自然语言处理、语音技术及教育技术等多个方向。在NLP领域,其分词、词性及语法点标注为中文句法分析、难度评估和文本简化研究提供了基准数据。在语音领域,双速音频对可辅助语音合成(TTS)的韵律建模和自动语音识别(ASR)的鲁棒性测试。教育技术方面,基于该数据集已开发出例句推荐系统、个性化练习题生成器及语法点自动检测工具,例如仓库中的语法规则回归测试套件即为一个典型案例。此外,该数据集已托管至Hugging Face,促进了社区驱动的模型微调(如句子难度预测、拼音预测)和跨语言学习工具研究,形成了一套完整的分级汉语学习数据生态。
数据集最近研究
最新研究方向
该数据集最新研究方向聚焦于构建符合HSK 3.0官方标准的分级中文教学资源,其创新之处在于实现了词汇、语法点与双速音频的机器可验证对齐,为零超纲词覆盖提供了可复现的量化保障。研究前沿体现在将语言学习数据与软件开发生态深度融合,通过npm、PyPI及Hugging Face等多渠道分发,支持SQL导出与Anki导入,直接服务于间隔重复系统(SRS)和影子跟读等个性化学习场景。此外,数据集中对413个官方语法点的标注及自动检测规则,为自然语言处理中的中文语法错误纠正和自适应学习路径规划提供了高质量语料基础,推动了计算语言学和智能教育技术的交叉应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务