Miwa-Keita/zenz-v2.5-dataset
收藏官方服务:
资源简介:
zenz-v2.5-dataset是一个专门为かな漢字変換任务构建的数据集,包含约1.9亿对「左文脈-输入-変換结果」数据,适用于训练zenz-v2.5系列的语言模型,数据集采用JSONL格式,可用于实现充分的模型性能。
zenz-v2.5-dataset is a dataset specialized for the kana-kanji conversion task, containing approximately 190 million pairs of "left context-input-conversion result" data, suitable for training the zenz-v2.5 series of language models. The dataset is in JSONL format and can be used to achieve substantial model performance.
提供机构:
Miwa-Keita


