遇见数据集

Miwa-Keita/zenz-v2.5-dataset

收藏
Hugging Face2025-01-17 更新2025-08-30 收录
官方服务:

资源简介:

zenz-v2.5-dataset是一个专门为かな漢字変換任务构建的数据集,包含约1.9亿对「左文脈-输入-変換结果」数据,适用于训练zenz-v2.5系列的语言模型,数据集采用JSONL格式,可用于实现充分的模型性能。

zenz-v2.5-dataset is a dataset specialized for the kana-kanji conversion task, containing approximately 190 million pairs of "left context-input-conversion result" data, suitable for training the zenz-v2.5 series of language models. The dataset is in JSONL format and can be used to achieve substantial model performance.

提供机构:
Miwa-Keita
二维码
社区交流群
二维码
科研交流群
商业服务