Datasets for "Tokenization as Structural Inductive Bias"
收藏官方服务:
资源简介:
Cleaned text corpora used for evaluating the StructPiece tokenizer across 9 languages.
经清洗的文本语料库,用于在9种语言中评估StructPiece分词器。
提供机构:
Zenodo创建时间:
2026-05-05

Cleaned text corpora used for evaluating the StructPiece tokenizer across 9 languages.
经清洗的文本语料库,用于在9种语言中评估StructPiece分词器。