遇见数据集

AkkadNMT-75K: A Large-Scale Akkadian-English Parallel Corpus for Neural Machine Translation

收藏
Zenodo2026-03-29 更新2026-05-26 收录
官方服务:

资源简介:

AkkadNMT-75K is a large-scale parallel corpus containing 75,562 aligned Akkadian transliteration-English translation pairs for neural machine translation research. Dataset Statistics:Total parallel pairs: 75,562Unique transliterations: 74,420 (98.5%)Unique translations: 47,633 (63.0%)Mean transliteration length: 102.5 characters / 12.8 wordsMean translation length: 113.0 characters / 20.4 words Sources:Old Assyrian Kültepe Tablets (including AKT 8): ~40,000 rowsORACC, CuneiML, EvaCun: ~37,000 rows File format: CSV with UTF-8 encodingColumns: transliteration, translation This dataset was developed for the Kaggle Deep Past Initiative Machine Translation Challenge, achieving a Silver Medal (79th place, score 36.3).

提供机构:
Zenodo
创建时间:
2026-03-29
二维码
社区交流群
二维码
科研交流群
商业服务