遇见数据集

GitHub Typo Corpus

收藏
OpenXLab2026-04-18 收录
官方服务:

资源简介:

你是那种在写代码的时候经常打错字的人吗?还是您是通过“修复错字”提交来修复它们的人?不管怎样,谢谢你——你为 NLP 领域的最新技术做出了贡献。 GitHub Typo Corpus 是一个大规模的拼写错误和语法错误以及从 GitHub 收集的更正的数据集。它包含超过 350k 的编辑和超过 15 种语言的 65M 字符,使其成为迄今为止最大的拼写错误数据集。

提供机构:
OpenDataLab
创建时间:
2022-05-23
二维码
社区交流群
二维码
科研交流群
商业服务