遇见数据集

CGIAR/TranslationDataset_AgriQueries

收藏
Hugging Face2024-11-19 更新2025-04-08 收录
官方服务:

资源简介:

本数据集包含英语和印地语拉丁文组成的文本对,以及一些包含印地语天城文的表格。数据集由不同的人类评估者创建,他们使用英文字母来书写印地语句。该数据集适用于构建从英语直接翻译到印地语拉丁文的模型,原因在于手机键盘输入印地语天城文字符存在限制。

This dataset consists of text pairs in English and Hindi_Latin, as well as some sheets containing Hindi_Devanagari. The dataset was created by different human evaluators who have written Hindi sentences in Hindi Latin (using English alphabets). The dataset can be used to create a translation model directly from English to Hindi Latin due to the limitations of mobile keyboards in typing Hindi Devanagari script.

提供机构:
CGIAR
二维码
社区交流群
二维码
科研交流群
商业服务