Sea-New
收藏资源简介:
Sea-News是一个双语新闻领域数据集,专为机器翻译任务设计。该数据集源自原始数据集HuggingFaceFW/finetranslations,并经过精选处理。它覆盖了多种东南亚语言,包括越南语、菲律宾语、印尼语、马来语、泰语、老挝语、高棉语(柬埔寨语)和缅甸语,以及英语。数据集规模在10万到20万样本之间,属于中等规模的多语言翻译语料,适用于自然语言处理中的多语言机器翻译研究和应用,特别是针对东盟语言场景。
Sea-News is a multilingual news domain dataset specifically designed for machine translation tasks. This dataset is derived from the original dataset HuggingFaceFW/finetranslations and has been carefully curated. It covers multiple Southeast Asian languages, including Vietnamese, Filipino, Indonesian, Malay, Thai, Lao, Khmer (Cambodian), Burmese, and English. With a scale ranging from 100,000 to 200,000 samples, it is a medium-sized multilingual translation corpus suitable for research and applications of multilingual machine translation in natural language processing, especially for ASEAN language scenarios.
数据集概述:Sea-News
- 名称:Sea-News
- 语言对:
- 越南语 (vi)
- 英语 (en)
- 菲律宾语 (fil)
- 印度尼西亚语 (id)
- 马来语 (ms)
- 泰语 (th)
- 老挝语 (lo)
- 高棉语/柬埔寨语 (km)
- 缅甸语 (my)
- 任务类别:翻译 (translation)
- 标签:机器翻译、多语言、自然语言处理、东盟语言
- 样本规模:100,000 < n < 200,000
- 数据领域:新闻 (News)
- 来源:该数据集从原始数据集
HuggingFaceFW/finetranslations中筛选提炼而成。 - 语言代码备注:高棉语(柬埔寨)在 Hugging Face 中使用 ISO 639-1 代码
km。




