遇见数据集

COO

收藏
OpenDataLab2026-07-12 更新2024-05-09 收录
官方服务:

资源简介:

COO是一个具有挑战性的文本数据集,由日本漫画中的拟声词文本组成。COO有许多任意文本,例如极弯曲、部分缩小的文本,或任意放置的文本。此外,一些文本被分成几个部分。每个部分都是截短的文本,本身没有意义。

COO is a challenging text dataset consisting of onomatopoeic texts extracted from Japanese manga. It contains numerous irregularly formatted texts, such as extremely curved, partially scaled-down, or arbitrarily positioned texts. Additionally, some texts are split into multiple segments, each of which is a truncated piece of text with no inherent meaning on its own.

提供机构:
OpenDataLab
创建时间:
2022-11-02
搜集汇总
数据集介绍
COO 数据集图片
背景与挑战
背景概述
COO是一个由东京大学于2022年发布的文本数据集,专用于日本漫画中的拟声词,包含大量具有挑战性的任意文本,如弯曲、缩小或分散的片段,这些片段本身无意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务