1,586,458 组文档OCR及结构化解析数据
收藏数据堂2026-08-17 收录
相关数据集
147小时菲律宾语自然对话电话信道语音数据
他加禄语自然对话电话信道语音数据,基于约30个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由约264名来自不同地域和文化背景的菲律宾本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数
数据堂610
203人中国台湾普通话语音数据_引导(手机)
中国台湾普通话语音数据_引导(手机),基于给定的脚本朗读并模拟录制,内容覆盖车载场景,智能家居,语音助手等多领域。此数据集标注了文本内容等多种属性,由203名来自不同地域和文化背景的台湾当地人录制,覆盖台北、高雄、台中、台南等地,其中女性 137 人,男性 66 人。数据录制环境是安静室内,无回音,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样
数据堂190
古吉拉特口语化语音数据
印度古吉拉特语口语化语音数据,反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别等多种属性,由多名来自不同地域和文化背景的印度人录制,准确性高,易用性强,为语音识别相关研究及应用提供了丰富的资源,有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循GDPR, CCPA, PIPL。
数据堂150
431小时德语语音数据_对话(电话)
德语语音数据_对话(电话),基于30余个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由590余名来自不同地域和文化背景的德国本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循
数据堂300
466人18,860张3D人体实例分割及人体22关键点标注数据
466人18,860张3D人体实例分割及人体22关键点数据。数据多样性包括多种场景、多种光照、多年龄段、多种拍摄角度、多姿态。 在标注方面,对人体进行实例分割标注,对人体进行22关键点标注。466人18,860张3D人体实例分割及人体22关键点数据可用于人体实例分割、人体行为识别等任务。
数据堂150



