smbu123456/RealText-V2
收藏资源简介:
RealText-V2是一个大规模多语言文档伪造分析基准数据集,专为多语言文本图像伪造分析而设计,在规模和标注深度上均处于领先地位。该数据集包含20,000多张图像,覆盖6种语言(英语、中文、阿拉伯语、泰语、马来语和印尼语)和6个领域(金融、教育、医疗、直播、电商和自然场景)。数据集提供多粒度伪造(字符级、词级和语义级篡改)、多源样本(真实世界和AIGC合成的伪造样本)以及丰富的多任务标注(像素级定位掩码、篡改类型标签和专家级自然语言解释)。训练集包含13,500个样本,其中7,500个为伪造样本,6,000个为原始样本。数据集的标注格式包括结构化伪造分析报告,详细描述了伪造结论、风险评分、异常类型、位置、原因和总结。
RealText-V2 is a large-scale multilingual document benchmark dataset purpose-built for multilingual text image forgery analysis, pioneering in both scale and annotation depth. It features 20K+ images across 6 languages (English, Chinese, Arabic, Thai, Malay, and Indonesian) and 6 domains (finance, education, healthcare, live streaming, e-commerce, and natural scenes). The dataset includes multi-granularity forgery (character-level, word-level, and semantic-level tampering), multi-source samples (real-world and AIGC-synthesized forgery samples), and rich multi-task annotations (pixel-level localization masks, tampering type labels, and expert-level natural language explanations). The training set consists of 13,500 samples, with 7,500 forged and 6,000 pristine samples. The annotation format includes structured forgery analysis reports detailing forgery conclusions, risk scores, anomaly types, locations, reasons, and summaries.




