WAON
收藏资源简介:
WAON是一个大规模、高质量的日语文本-图像对数据集,包含约1.55亿个示例,从Common Crawl收集。数据集构建流程采用了各种技术,包括过滤和去重,以提高数据质量。WAON旨在有效提升模型在日语文本和文化内容上的性能。数据集构建过程涉及从WARC文件中提取日文HTML文档,进行语言识别,提取图像和文本对,去重,下载图像,进行图像质量过滤,NSFW过滤,基于pHash的去重,以及基于SigLIP得分的过滤。数据集的构建旨在提高模型在日文文化内容上的性能,并为视觉语言模型的发展提供支持。
WAON is a large-scale, high-quality Japanese text-image pair dataset containing approximately 155 million examples collected from Common Crawl. The dataset construction pipeline adopts various techniques including filtering and deduplication to improve data quality. WAON aims to effectively enhance the performance of models on Japanese textual and cultural content. The dataset construction process involves extracting Japanese HTML documents from WARC files, conducting language identification, extracting image-text pairs, deduplication, downloading images, performing image quality filtering, NSFW filtering, pHash-based deduplication, and SigLIP score-based filtering. The dataset is designed to improve models' performance on Japanese cultural content and provide support for the development of vision-language models.
Lingua 语言检测库数据集概述
数据集基本信息
- 项目名称: Lingua
- 项目类型: 语言检测库
- 编程语言: Python(基于Rust实现)
- 版本: v2.1.1
- 许可证: Apache 2.0
- Python版本要求: >= 3.10
核心功能
- 检测文本的编写语言
- 支持单字、词组和句子的语言检测
- 结合规则引擎和统计方法(Naive Bayes)
- 完全离线使用,无需外部API或服务
技术特点
- 使用1到5字符的n-gram模型
- 集成规则引擎进行初步语言筛选
- 支持单线程和多线程模式
- 线程安全设计
支持语言
共支持75种语言,按字母顺序排列:
A
- 南非荷兰语、阿尔巴尼亚语、阿拉伯语、亚美尼亚语、阿塞拜疆语
B
- 巴斯克语、白俄罗斯语、孟加拉语、挪威博克马尔语、波斯尼亚语、保加利亚语
C
- 加泰罗尼亚语、中文、克罗地亚语、捷克语
D
- 丹麦语、荷兰语
E
- 英语、世界语、爱沙尼亚语
F
- 芬兰语、法语
G
- 干达语、格鲁吉亚语、德语、希腊语、古吉拉特语
H
- 希伯来语、印地语、匈牙利语
I
- 冰岛语、印度尼西亚语、爱尔兰语、意大利语
J
- 日语
K
- 哈萨克语、韩语
L
- 拉丁语、拉脱维亚语、立陶宛语
M
- 马其顿语、马来语、毛利语、马拉地语、蒙古语
N
- 新挪威语
P
- 波斯语、波兰语、葡萄牙语、旁遮普语
R
- 罗马尼亚语、俄语
S
- 塞尔维亚语、绍纳语、斯洛伐克语、斯洛文尼亚语、索马里语、索托语、西班牙语、斯瓦希里语、瑞典语
T
- 他加禄语、泰米尔语、泰卢固语、泰语、聪加语、茨瓦纳语、土耳其语
U
- 乌克兰语、乌尔都语
V
- 越南语
W
- 威尔士语
X
- 科萨语
Y
- 约鲁巴语
Z
- 祖鲁语
性能表现
检测精度
- 基于Wortschatz语料库进行训练和测试
- 测试数据包含单字、词组和句子
- 与其他检测器(Langdetect、Langid、Simplemma、CLD 2、CLD 3)进行比较
检测速度
在iMac 3.6 Ghz 8-Core Intel Core i9上的表现:
| 检测器 | 时间 |
|---|---|
| Lingua(低精度模式,多线程) | 3.00秒 |
| Lingua(高精度模式,多线程) | 7.97秒 |
| CLD 2 | 8.65秒 |
| CLD 3 | 16.77秒 |
| Lingua(低精度模式,单线程) | 20.46秒 |
| Lingua(高精度模式,单线程) | 51.88秒 |
安装方式
bash pip install lingua-language-detector
使用方法
python from lingua import Language, LanguageDetectorBuilder
languages = [Language.ENGLISH, Language.FRENCH, Language.GERMAN, Language.SPANISH] detector = LanguageDetectorBuilder.from_languages(*languages).build() language = detector.detect_language_of("languages are awesome")
内存占用
- 内存消耗小于1GB
- 语言模型共享,多实例不重复加载
测试报告
可通过脚本生成详细的精度测试报告: bash poetry run python3 scripts/accuracy_reporter.py
测试报告包含每种语言的检测精度统计和错误分类详情。




