ISO Language Codes|语言代码数据集|国际化数据集
收藏数据集概述
数据来源
- 数据来源于Library of Congress作为ISO 639-2注册机构,以及Unicode Common Locale Data Repository。
数据文件
data/language-codes.csv
- 包含184种语言的ISO 639-1(alpha 2 / 两字母)代码及其英文名称。
data/language-codes-3b2.csv
- 包含184种语言的ISO 639-2(alpha 3 / 三字母)书目代码和ISO 639-1代码,以及它们的英文名称。
data/language-codes-full.csv
- 包含所有ISO 639-2(alpha 3 / 三字母)代码的语言,相应的ISO 639-1代码(如果有),以及每种语言的英文和法文名称。
- 存在两种三字母代码版本:书目和术语。每种语言都有一个书目代码,但只有少数语言有术语代码。术语代码设计为与相应的ISO 639-1两字母代码相似。
- 包含四个特殊代码:mul, und, mis, zxx;以及一个保留范围qaa-qtz。
data/ietf-language-tags.csv
- 列出所有IETF语言标签,这些标签来自http://www.iana.org/assignments/language-tag-extensions-registry,并被包含在http://www.unicode.org/Public/cldr/latest/core.zip的/main文件夹中。
许可证
- 本数据集根据Public Domain Dedication and License (PDDL)授权。
- 使用这些数据时,建议检查原始来源以确认任何特定限制。

烟火数据集
烟火数据集是一个专门用于烟火识别和检测任务的数据集,旨在帮助研究人员开发更加精确和高效的烟火识别算法。包含了大量真实场景下的烟火视频数据,具有广泛的应用前景和重要的研究价值。
阿里云天池 收录
CatMeows
该数据集包含440个声音样本,由21只属于两个品种(缅因州库恩猫和欧洲短毛猫)的猫在三种不同情境下发出的喵声组成。这些情境包括刷毛、在陌生环境中隔离和等待食物。每个声音文件都遵循特定的命名约定,包含猫的唯一ID、品种、性别、猫主人的唯一ID、录音场次和发声计数。此外,还有一个额外的zip文件,包含被排除的录音(非喵声)和未剪辑的连续发声序列。
huggingface 收录
CE-CSL
CE-CSL数据集是由哈尔滨工程大学智能科学与工程学院创建的中文连续手语数据集,旨在解决现有数据集在复杂环境下的局限性。该数据集包含5,988个从日常生活场景中收集的连续手语视频片段,涵盖超过70种不同的复杂背景,确保了数据集的代表性和泛化能力。数据集的创建过程严格遵循实际应用导向,通过收集大量真实场景下的手语视频材料,覆盖了广泛的情境变化和环境复杂性。CE-CSL数据集主要应用于连续手语识别领域,旨在提高手语识别技术在复杂环境中的准确性和效率,促进聋人与听人社区之间的无障碍沟通。
arXiv 收录
YOLO-dataset
该数据集用于训练YOLO模型,包括分类、检测和姿态识别模型。目前支持v8版本,未来计划支持更多版本。
github 收录
eming/stock_price_trunked_128_12
该数据集包含股票交易相关的详细信息,如交易日期、收盘价、不同周期的移动平均线(MA3, MA5, MA10, MA20, MA60)、MACD指标、股票代码、预测值及预测日期。数据集分为训练集,共有121379个样本,总大小为1126032983字节。
hugging_face 收录