Awesome-NLP-LLM-Spanish-Espa-ol
收藏官方服务:
资源简介:
该合集是一个专注于西班牙语自然语言处理和大语言模型的资源集合,收录了多个西班牙语相关的数据集、模型、课程和其他资源,旨在为西班牙语NLP和LLM领域提供全面的资源索引和推荐。
This collection is a dedicated resource repository focused on Spanish natural language processing (NLP) and large language models (LLMs). It encompasses a variety of Spanish-related datasets, models, courses and other resources, with the goal of providing a comprehensive resource index and recommendations for the Spanish NLP and LLM communities.
创建时间:
2024-08-15
原始信息汇总
数据集详情总结:Awesome-NLP-LLM-Spanish-Español
该页面是一个西班牙语自然语言处理(NLP)与大型语言模型(LLM)资源集合,收录了与西班牙语相关的数据集、模型、工具和学习资源。
一、类似资源集合
- LLMs In Spanish:西班牙语LLM资源列表。
- Lacuna Fund:多种语言资源。
- SomosNLP:社区,包含大量西班牙语数据集和模型。
- PrevenIA:由西班牙卫生部支持,提供预防自杀工具、模型和数据集。
- SomosNLP 语料集:
- Corpus: Evaluation datasets for ES & LATAM:西班牙语及拉丁美洲变体LLM评估数据集。
- Corpus: Instructions in Spanish and related languages:西班牙语及相关语言指令/SFT数据集。
- Instruction-Tuned Models ES:西班牙语及相近语言指令微调模型集合。
二、西班牙语大型语言模型(LLM)
2.1 专用西班牙语模型
- LINCE ZERO:来自 clibrain,简单版西班牙语模型,另有需申请的FULL版本。
- Projecte AINA(加泰罗尼亚语及西班牙语):
- Flor 1.3B-Instructed
- Flor 6.3B
- Aguila 7B:基于Falcon7B。
- Salamandra(BSC-LT):
- salamandra-7b-instruct:7B,适合聊天和通用任务,性价比良好。
- salamandra-2b-instruct:2B轻量版。
- Salamandra-VL-7B-2512:多模态(视觉+文本)版本。
- IberianLLM(BSC开发,支持西班牙语、葡萄牙语、加泰罗尼亚语、巴斯克语、加利西亚语):
- Iberian-7B-instruct-v1:7B,面向聊天、翻译和通用任务。
- ALIA-40B:40B,西班牙首个公开模型,在35种欧洲语言上从零训练,Apache 2.0许可。
- LLM Latino:进行中项目,latamgpt.org,尚未发布模型。
2.2 多语言LLM(包含西班牙语)
- Meta / Facebook:Llama 2(7B/13B/70B)、CodeLlama(7B/13B/34B/70B)、Llama 3(8B/70B)、Llama 3.1(8B/70B/405B)、Llama 3.2(1B/3B/11B/90B,部分含视觉)、Llama 3.3(70B)。
- Mistral AI:Mistral 7B、Ministral 8B、Mixtral 8x7B、Mistral Large 123B、Mistral Nemo 12B、Mixtral 8x22B、Magistral-Small 24B(含推理)、Ministral 3B/8B。
- Microsoft:Phi 3.5 Mini/MoE/Vision、Phi 4 Mini(~4B)、Phi 4 Multimodal(~6B,支持文本/图像/音频)。
- Google:
- Gemma 3:1B(仅文本)、4B/12B/27B(多模态),支持140+语言,128K上下文。
- Gemma 4:E2B IT(~2.3B)、E4B IT(~4.5B)、26B A4B IT(MoE,26B总/4B激活)、31B IT,支持文本/图像/音频,Apache 2.0许可。
- DeepSeek:V4-Flash(284B总/13B激活)、V4-Pro(1.6T总/49B激活)、V3(671B MoE)、R1(687B MoE,主要中英文)、Distill Qwen 1.5B。
- Qwen3(阿里巴巴):0.6B至32B多种规模,MoE版30B-A3B、235B-A22B;Qwen Coder编程专用;Qwen 3.6(27B稠密、35B-A3B MoE,262K上下文,可扩展至1M)。
- Kimi:K2 Thinking(1T,多语言)。
- 其他:Molmo、EuroLLM(聚焦欧洲语言)、Apollo、Smol LM 3(Hugging Face 3B)。
三、西班牙语BERT、BART及Transformer模型
3.1 专用西班牙语编码器
- DCC Uchile(智利大学):
- BETO微调版:
- RigoBERTa 2.0:鲁棒BERT,适合NLU任务。
- mmBERT(JHU-CLSP):基于ModernBERT,1800+语言,8192上下文,small(140M)和base(307M)版本。
- MrBERT(BSC-LT):基于ModernBERT,8192上下文,有西班牙语专用版和多语言版(35语言)。
- EuroBERT:多语言欧洲BERT,支持西班牙语。
- Bertin Project:西班牙语BERT及GPT模型项目。
- Qwen3 Embeddings:生成[n_tokens × 1024]嵌入向量,目前无池化句子嵌入版本。
- Qwen3 Reranker:根据任务目标对查询-文档对打分。
3.2 句子相似度与语义搜索嵌入模型
- NV-Embed v1/v2:7B,基于Mistral,多任务,4096上下文。
- BETO句子相似度微调版:110M,512上下文。
- ModernBert嵌入微调版:149M,8192上下文。
- JinaAI v3:572M,多语言多任务,8192上下文。
- LaBSE:471M,多语言,平行句任务,256上下文。
- BGE-M3:多语言,8192上下文。
- Embedding Gemma 300:Google先进多语言模型。
- Qwen3 Embedding 0.6B:可作为SentenceTransformer使用。
- Paraphrase Multilingual MiniLM:118M,紧凑快速。
- Paraphrase Multilingual MPNet:多语言,质量优先。
- DistilUSE Multilingual v2:512维,速度优先。
四、命名实体识别(NER)
- Wikineural:多语言。
- xlm-roberta-large-ner-spanish:西班牙语高精度NER。
- PIIRANHA:4语言个人身份信息检测。
五、机器翻译
- nllb-200(Facebook):1.3B和3.3B版本及蒸馏版。
- Seamless M4T v2 Large(Facebook):支持音频转文本、文本转文本等。
- Helsinki Opus:英⇄西、西⇄英。
六、语音识别(ASR)
- Whisper v3 Large Turbo(OpenAI):含small/tiny及fast版。
- Canary(Nvidia):180M和1B版本,含Qwen基版。
- Parakeet(NVIDIA):多语言ASR,含Projecte Aina西班牙语微调版。
- MMS 1B(Facebook):1162语言训练。
- Seamless M4T v2 Large(Facebook):支持S2ST、S2TT、T2ST、T2TT、ASR。
- Phi4 Multimodal(Microsoft):多模态LLM,可转录音频。
- Voxtral(Mistral):3B Mini版和4B Realtime版,多语言音频理解/转录。
- VibeVoice ASR(Microsoft):低延迟语音识别。
七、文本转语音(TTS)
- MMS TTS(Facebook):西班牙语。
- Bark(Suno):多语言。
- Zonoz v0.1-Hybrid:1.65B,多语言。
- Kokoro 1.0:82M,8语言54种声音,含西班牙语。
- Qwen3 TTS CustomVoice:1.7B,支持个性化语音克隆。
- Fun CosyVoice3:0.5B,多语言自然合成。
- Chatterbox(ResembleAI):低延迟流式TTS。
- VibeVoice(Microsoft):0.5B实时版和1.5B高质量版。
- Fish S1 Mini:轻量多语言语音合成。
- Seamless M4T v2 Large(Facebook):支持S2ST、S2TT、T2ST、T2TT、ASR。



