NLP预训练/指令微调数据集
收藏资源简介:
本项目提供的中文基础模型和对话模型,如Chinese-LLaMA和Chinese-Falcon,以及Linly-ChatFlow,都是基于特定的预训练和指令微调数据集进行训练的。这些数据集包括中文和中英平行语料,用于扩展模型的语言能力到中文,并进行大规模指令跟随训练。
This project provides foundational and conversational models in Chinese, such as Chinese-LLaMA and Chinese-Falcon, along with Linly-ChatFlow, all of which are trained on specific pre-training and instruction fine-tuning datasets. These datasets include Chinese and Chinese-English parallel corpora, aimed at extending the models' linguistic capabilities to Chinese and conducting large-scale instruction-following training.
数据集概述
数据集名称
中文 LLaMA1-2 & Linly-OpenLLaMA & Falcon 大模型
数据集内容
本项目向社区提供以下内容:
- 中文对话模型 Linly-ChatFlow
- 中文基础模型 Chinese-LLaMA (1-2)、Chinese-Falcon
- 训练数据
模型性能指标
与APUS联合训练的Linly-70B模型性能指标如下:
| 指标 | 值 |
|---|---|
| ARC | 54.69 |
| HellaSwag | 76.94 |
| MMLU | 60.4 |
| Truthful QA | 53.54 |
| Winogrande | 73.4 |
| GSM8K | 34.12 |
| C-Eval | 80.6 |
模型训练
中文基础模型以 LLaMA 和 Falcon 为底座,使用中文和中英平行语料进行增量预训练。项目还汇总了多语言指令数据,对中文模型进行大规模指令跟随训练,实现了 Linly-ChatFlow 对话模型。
开源模型
项目开源了从头训练的 Linly-OpenLLaMA 模型,包含 3B、7B、13B 规模,在 1TB 中英文语料上进行预训练,以 Apache 2.0 协议公开。
项目内容
- 通过 Full-tuning 获得中文 LLaMA、Falcon 等模型,提供 TencentPretrain 与 HuggingFace 版本
- 模型细节公开可复现,提供数据准备、模型训练和模型评估完整流程代码
- 多种量化方案,支持 CUDA 和边缘设备部署推理
模型下载
- Linly-Chinese-LLaMA-2: 使用 LLaMA2 扩充中文词表,在混合语料上进行增量预训练。
- Linly-Chinese-Falcon: 在 Falcon 基础上扩充中文词表,在中英文数据上增量预训练。
- Linly-Chinese-LLaMA: 基于 LLaMA 权重和词表,在中文数据上增量预训练。
- Linly-OpenLLaMA: 在大规模中英文语料上从头训练词表和模型参数。
生成示例
展示 Linly-Chinese-LLaMA-2 模型效果,包括信息提取、代码生成和知识问答。
在线试用
在线 demo 可在 Linly-ChatFlow 体验。
模型使用
介绍 TencentPretrain 格式模型权重的使用方法,包括解码参数和详细使用说明。
模型训练细节
模型基于 TencentPretrain 预训练和指令精调,详细信息参见相关链接。
新闻
- [2024/2/4] 发布与 APUS 联合训练的 Chinese-LLaMA-2 (70B) 模型。
- [2023/7/22] 发布 Chinese-LLaMA-2 (7B、13B) 模型。
- [2023/6/14] 发布中文 Falcon-7B 基础模型。
- [2023/5/31] Linly-ChatFlow-7B 对话模型参与 SuperCLUE-琅琊榜排名。




