awesome-llm-datasets
收藏资源简介:
这是一个精心策划的数据集资源合集,专注于收集和整理用于大型语言模型(LLMs)、人类反馈强化学习(RLHF)及相关资源的数据集。合集覆盖多个领域,包括预训练数据集、指令调优数据集、RLHF数据集、评估数据集等,并提供工具、预训练模型和研究论文的链接,旨在帮助研究人员和开发者从数据角度处理LLMs和RLHF。
This is a curated collection of dataset resources, dedicated to collecting and organizing datasets for large language models (LLMs) and reinforcement learning from human feedback (RLHF), alongside related resources. The collection spans multiple domains, including pre-training datasets, instruction-tuning datasets, RLHF datasets, evaluation datasets, and more. It also provides links to tools, pre-trained models and research papers, aiming to assist researchers and developers in addressing LLMs and RLHF from a data-centric perspective.
👩🤝🤖 Awesome LLM Datasets 数据集详情
概述
该仓库是一个专注于语言模型(LLM)和基于人类反馈的强化学习(RLHF)数据集的资源集合,收录了各类开放数据集、工具、预训练模型及研究论文,旨在从数据角度帮助研究人员和开发者开展工作。
数据集分类
1. 预训练数据集
2023年
- RedPajama Data
- 包含1.2万亿个Token的英文数据集
- 数据来源与规模:
数据源 Token数量 Commoncrawl 8780亿 C4 1750亿 GitHub 590亿 Books 260亿 ArXiv 280亿 Wikipedia 240亿 StackExchange 200亿 总计 1.2万亿 - 同时提供数据准备、去重、分词和可视化的代码
- 创建者:Ontocord.ai、MILA Québec AI Institute、ETH DS3Lab、Université de Montréal、Stanford Center for Research on Foundation Models (CRFM)、Stanford Hazy Research research group 和 LAION
2. 指令微调数据集
- 分类索引存在,具体内容待补充
3. RLHF与对齐数据集
- 分类索引存在,具体内容待补充
4. 评估数据集
- 分类索引存在,具体内容待补充
5. 其他用途数据集
- 分类索引存在,具体内容待补充
模型与其所用数据集
LLaMA
- 概述:Meta AI发布的一系列开源基础模型,参数量从7B到65B
- 许可协议:模型使用非商业定制许可,代码使用GPL-3.0
- 相关链接:
- 发布博客:https://ai.facebook.com/blog/large-language-model-llama-meta-ai/
- arXiv论文:https://arxiv.org/abs/2302.13971
- 模型卡片:https://github.com/facebookresearch/llama/blob/main/MODEL_CARD.md
Vicuna
- 概述:基于LLaMA微调的13B参数开源聊天机器人模型,训练数据为约7万条ChatGPT对话,性能达到ChatGPT的92%,超越LLaMA和Alpaca
- 许可协议:模型使用非商业定制许可,代码使用Apache 2.0
- 相关链接:
- 仓库:https://github.com/lm-sys/FastChat#vicuna-weights
- 发布博客:https://vicuna.lmsys.org/
- ShareGPT数据集:https://sharegpt.com/
- 模型(Hugging Face):https://huggingface.co/lmsys
- Gradio演示:https://chat.lmsys.org/
Dolly 2.0
- 概述:完全开源的12B参数指令跟随LLM,基于人工生成的指令数据集微调,数据集可用于研究和商业用途
- 许可协议:模型使用CC BY-SA 3.0,数据集使用CC BY-SA 3.0,代码使用Apache 2.0
- 相关链接:
- 仓库:https://github.com/databrickslabs/dolly
- 发布博客:https://www.databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm
- 模型(Hugging Face):https://huggingface.co/databricks
LLaVA
- 概述:多模态LLM,结合视觉编码器和Vicuna,具备类似GPT-4的通用视觉和语言理解能力
- 许可协议:模型使用非商业定制许可,数据集使用CC BY NC 4.0,代码使用Apache 2.0
- 相关链接:
- 仓库:https://github.com/haotian-liu/LLaVA
- 项目主页:https://llava-vl.github.io/
- arXiv论文:https://arxiv.org/abs/2304.08485
- 数据集与模型(Hugging Face):https://huggingface.co/liuhaotian
- Gradio演示:https://llava.hliu.cc/
StableLM
- 概述:一系列低参数量(3B、7B)LLM,基于The Pile构建的新数据集训练,含1.5万亿个Token内容
- 许可协议:模型使用CC BY-SA-4.0
- 相关链接:
- 仓库:https://github.com/stability-AI/stableLM/
- 发布博客:https://stability.ai/blog/stability-ai-launches-the-first-of-its-stablelm-suite-of-language-models
- 模型(Hugging Face):https://huggingface.co/stabilityai
- Gradio演示:https://huggingface.co/spaces/stabilityai/stablelm-tuned-alpha-chat
Alpaca
- 概述:基于LLaMA微调的部分开源指令跟随模型,规模更小、成本更低,性能与GPT-3.5相似
- 许可协议:模型使用非商业定制许可,数据集使用CC BY-NC 4.0,代码使用Apache 2.0
- 相关链接:
- 发布博客:https://crfm.stanford.edu/2023/03/13/alpaca.html
- 数据集(Hugging Face):https://huggingface.co/datasets/tatsu-lab/alpaca
其他资源
仓库还包含了工具与方法、研究论文的索引目录,具体内容等待后续补充。




