GRATH数据集用于论文《GRATH: Gradual Self-Truthifying for Large Language Models》中的成对真实性训练数据。数据集包含由Llama2-7B、Llama2-13B和Zephyr-7B生成的三个子集,每个子集包含pretrained_gen和selftruth_gen两个分割。pretrained_gen分割包含由预训练基础模型生成的数据,用于
Recent advances in scaling large language models (LLMs) has resulted in significant improvements over a number of natural language processing benchmarks. There has been some work to pretrain these lan