tinyLLM-ee628
收藏资源简介:
该数据集是一个用于模型推理评估或训练的数据集,包含1000个训练样本。每个样本由多个字段构成:dataset(标识来源数据集)、prompt(输入提示)、gold_answer(标准答案)、gold_label(标准标签)、correct_rationale(正确的推理过程)和correct_rationale_model_id(生成正确推理的模型标识)。此外,每个样本还包含一个teacher_outputs列表,记录了多个不同模型对同一提示的生成结果,包括模型标识(model_id)、生成的答案(answer)、平均对数概率(avg_logprob)、答案是否正确(correct)、生成的推理过程(rationale)、答案长度(answer_len)、推理长度(rationale_len)和生成延迟(latency_ms)。该数据集适用于研究模型推理能力、答案生成质量、多模型比较等任务,支持对模型输出进行细粒度的性能分析。
This dataset is intended for model inference evaluation or training, containing 1,000 training samples. Each sample comprises multiple fields: dataset (identifies the source dataset), prompt (input prompt), gold_answer (standard answer), gold_label (standard label), correct_rationale (correct reasoning process), and correct_rationale_model_id (model identifier that generated the correct reasoning). Additionally, each sample includes a teacher_outputs list that records the generation outputs of multiple distinct models for the same prompt, covering model_id (model identifier), answer (generated answer), avg_logprob (average log probability), correct (whether the answer is correct), rationale (generated reasoning process), answer_len (answer length), rationale_len (reasoning length), and latency_ms (generation latency in milliseconds). This dataset is applicable to tasks such as researching model reasoning capabilities, answer generation quality, and multi-model comparison, and supports fine-grained performance analysis of model outputs.




