相关数据集
ChemCoTBench
ChemCoTBench是一个用于评估大型语言模型(LLM)在化学应用中的推理能力的基准数据集。它通过将复杂的化学任务分解为一系列可验证的模块化化学操作来评估LLM的推理能力。数据集包含1495个样本,涵盖了22个化学任务,包括分子理解、编辑、优化和反应预测。该数据集的创建旨在解决现有化学基准数据集缺乏推理和应用导向任务的局限性。
arXiv2025-05-27 更新600
LLMsForHepth/infer_hep-ph_gr-qc
该数据集基于LLMsForHepth/hep-ph_gr-qc_primary数据集,并添加了`prompt`和`y_true`列。多个模型以`prompt`列中的数据为输入生成文本,并将输出存储在`comp`或`preds`开头的列中。生成过程使用了特定的参数和模型配置。
Hugging Face2025-01-16 更新200
vtsrpkn/diamond-sharegpt
该数据集包含对话信息,每个对话由from和value两个字段组成,均为字符串类型。数据集仅包含一个训练集,共有3822个样本,总大小为2340224字节,下载大小为447463字节。数据文件路径为data/train-*。
Hugging Face2024-07-16 更新170
Readability tools and their interpretations.
Readability tools and their interpretations.
Figshare2019-06-20 更新320
open-llm-leaderboard-old/details_bigcode__starcoderbase-3b
--- pretty_name: Evaluation run of bigcode/starcoderbase-3b dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [bigcode/starcoderbase-3b](https://huggingface.co/bi
Hugging Face2024-02-14 更新200



