相关数据集
argilla-warehouse/personahub-fineweb-edu-4-embeddings
该数据集通过使用Alibaba-NLP/gte-large-en-v1.5模型从句子转换器中获取了argilla-warehouse/personahub-fineweb-edu-4-dedup数据集的嵌入。数据集包含一个pipeline.yaml文件,可用于在distilabel中使用distilabel CLI重现生成数据集的管道。数据集的特征包括id、persona、model_name_e
Hugging Face2024-09-10 更新160
Dawnnn0429/MathInstruct-PoT-NumGLUE
该数据集包含三个字段:来源(source),指令(instruction)和输出(output),均为文本格式。数据集分为训练集和测试集两部分,其中训练集包含12126个示例,测试集包含1348个示例。数据集主要用于某种文本生成或处理任务,具体应用场景需结合字段内容和数据集划分进一步分析。
Hugging Face2025-11-12 更新100
line.10.9.10.10000
该数据集包含输入文本(input_text)和目标文本(target_text)两个字段,适用于研究文本生成任务。数据集分为训练集和验证集,其中训练集有10000个样本,验证集有1024个样本。数据集用于支持论文《Roll the dice & look before you leap: Going beyond the creative limits of next-token predicti
Hugging Face2025-05-27 更新90
open-llm-leaderboard-old/details_wei123602__FINETUNE3_TEST4
该数据集是在模型wei123602/FINETUNE3_TEST4的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集包含64个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于在Ope
Hugging Face2023-10-26 更新110
Dataset of five narratives split (1200 tokens) into events
This repository contains 5 textual narratives split into events by diffirent Large Language Models
DataCite Commons2024-07-08 更新90



