遇见数据集

preference-agents-working/enron-cleaned

收藏
Hugging Face2024-04-25 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: message_id dtype: string - name: from dtype: string - name: to dtype: string - name: date dtype: string - name: subject dtype: string - name: content dtype: string - name: email_context dtype: string - name: token_count_content dtype: int32 - name: token_count_context dtype: int32 - name: intent dtype: string - name: baseline struct: - name: google/gemma-1.1-2b-it dtype: string - name: google/gemma-1.1-7b-it dtype: string - name: meta-llama/Meta-Llama-3-70B-Instruct dtype: string - name: meta-llama/Meta-Llama-3-8B-Instruct dtype: string - name: mistralai/Mistral-7B-Instruct-v0.2 dtype: string - name: automatic_eval struct: - name: google/gemma-1.1-2b-it struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: google/gemma-1.1-7b-it struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: meta-llama/Meta-Llama-3-8B-Instruct struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: mistralai/Mistral-7B-Instruct-v0.2 struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 splits: - name: train num_bytes: 95526649 num_examples: 20330 download_size: 51947088 dataset_size: 95526649 configs: - config_name: default data_files: - split: train path: data/train-* ---

dataset_info: 数据集基本信息 features: - 字段名称:message_id,数据类型:字符串(string) - 字段名称:from,数据类型:字符串 - 字段名称:to,数据类型:字符串 - 字段名称:date,数据类型:字符串 - 字段名称:subject,数据类型:字符串 - 字段名称:content,数据类型:字符串 - 字段名称:email_context,数据类型:字符串 - 字段名称:token_count_content,数据类型:32位整型(int32) - 字段名称:token_count_context,数据类型:32位整型 - 字段名称:intent,数据类型:字符串 - 字段名称:baseline:结构体类型,包含各基线大语言模型的输出结果,具体如下: - 模型名称:google/gemma-1.1-2b-it,数据类型:字符串 - 模型名称:google/gemma-1.1-7b-it,数据类型:字符串 - 模型名称:meta-llama/Meta-Llama-3-70B-Instruct,数据类型:字符串 - 模型名称:meta-llama/Meta-Llama-3-8B-Instruct,数据类型:字符串 - 模型名称:mistralai/Mistral-7B-Instruct-v0.2,数据类型:字符串 - 字段名称:automatic_eval:结构体类型,包含各基线模型的自动评估指标,具体如下: - 模型:google/gemma-1.1-2b-it,结构体包含以下评估指标: - BERT余弦相似度(BERT Cosine Similarity):64位浮点型(float64) - BLEU得分(BLEU Score):64位浮点型 - ROUGE-L得分(ROUGE-L Score):64位浮点型 - TF-IDF余弦相似度(TF-IDF Cosine Similarity):64位浮点型 - 模型:google/gemma-1.1-7b-it,结构体包含上述四项评估指标,数据类型均为64位浮点型 - 模型:meta-llama/Meta-Llama-3-8B-Instruct,结构体包含上述四项评估指标,数据类型均为64位浮点型 - 模型:mistralai/Mistral-7B-Instruct-v0.2,结构体包含上述四项评估指标,数据类型均为64位浮点型 splits: - 拆分名称:train,数据字节数:95526649,样本总量:20330 download_size: 51947088(下载大小) dataset_size: 95526649(数据集总大小) configs: - 配置名称:default,数据文件配置: - 对应拆分:train,文件路径:data/train-*

原始信息汇总

数据集概述

数据集特征

  • message_id: 字符串类型
  • from: 字符串类型
  • to: 字符串类型
  • date: 字符串类型
  • subject: 字符串类型
  • content: 字符串类型
  • email_context: 字符串类型
  • token_count_content: 整数类型(int32)
  • token_count_context: 整数类型(int32)
  • intent: 字符串类型
  • baseline: 结构体类型,包含多个模型名称,如:
    • google/gemma-1.1-2b-it
    • google/gemma-1.1-7b-it
    • meta-llama/Meta-Llama-3-70B-Instruct
    • meta-llama/Meta-Llama-3-8B-Instruct
    • mistralai/Mistral-7B-Instruct-v0.2
  • automatic_eval: 结构体类型,包含多个模型的评估指标,如:
    • BERT Cosine Similarity: 浮点数类型(float64)
    • BLEU Score: 浮点数类型(float64)
    • ROUGE-L Score: 浮点数类型(float64)
    • TF-IDF Cosine Similarity: 浮点数类型(float64)

数据集分割

  • train:
    • 数据量: 95526649字节
    • 示例数量: 20330

数据集大小

  • 下载大小: 51947088字节
  • 数据集大小: 95526649字节
搜集汇总
数据集介绍
preference-agents-working/enron-cleaned 数据集图片
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务