preference-agents-working/enron-cleaned
收藏资源简介:
--- dataset_info: features: - name: message_id dtype: string - name: from dtype: string - name: to dtype: string - name: date dtype: string - name: subject dtype: string - name: content dtype: string - name: email_context dtype: string - name: token_count_content dtype: int32 - name: token_count_context dtype: int32 - name: intent dtype: string - name: baseline struct: - name: google/gemma-1.1-2b-it dtype: string - name: google/gemma-1.1-7b-it dtype: string - name: meta-llama/Meta-Llama-3-70B-Instruct dtype: string - name: meta-llama/Meta-Llama-3-8B-Instruct dtype: string - name: mistralai/Mistral-7B-Instruct-v0.2 dtype: string - name: automatic_eval struct: - name: google/gemma-1.1-2b-it struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: google/gemma-1.1-7b-it struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: meta-llama/Meta-Llama-3-8B-Instruct struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 - name: mistralai/Mistral-7B-Instruct-v0.2 struct: - name: BERT Cosine Similarity dtype: float64 - name: BLEU Score dtype: float64 - name: ROUGE-L Score dtype: float64 - name: TF-IDF Cosine Similarity dtype: float64 splits: - name: train num_bytes: 95526649 num_examples: 20330 download_size: 51947088 dataset_size: 95526649 configs: - config_name: default data_files: - split: train path: data/train-* ---
dataset_info: 数据集基本信息 features: - 字段名称:message_id,数据类型:字符串(string) - 字段名称:from,数据类型:字符串 - 字段名称:to,数据类型:字符串 - 字段名称:date,数据类型:字符串 - 字段名称:subject,数据类型:字符串 - 字段名称:content,数据类型:字符串 - 字段名称:email_context,数据类型:字符串 - 字段名称:token_count_content,数据类型:32位整型(int32) - 字段名称:token_count_context,数据类型:32位整型 - 字段名称:intent,数据类型:字符串 - 字段名称:baseline:结构体类型,包含各基线大语言模型的输出结果,具体如下: - 模型名称:google/gemma-1.1-2b-it,数据类型:字符串 - 模型名称:google/gemma-1.1-7b-it,数据类型:字符串 - 模型名称:meta-llama/Meta-Llama-3-70B-Instruct,数据类型:字符串 - 模型名称:meta-llama/Meta-Llama-3-8B-Instruct,数据类型:字符串 - 模型名称:mistralai/Mistral-7B-Instruct-v0.2,数据类型:字符串 - 字段名称:automatic_eval:结构体类型,包含各基线模型的自动评估指标,具体如下: - 模型:google/gemma-1.1-2b-it,结构体包含以下评估指标: - BERT余弦相似度(BERT Cosine Similarity):64位浮点型(float64) - BLEU得分(BLEU Score):64位浮点型 - ROUGE-L得分(ROUGE-L Score):64位浮点型 - TF-IDF余弦相似度(TF-IDF Cosine Similarity):64位浮点型 - 模型:google/gemma-1.1-7b-it,结构体包含上述四项评估指标,数据类型均为64位浮点型 - 模型:meta-llama/Meta-Llama-3-8B-Instruct,结构体包含上述四项评估指标,数据类型均为64位浮点型 - 模型:mistralai/Mistral-7B-Instruct-v0.2,结构体包含上述四项评估指标,数据类型均为64位浮点型 splits: - 拆分名称:train,数据字节数:95526649,样本总量:20330 download_size: 51947088(下载大小) dataset_size: 95526649(数据集总大小) configs: - 配置名称:default,数据文件配置: - 对应拆分:train,文件路径:data/train-*
数据集概述
数据集特征
- message_id: 字符串类型
- from: 字符串类型
- to: 字符串类型
- date: 字符串类型
- subject: 字符串类型
- content: 字符串类型
- email_context: 字符串类型
- token_count_content: 整数类型(int32)
- token_count_context: 整数类型(int32)
- intent: 字符串类型
- baseline: 结构体类型,包含多个模型名称,如:
- google/gemma-1.1-2b-it
- google/gemma-1.1-7b-it
- meta-llama/Meta-Llama-3-70B-Instruct
- meta-llama/Meta-Llama-3-8B-Instruct
- mistralai/Mistral-7B-Instruct-v0.2
- automatic_eval: 结构体类型,包含多个模型的评估指标,如:
- BERT Cosine Similarity: 浮点数类型(float64)
- BLEU Score: 浮点数类型(float64)
- ROUGE-L Score: 浮点数类型(float64)
- TF-IDF Cosine Similarity: 浮点数类型(float64)
数据集分割
- train:
- 数据量: 95526649字节
- 示例数量: 20330
数据集大小
- 下载大小: 51947088字节
- 数据集大小: 95526649字节




