Supabase/dbpedia-openai-3-large-1M
收藏资源简介:
--- license: mit dataset_info: features: - name: _id dtype: string - name: title dtype: string - name: text dtype: string - name: embedding sequence: float32 splits: - name: train num_bytes: 17782586772 num_examples: 1000000 download_size: 17782586772 dataset_size: 1000000 language: - en pretty_name: OpenAI text-embedding-3-large with 1M DBPedia Entities size_categories: - 1M<n<10M --- 1 million OpenAI Embeddings - 3072 dimensions Created: February 2024. Text used for Embedding: title (string) + text (string) Embedding Model: text-embedding-3-large ## Credits: This dataset was generated from the first 1M entries of https://huggingface.co/datasets/BeIR/dbpedia-entity
许可证:MIT 数据集信息: 特征: - 名称:_id,数据类型:字符串 - 名称:标题,数据类型:字符串 - 名称:文本,数据类型:字符串 - 名称:嵌入向量(embedding),序列类型:32位单精度浮点数(float32) 数据集划分: - 名称:训练集,字节数:17782586772,样本数量:1000000 下载大小:17782586772 数据集总大小:1000000 语言: - 英语 友好名称:包含100万个DBpedia实体的OpenAI text-embedding-3-large嵌入数据集 规模分类:100万<样本数<1000万 100万个OpenAI嵌入向量,维度为3072 数据集创建于2024年2月。 用于生成嵌入向量的文本:标题与文本拼接 嵌入模型:text-embedding-3-large 致谢: 本数据集源自https://huggingface.co/datasets/BeIR/dbpedia-entity 的前100万条数据条目。
数据集概述
数据集信息
- 特征:
_id: 字符串类型title: 字符串类型text: 字符串类型embedding: 浮点数序列类型
- 分割:
train: 包含1,000,000个样本,总大小为17,782,586,772字节
- 下载大小: 17,782,586,772字节
- 数据集大小: 1,000,000个样本
- 语言: 英语
- 名称: OpenAI text-embedding-3-large with 1M DBPedia Entities
- 大小类别: 1M<n<10M
其他信息
- 创建日期: 2024年2月
- 用于嵌入的文本:
title(字符串) +text(字符串) - 嵌入模型: text-embedding-3-large
- 数据来源: 从https://huggingface.co/datasets/BeIR/dbpedia-entity的前1,000,000条记录生成




