Qdrant/dbpedia-entities-openai3-text-embedding-3-large-1536-1M
收藏资源简介:
--- dataset_info: features: - name: _id dtype: string - name: title dtype: string - name: text dtype: string - name: text-embedding-3-large-1536-embedding sequence: float64 splits: - name: train num_bytes: 12679725776 num_examples: 1000000 download_size: 9551862565 dataset_size: 12679725776 configs: - config_name: default data_files: - split: train path: data/train-* license: mit task_categories: - feature-extraction language: - en size_categories: - 1M<n<10M --- 1M OpenAI Embeddings: text-embedding-3-large 1536 dimensions - Created: February 2024. - Text used for Embedding: title (string) + text (string) - Embedding Model: OpenAI text-embedding-3-large - This dataset was generated from the first 1M entries of https://huggingface.co/datasets/BeIR/dbpedia-entity, extracted by @KShivendu_ [here](https://huggingface.co/datasets/KShivendu/dbpedia-entities-openai-1M)
数据集信息: ## 特征字段 1. `_id`:字符串类型 2. `title`(标题):字符串类型 3. `text`(正文):字符串类型 4. `text-embedding-3-large-1536-embedding`:float64(双精度浮点数)序列 ## 数据拆分 - 训练集(train):占用字节数12679725776,样本量1000000 下载大小:9551862565 数据集总存储大小:12679725776 ## 数据集配置 - 默认配置(default):数据文件路径为`data/train-*`,对应训练集拆分 许可证:MIT许可证(mit) 任务类别:特征提取(feature-extraction) 语言:英语(en) 样本规模:100万 < 样本数 < 1000万(1M<n<10M) --- 100万条OpenAI嵌入数据集:text-embedding-3-large(1536维) - 创建时间:2024年2月 - 嵌入生成所用文本:`title`(标题)与`text`(正文)拼接 - 嵌入模型:OpenAI text-embedding-3-large - 本数据集源自https://huggingface.co/datasets/BeIR/dbpedia-entity的前100万条数据,由@KShivendu_ 于[此处](https://huggingface.co/datasets/KShivendu/dbpedia-entities-openai-1M)提取整理
数据集概述
数据集信息
- 特征列表:
_id: 类型为字符串title: 类型为字符串text: 类型为字符串text-embedding-3-large-1536-embedding: 类型为浮点数序列
- 数据分割:
train: 包含1,000,000个样本,总大小为12,679,725,776字节
- 下载大小: 9,551,862,565字节
- 数据集大小: 12,679,725,776字节
配置信息
- 配置名称: default
- 数据文件路径:
train:data/train-*
许可证
- MIT许可证
任务类别
- 特征提取
语言
- 英语
数据集大小类别
- 1M < n < 10M
创建时间
- 2024年2月
文本嵌入信息
- 文本来源:
title和text - 嵌入模型: OpenAI text-embedding-3-large
- 数据集来源: 从
BeIR/dbpedia-entity数据集的前1,000,000个条目生成




