相关数据集
minishlab/my-vicinity-repo
该数据集使用vicinity库创建,包含一个有5个项目的向量空间。数据集的配置信息包括使用的模型为minishlab/potion-base-8M,后端类型为basic。
Hugging Face2025-03-02 更新190
minishlab/tokenlearn-cornstack-docs-coderankembed-v2
该数据集是使用Tokenlearn工具创建的,旨在为代码检索任务训练Model2Vec模型。它包含了由nomic-ai/CodeRankEmbed模型生成的均值token嵌入,这些嵌入作为静态嵌入蒸馏的训练目标。数据集来源于CornStack,覆盖了六种编程语言:Python、Java、PHP、Go、JavaScript和Ruby,每种语言提供100,000个代码文档,总计600,000行。每个数
Hugging Face2026-05-06 更新20
minishlab/tokenlearn-c4-en-bge-base-en-v1.5
--- language: en tags: - tokenlearn - embeddings - model2vec configs: - config_name: 10m data_files: - split: train path: 10m/train-* default: true --- # minishlab/tokenlearn-c4-en-bge-base
Hugging Face2026-03-27 更新10
minishlab/tokenlearn-c4-multilingual-bge-m3
--- dataset_info: - config_name: 10m features: - name: text dtype: string - name: embedding sequence: float32 splits: - name: train num_bytes: 0 num_examples: 9999954 - confi
Hugging Face2026-03-27 更新60
minishlab/tokenlearn-cornstack-queries-coderankembed-v2
该数据集由Tokenlearn创建,用于在代码检索任务上训练Model2Vec模型。它包含来自CornStack的代码文档,涵盖六种编程语言(Python、Java、PHP、Go、JavaScript、Ruby),每种语言有10万行数据,总计60万行。每个数据样本包括两个字段:text(截断的输入文本,最大标记长度为512)和embedding(由nomic-ai/CodeRankEmbed模型生
Hugging Face2026-05-06 更新10



