遇见数据集

akontra/simple-wiki-3teacher-distill-set

收藏
Hugging Face2026-03-23 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - en tags: - embeddings - sentence-transformers - distillation - representation-learning - wikipedia task_categories: - feature-extraction pretty_name: Simple Wiki Multi-Teacher Embedding Distillation size_categories: - 100K<n<1M configs: - config_name: default data_files: - split: train path: data/train-* dataset_info: features: - name: text dtype: string - name: teacher1_embedding list: float32 - name: teacher2_embedding list: float32 - name: teacher3_embedding list: float32 splits: - name: train num_bytes: 487822961 num_examples: 102225 download_size: 482476901 dataset_size: 487822961 --- # Simple Wiki Multi-Teacher Embedding Distillation Multi-teacher embedding distillation dataset built from the original text in [`sentence-transformers/simple-wiki`](https://huggingface.co/datasets/sentence-transformers/simple-wiki), using the `pair` config and keeping only the `text` column. Each sample contains the source text plus embeddings generated sequentially from three teacher models: 1. `avsolatorio/NoInstruct-small-Embedding-v0` 2. `Supabase/gte-small` 3. `avsolatorio/GIST-small-Embedding-v0` This setup is intended for **task-agnostic embedding distillation** across heterogeneous teacher spaces. - Texts may have been truncated to a fixed maximum sequence length during encoding ## Example ```python from datasets import load_dataset ds = load_dataset("YOUR_USERNAME/YOUR_DATASET_NAME") print(ds["train"][0].keys())

语言: - 英语 标签: - 嵌入(embeddings) - 句子转换器(sentence-transformers) - 知识蒸馏(distillation) - 表征学习(representation-learning) - 维基百科(Wikipedia) 任务类别: - 特征提取(feature-extraction) 美观名称:简易维基百科多教师嵌入蒸馏(Simple Wiki Multi-Teacher Embedding Distillation) 样本规模类别:10万 < 样本数 < 100万 配置项: - 配置名称:default 数据文件: - 拆分集:训练集(train) 路径:data/train-* 数据集信息: 特征: - 名称:文本(text) 数据类型:字符串(string) - 名称:教师1嵌入(teacher1_embedding) 类型:float32列表 - 名称:教师2嵌入(teacher2_embedding) 类型:float32列表 - 名称:教师3嵌入(teacher3_embedding) 类型:float32列表 拆分: - 名称:训练集(train) 字节数:487822961 样本数:102225 下载大小:482476901 数据集总大小:487822961 # 简易维基百科多教师嵌入蒸馏(Simple Wiki Multi-Teacher Embedding Distillation) 本数据集为多教师嵌入蒸馏(embedding distillation)数据集,基于 [`sentence-transformers/simple-wiki`](https://huggingface.co/datasets/sentence-transformers/simple-wiki) 中的原始文本构建,采用`pair`配置,仅保留`text`列。 每个样本包含源文本,以及依次由以下三个教师模型生成的嵌入(embeddings): 1. `avsolatorio/NoInstruct-small-Embedding-v0` 2. `Supabase/gte-small` 3. `avsolatorio/GIST-small-Embedding-v0` 该设计旨在实现跨异构教师空间的**任务无关嵌入蒸馏(task-agnostic embedding distillation)**。 - 编码过程中,文本可能已被截断至固定最大序列长度。 ## 示例 python from datasets import load_dataset ds = load_dataset("YOUR_USERNAME/YOUR_DATASET_NAME") print(ds["train"][0].keys())

提供机构:
akontra
二维码
社区交流群
二维码
科研交流群
商业服务