遇见数据集

search-v3-embeddings

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Hub Card Search Embeddings (v3) 是一个专为语义搜索设计的数据集,包含Hugging Face Hub上1,173,030个公开数据集和模型卡片(536,870个数据集,636,160个模型)的机器生成单句摘要及其对应的1024维嵌入向量。该数据集源自每日更新的公共卡片转储(librarian-bots/dataset_cards_with_metadata和librarian-bots/model_cards_with_metadata),并过滤了无内容或内容极少的卡片。摘要由davanstrien/hub-tldr-v3-lfm25-350m模型生成,嵌入向量由Qwen/Qwen3-Embedding-0.6B模型计算,存储为fp16格式。数据集提供两个配置(datasets和models),包含id、摘要文本、嵌入向量、元数据(如点赞数、下载量、最后修改时间、任务类型、许可证、语言)、摘要来源(model/template/none)、置信度标记(low_confidence)和质量标志(flags)等字段,其中模型配置额外包含参数字段(param_count)。该数据集主要用作Hugging Face Hub语义搜索后端的基础索引,支持通过摘要嵌入进行高效检索,并提供了256维Matryoshka截断视图以优化存储和查询性能。需要注意的是,部分摘要可能因卡片内容稀疏而存在机器生成的误差,且617行数据的嵌入向量为null,构建索引前需过滤。

Hub Card Search Embeddings (v3) is a dataset specifically designed for semantic search, containing machine-generated single-sentence summaries and their corresponding 1024-dimensional embedding vectors for 1,173,030 public dataset and model cards (536,870 datasets, 636,160 models) on the Hugging Face Hub. The dataset is derived from daily updated public card dumps (librarian-bots/dataset_cards_with_metadata and librarian-bots/model_cards_with_metadata), with cards that have no content or minimal content filtered out. Summaries are generated by the davanstrien/hub-tldr-v3-lfm25-350m model, and embedding vectors are computed by the Qwen/Qwen3-Embedding-0.6B model, stored in fp16 format. The dataset provides two configurations (datasets and models), including fields such as id, summary text, embedding vector, metadata (e.g., likes, downloads, last modified time, task type, license, language), summary source (model/template/none), confidence marker (low_confidence), and quality flags (flags), with the model configuration additionally including a parameter field (param_count). This dataset is primarily used as the underlying index for the Hugging Face Hub semantic search backend, enabling efficient retrieval via summary embeddings, and offers a 256-dimensional Matryoshka truncated view to optimize storage and query performance. It should be noted that some summaries may contain machine-generated errors due to sparse card content, and 617 rows have null embedding vectors, which must be filtered before building the index.

创建时间:
2026-07-18
原始信息汇总

数据集概述:Hub Card Search Embeddings (v3)

该数据集是 Hugging Face Hub 上 1,173,030 个数据集和模型卡片(536,870 个数据集 + 636,160 个模型)的单句摘要及其对应的 1024 维嵌入向量。它是 librarian-bots/huggingface-semantic-search 空间后端所使用的语义搜索索引。

数据来源与筛选

构建流程

  1. 生成摘要:使用 davanstrien/hub-tldr-v3-lfm25-350m(一个 3.5 亿参数的 LFM2.5 微调模型,通过 vLLM 服务,temperature=0.3, max_tokens=120),为每张符合条件的卡片生成一句话摘要。
  2. 生成嵌入:使用 Qwen/Qwen3-Embedding-0.6B 模型对上述摘要进行嵌入,存储为 fp16 格式、完整 1024 维的向量。

摘要质量与置信度

摘要由机器生成,主要用于检索,不适合直接引用。

  • 来源分布
    • model:模型生成(数据集 84.8%,模型 82.6%)。
    • template:模板生成(数据集 15.1%,模型 17.4%),用于卡片内容过薄无法摘要的情况。
    • none:模型返回“信息不足”(数据集 0.1%,模型 0.0%),摘要和嵌入均为 null。
  • 置信度low_confidence 列为 True 的数据占数据集 16.0%,模型 22.4%。包含所有模板行、拒绝行以及再生后仍未能通过筛查的模型摘要。
  • 注意事项:对于内容单薄或自动生成的卡片,模型可能虚构准确但实际错误的细节。flags 列记录了具体的筛查或拒绝原因。

数据集配置与结构

数据集包含两个配置:datasetsmodels,除 param_count 列外列结构相同。

列说明

列名 类型 说明
id string 仓库 ID
summary string 一句话摘要;对于拒绝样本为 null
embedding list<float16>[1024] 嵌入向量;对于拒绝样本为 null;支持截断至 256 维以用于 Matryoshka Representation Learning (MRL) 视图
likes int64 源元数据(点赞数)
downloads int64 源元数据(下载量)
last_modified string 源元数据(最后修改时间)
task string 模型为 pipeline_tag,数据集为 task_categories 标签;可为 null
license string 来自 license 标签;可为 null
language string 来自 language 标签,逗号连接;可为 null
summary_source string 摘要来源:model, template, 或 none
low_confidence bool 低置信度标志
flags list<string> 筛查/门控原因列表
param_count int64 仅模型配置;来自 safetensors.total;不存在时为 null

关键处理建议

  • 空嵌入处理:共有 617 行(581 个数据集 + 36 个模型)嵌入向量为 null(拒绝样本)。在构建向量索引前必须过滤 embedding IS NOT NULL
  • MRL 截断使用:Qwen3-Embedding 支持 Matryoshka 截断,可仅使用前 256 维以降低存储和查询成本,同时保留大部分排名准确性。后端索引即使用 256 维视图。

许可与致谢

  • 许可:数据集使用 other 许可证。
  • 语言:英语。
  • 任务类别:特征提取、句子相似度。
  • 致谢:由 Hugging Face 的 Daniel van Strien 构建。原始卡片来自 librarian-bots 转储,由各仓库作者编写;摘要由 hub-tldr-v3-lfm25-350m 生成,嵌入由 Qwen/Qwen3-Embedding-0.6B 生成。此数据集不改变或取代原始卡片的许可证。
搜集汇总
数据集介绍
search-v3-embeddings 数据集图片
构建方式
本数据集依托Hugging Face Hub上每日刷新的公开卡片转储,从librarian-bots/dataset_cards_with_metadata与librarian-bots/model_cards_with_metadata中筛选出内容非空且字节数介于200至100,000之间的有效卡片。每张卡片首先经由davanstrien/hub-tldr-v3-lfm25-350m模型(350M参数,基于LFM2.5微调,温度参数0.3,最大生成长度120 token)归纳为一句摘要,随后利用Qwen/Qwen3-Embedding-0.6B模型将摘要编码为1024维的fp16浮点向量。整个流程以4×L4分片在vLLM服务器模式下并行运行,并使用追加式parquet分片存储,通过反连接机制避免因分片故障导致数据重复,确保构建过程的高效与鲁棒。
特点
该数据集覆盖536,870个数据集与636,160个模型卡片,共计1,173,030条记录,是Hugging Face Hub上规模最大的语义搜索索引之一。其核心创新在于对卡片摘要而非原始文本进行检索与嵌入,大幅降低了计算开销。摘要质量经多维度筛选:模型生成的摘要占绝大多数(数据集84.8%,模型82.6%),对于内容过于单薄的卡片则使用确定性模板替代,极少数拒绝生成的情况保留为空值。约16.0%的数据集条目与22.4%的模型条目被标记为低置信度(low_confidence),用户可根据精度需求灵活过滤。此外,嵌入向量支持Matryoshka截断,256维视图即可保持大部分排序质量,显著节约存储与查询成本。
使用方法
用户可通过Polars或NumPy库便捷加载parquet格式数据。例如,使用pl.read_parquet('hf://datasets/davanstrien/search-v3-embeddings/datasets/part-*.parquet')读取指定配置,并通过filter(pl.col('embedding').is_not_null())剔除拒绝生成的行。随后将嵌入列转为NumPy数组(形状为N×1024),若需使用Matryoshka视图,可取前256维并重新归一化。对于高精度检索场景,建议过滤掉low_confidence为True的条目;若更注重覆盖广度,则可保留这些记录并谨慎对待其摘要。构建向量索引前务必确保embedding字段非空,以免空值影响检索效果。
背景与挑战
背景概述
search-v3-embeddings数据集由Hugging Face机器学习馆员Daniel van Strien于2024年构建,旨在为Hugging Face Hub上逾百万张数据集与模型卡片提供语义搜索能力。该数据集通过微调后的350M参数语言模型将每张卡片压缩为单句摘要,并利用Qwen3-Embedding-0.6B模型生成1024维嵌入向量,最终覆盖536,870个数据集与636,160个模型卡片。作为Hub Card语义搜索后端的基础索引,它解决了大规模资源库中基于原始卡片文本检索效率低下的问题,通过摘要嵌入替代完整卡片处理,显著降低了计算成本与延迟,推动了Hugging Face生态中资源发现的智能化进程。
当前挑战
该数据集面临的核心挑战源于摘要生成与检索质量的平衡。首先,机器生成的摘要存在幻觉风险,模型可能在卡片内容贫乏时捏造看似可信的具体细节,例如将库名称误读为任务类型。其次,摘要质量的不可靠性导致16.0%的数据集卡片与22.4%的模型卡片被标记为低置信度,这些行若直接用于检索可能污染索引结果。构建过程中,为应对薄卡片或自动生成卡片,团队设计了模板生成与拒绝检测的级联策略,但边界卡片仍会漏过筛查,需通过多轮重生成与标志列记录来补救,同时要求用户在构建向量索引前过滤空嵌入行以避免干扰排名。
常用场景
经典使用场景
search-v3-embeddings数据集的核心应用在于为Hugging Face Hub上的海量模型与数据集卡片提供语义检索的基石。通过将原始卡片内容浓缩为一句话摘要,并利用Qwen3-Embedding-0.6B模型生成1024维的稠密向量,该数据集构建了一个轻量且高效的搜索索引。其经典使用方式是将用户查询嵌入后,与这些预计算的摘要向量进行余弦相似度比对,从而快速定位最相关的卡片。这种设计避免了直接对冗长的原始卡片进行实时推理,极大地降低了检索延迟与计算成本,为社区提供了一个便捷的即用型语义搜索基础设施。
解决学术问题
在学术研究领域,该数据集有效应对了机器学习社区中资源发现与组织管理的两大核心挑战:一是如何从海量、非结构化的仓库卡片中提取可检索的语义信息;二是如何在不依赖人工标注的前提下,构建一个可扩展且覆盖面广的检索基准。通过引入机器生成摘要与Matryoshka表示学习(MRL)技术,该数据集为低资源下的高效语义搜索提供了验证平台。它尤其适用于研究摘要生成质量对检索性能的影响、小模型嵌入的评价,以及向量量化与降维在真实大规模索引中的鲁棒性。
衍生相关工作
该数据集衍生了一系列重要的相关工作。首先,其使用的机器摘要模型hub-tldr-v3-lfm25-350m成为了连接原始卡片与语义嵌入的关键桥梁,推动了针对技术文档的小型语言模型微调研究。其次,基于数据集中的flags与low_confidence字段,研究者可深入分析机器摘要的幻觉与失败模式,从而开发更可靠的生成后校验机制。此外,Qwen3-Embedding模型的Matryoshka表示在该数据集中得到实证,为多粒度检索效率的研究提供了现实基准。最后,该数据集的构建管线(含反连接去重与增量更新策略)本身也成为可复用的工程范式,启发了类似Hub级索引的设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务