遇见数据集

BUT-FIT/FLiP-data

收藏
Hugging Face2026-06-29 更新2026-05-10 收录
官方服务:

资源简介:

FLiP-data 是FLiP项目的预处理数据集,用于通过因子化线性投影解释多模态多语言句子嵌入。该数据集基于Mozilla Common Voice v15英语数据,包含SONAR语音嵌入、文本嵌入、语音与文本嵌入之间的余弦相似度分数、参考转录文本以及使用Gemini 2.5 Flash Lite提取的命名实体。数据分为训练集(约100万条语句)、开发集(约1.6万条)和测试集(约1.6万条)。嵌入使用SONAR编码器从Common Voice音频和转录计算,源数据遵循CC BY 4.0许可。数据集支持句子相似性和特征提取任务,旨在促进多模态嵌入的可解释性研究。

FLiP-data is a preprocessed dataset for the FLiP project, which focuses on interpreting multimodal multilingual sentence embeddings via factorized linear projection. It includes SONAR speech embeddings, text embeddings, cosine similarity scores between paired speech and text embeddings, reference transcripts, and named entities extracted with Gemini 2.5 Flash Lite, all based on Mozilla Common Voice v15 English data. The dataset is split into train (~1M utterances), dev (~16k), and test (~16k) sets. Embeddings are computed using the SONAR encoder from Common Voice audio and transcripts, with source data licensed under CC BY 4.0. It is designed for tasks such as sentence similarity and feature extraction to advance interpretability research in multimodal embeddings.

提供机构:
BUT-FIT
搜集汇总
数据集介绍
BUT-FIT/FLiP-data 数据集图片
构建方式
该数据集是为FLiP(Factorized Linear Projection)项目构建的预处理数据,旨在通过单一的线性投影从预训练的多模态多语言句子嵌入中恢复词汇内容。其数据源于Mozilla Common Voice v15英文语料库,利用SONAR编码器提取语音与文本嵌入,分别存储为N×1024维的浮点型矩阵。数据集还提供了配对嵌入间的余弦相似度、参考转录文本以及通过Gemini 2.5 Flash Lite提取的命名实体,整体划分为约100万条训练样本和各约1.6万条开发与测试样本。
特点
FLiP-data的独特之处在于其多模态对齐特性,同时囊括了SONAR语音与文本嵌入,便于直接比较两者在语义空间中的表征。数据集附带的余弦相似度分数可用于评估嵌入一致性,而命名实体标注则支持可解释性研究。其规模适中且划分明确,非常适合训练与评估线性投影模型,且无需对编码器进行微调,有效降低了计算成本。
使用方法
使用者可通过NumPy库轻松加载数据,例如使用np.load函数读取语音或文本嵌入文件,并参考配套的转录文本与实体进行训练或分析。完整的模型训练与评估脚本已开源在FLiP GitHub仓库中,用户下载数据后可直接运行相关代码。推荐的预训练检查点已上传至HuggingFace,支持秩为512或1024的矩阵因子化,便于快速重现论文实验或应用于下游可解释性任务。
背景与挑战
背景概述
FLiP-data数据集由捷克布尔诺理工大学(BUT)语音处理研究团队于2026年创建,旨在为多模态多语言句子嵌入的可解释性研究提供基础资源。该数据集基于Mozilla Common Voice v15英文语料,利用SONAR编码器提取了约100万条语音和文本嵌入向量,并配套提供了余弦相似度分数、人工转录文本及由大语言模型提取的命名实体标签。FLiP-data的核心研究问题在于探究预训练句子嵌入中的词汇语义信息是否可通过线性投影恢复,从而推动对多模态嵌入表征的理解。该数据集为因子化线性投影模型(FLiP)的训练和评估提供了标准化基准,对语音与文本联合表示学习、嵌入可解释性及多语言模型分析领域产生了积极影响。
当前挑战
FLiP-data面临的挑战主要体现在两个层面。在领域问题层面,该数据集致力于解决多模态句子嵌入中隐含的词汇信息难以直接解释的难题,传统方法往往依赖复杂的解码模型或黑箱分析,而FLiP试图通过简单的线性投影实现语义恢复,这对嵌入空间的线性可分离性与多模态对齐质量提出了极高要求。在构建过程中,数据集的制作需协调大规模语音数据处理与嵌入提取的算力开销,确保Common Voice语料中噪声环境、口音差异及转录错误对标注质量的干扰被有效控制,此外,命名实体抽取依赖大语言模型,其准确性与一致性也是需要谨慎处理的挑战。
常用场景
经典使用场景
FLiP-data数据集的核心使用场景在于探究多模态多语言句子嵌入的可解释性。研究者通过该数据集提供的SONAR语音与文本嵌入对,训练一个因子化对数线性模型,以单一线性投影的方式从预训练嵌入中恢复词汇层面的关键信息。这种无需对编码器进行微调即可实现语义解耦的方法,为理解多模态表示的内部结构开辟了新路径。数据集包含约一百万条Mozilla Common Voice英语话语的成对嵌入,并提供了命名实体标注,使其成为分析多模态嵌入中词汇与语义对齐关系的理想基准。
解决学术问题
该数据集旨在解决多模态句子嵌入普遍缺乏可解释性的学术难题。传统方法往往将嵌入视为不透明的语义向量,难以回答'哪些词汇信息被嵌入表征所保留'这一核心问题。FLiP-data通过提供线性投影框架下的词汇恢复任务,从实证层面揭示了多模态嵌入中词汇内容的编码方式。这一工作推动了可解释性研究从关注单一模态向跨模态方向拓展,其意义在于建立了一种无需昂贵标注即可评估嵌入质量的新范式,为未来设计更透明、更可控的表示学习模型奠定了方法论基础。
衍生相关工作
FLiP-data衍生了一系列关于多模态嵌入可解释性的开创性工作。最直接的后续研究是FLiP模型本身,一种因子化线性投影方法,在无需微调编码器的情况下从嵌入中恢复词汇信息。此外,该数据集的发布促成了对SONAR等大规模多模态编码器的系统性诊断,衍生出关于嵌入维度压缩与语义保留之间关系的研究。相关研究还探索了将因子化分解应用于跨语言嵌入的对比分析,以及利用线性探测技术评估不同模态编码器质量的标准化路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务