Semantic Stress Test Dataset
收藏资源简介:
该数据集包含三元组:(基础文本,看起来相似,看起来不同),用于压力测试嵌入模型的语义理解能力。基础文本描述软件组件,看起来相似文本重用大部分词汇但含义完全不同,看起来不同文本使用完全不同的词汇和句式表达相同含义。优秀模型应识别语义相同而非词汇相似的文本对。
This dataset comprises triples structured as (base text, similar-appearing text, dissimilar-appearing text). The similar-appearing text reuses most of the vocabulary from the base text but carries a completely different semantic meaning, while the dissimilar-appearing text utilizes entirely different vocabulary and sentence structures to express the exact same meaning as the base text. This dataset is designed to stress-test the semantic understanding capabilities of embedding models: excellent models should recognize text pairs that share identical semantic meanings with the base text, rather than those that merely have similar lexical features but distinct semantics.
语义向量模型压力测试数据集概述
数据集基本信息
- 数据集名称:语义向量模型压力测试
- 核心用途:评估嵌入模型对文本全局语义的理解能力
- 测试原理:通过三元组结构验证模型是否能区分词汇相似性和语义相似性
数据集结构
三元组构成
- Base:软件组件描述文本
- Looks Similar(词汇陷阱):词汇和结构与Base高度相似但语义完全不同的句子
- Looks Different(语义双胞胎):词汇和结构完全不同但语义与Base完全一致的句子
评估方法
准确率计算
- 使用
measure_accuracy.py脚本计算模型准确率 - 判定标准:当Base与Looks Different的余弦相似度得分高于Base与Looks Similar的得分时记为正确
- 最终准确率:正确识别语义双胞胎的样本比例
数据集特性
生成方式
- 通过GPT-4基于生成提示自动合成
- 支持灵活扩展测试用例数量和复杂度
领域适应性
- 当前聚焦软件工程领域
- 可适配法律、医疗、金融等其他领域
应用价值
模型评估优势
- 采用相对比较方法,规避不同模型分数分布差异问题
- 提供公平的跨模型比较基准
模型优化潜力
- 支持生成无限量高质量三元组
- 可用于微调现有嵌入模型或训练新模型
使用说明
数据获取
- 通过Git LFS下载预生成数据集
运行流程
- 配置API密钥
- (可选)重新生成数据集
- 运行基准测试
- 测量模型准确率



