MemeCMD
收藏资源简介:
MemeCMD是一个自动生成的中文多轮对话数据集,它结合了大规模的、由多语言大型语言模型(MLLM)标注的Meme库和由双代理在多种场景下自动生成的对话。数据集包含6023张图像,每张图像都伴随着高质量的详细标注。数据集旨在解决现有对话数据集缺乏表达力和上下文细微差别的问题,通过引入Meme来增强对话的丰富性和自然性。
MemeCMD is an automatically generated Chinese multi-turn dialogue dataset that combines a large-scale Meme library annotated by multilingual large language models (MLLMs) and dialogues automatically generated by dual agents across various scenarios. The dataset contains 6023 images, each paired with high-quality detailed annotations. It aims to address the lack of expressiveness and contextual subtleties in existing dialogue datasets, and enhances the richness and naturalness of dialogues by introducing Memes.
MemeCMD数据集概述
数据集简介
- 名称:MemeCMD
- 类型:基于Python的智能表情包检索与匹配工具
- 功能:基于角色嵌入和相似性评分的表情包检索匹配
核心特征
- 角色嵌入处理
- 加权余弦相似度计算
- 前3相似表情包检索
- 相似度分布可视化
- 批处理支持
数据结构
. ├── find_figures.py # 索引到图像文件名的映射 ├── retrieve.py # 核心检索和相似度计算 ├── imgs/ # 图像目录 ├── Meme Warehouse/ # 包含表情包嵌入和图形 ├── Summary/ # 输出摘要 └── Dialogs/ # 对话数据
使用要求
- Python 3.x
- NumPy
- Matplotlib
- Seaborn
使用方法
-
在
roles-dialog-embedding目录准备角色嵌入 -
确保基础嵌入位于
Meme_Warehouse/embeddings.npy -
运行检索过程: bash python retrieve.py
-
将结果映射到实际图像文件: bash python find_figures.py
工作原理
- 计算角色嵌入和基础嵌入间的余弦相似度
- 对不同相似度组件应用权重
- 基于组合相似度分数检索前3匹配项
- 生成相似度分布可视化
- 将数字索引映射到实际图像文件
输出内容
- 包含前3索引和相似度分数的NPZ文件
- 索引到实际图像文件名的JSON映射文件
- 相似度分布图
- 详细处理日志
技术说明
- 使用加权评分系统(权重:0.3, -0.2, 0.2, 0.7)
- 实现批处理以高效处理大型数据集
- 所有嵌入在相似度计算前均经过标准化




