EvoTrain-180K
收藏资源简介:
发布的EvoTrain-180K数据集采用直观的聊天式微调格式,专为联合SFT(监督微调)和检索优化而设计。每个训练实例都是一个自包含的上下文窗口,结构包括messages(标准交替用户/助手轮次,代表SFT生成目标)、meta.turns(格式化轮次级字符串,模拟动态上下文流处理)和meta.evidence_turns(指向包含真实证据的特定历史轮次的零基索引,作为对比损失的正目标)。
The released EvoTrain-180K dataset adopts an intuitive chat-based fine-tuning format, which is specifically designed for joint SFT (supervised fine-tuning) and retrieval optimization. Each training instance is a self-contained context window, whose structure includes messages (standard alternating user/assistant turns representing the generation targets for SFT), meta.turns (formatted turn-level strings that simulate dynamic context stream processing), and meta.evidence_turns (zero-based indices pointing to specific historical turns containing real evidence, serving as positive targets for contrastive loss).
数据集概述
项目名称:EvoEmbedding
发布机构:MiG-NJU
核心概念:通过“原生记忆 + 隐式嵌入”(Native Memory + Latent Embedding)生成可演化的上下文感知文本表示,专为长上下文检索设计。
数据集:EvoTrain-180K
- 规模与用途:包含约 180K 训练样本,采用对话式微调格式(chat-style),适用于联合监督微调(SFT)与检索优化。
- 数据格式:每个训练实例为一个自包含的上下文窗口,包含以下关键字段:
messages:标准的用户/助手交替对话,作为 SFT 生成目标。meta.turns:按顺序拼接的回合级字符串(用户与助手消息),供检索路径模拟动态上下文流。meta.evidence_turns:基于零的索引列表,指向包含真实证据的回合,作为对比学习中的正样本。
- 设计特点:
- 训练时无需复杂的向量数据库设置。
- 支持自定义数据集,用户只需按以下步骤构建:
- 将文档块、段落或对话轮次按顺序填入
meta.turns。 - 标记包含答案的块,将索引填入
meta.evidence_turns。 - 在
meta.turns末尾放置最终查询,并确保messages数组包含完整上下文及助手的正确回复。
- 将文档块、段落或对话轮次按顺序填入
模型与性能
- 模型大小:提供 0.8B、2B、4B 三种规模(4B 版本已在 Hugging Face 发布)。
- 检索性能:
- 在 10 个基准测试上达到领先水平,超越部分更大规模的专业模型(如 Qwen3-Embedding-8B、KaLM-Embedding-Gemma3-12B)。
- Naive RAG 能力:
- 使用 EvoEmbedding-4B 的简单 RAG(检索增强生成)流程,性能超过复杂的专用记忆架构(如 Mem0、MemoryOS),且无需在推理时消耗显式的记忆构建 Token。
- 插件兼容性:
- 可直接替换现有框架(如 A-MEM、LightMem)中的嵌入模型,无需修改核心生成 LLM,并带来显著性能提升(分别 +19.2% 和 +13.5%)。
- 时间敏感性:
- 隐式空间对时间顺序高度敏感,能够有效解耦时间意图,在处理含时间关键词(如“首先”、“最后”)的查询时表现优异。
使用与训练
-
仓库结构:
model/:模型实现与客户端代码。train/:训练入口。eval/:评估脚本。docs/:项目页面与可视化资源。
-
环境配置:
- 根据模型大小选择对应的依赖文件:
requirements-evoembedding-lite.txt(0.8B/2B)或requirements-evoembedding-4b.txt(4B)。 - 使用 conda 环境
evoemb,并执行pip install -r <requirements>。
- 根据模型大小选择对应的依赖文件:
-
快速使用:
- 作为嵌入模型:通过
EvoEmbeddingClient输入对话消息列表,返回归一化的嵌入向量。 - 作为重排序器:提供候选文本列表与查询,返回按相关性排序的结果。
- 作为嵌入模型:通过
-
训练命令示例(4B 模型): bash PYTHONPATH=. torchrun --nproc_per_node=8 train/train.py --dataset_name MiG-NJU/EvoTrain-180K --base_model Qwen/Qwen3-4B-Instruct-2507 --output_dir ./output/evoembedding-4b
-
评估命令示例: bash PYTHONPATH=. python eval/eval.py --eval_method rag --model_name EvoEmbedding --eval_bench locomo --rag_sentence_num 16 --embedding_model Qwen/Qwen3-Embedding-0.6B
引用信息
bibtex @article{nie2026evoembedding, title={EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory}, author={Nie, Chang and Fu, Chaoyou and Feng, Junlan and Shan, Caifeng}, journal={arXiv preprint}, year={2026} }
相关资源链接
- 项目主页:https://clare-nie.github.io/EvoEmbedding/
- 论文:https://arxiv.org/abs/0000.00000
- Hugging Face 模型:https://huggingface.co/MiG-NJU/EvoEmbedding-4B
- Hugging Face 训练数据:https://huggingface.co/datasets/MiG-NJU/EvoTrain-180K





