遇见数据集

EvoTrain-180K

收藏
github2026-06-19 更新2026-06-22 收录
官方服务:

资源简介:

发布的EvoTrain-180K数据集采用直观的聊天式微调格式,专为联合SFT(监督微调)和检索优化而设计。每个训练实例都是一个自包含的上下文窗口,结构包括messages(标准交替用户/助手轮次,代表SFT生成目标)、meta.turns(格式化轮次级字符串,模拟动态上下文流处理)和meta.evidence_turns(指向包含真实证据的特定历史轮次的零基索引,作为对比损失的正目标)。

The released EvoTrain-180K dataset adopts an intuitive chat-based fine-tuning format, which is specifically designed for joint SFT (supervised fine-tuning) and retrieval optimization. Each training instance is a self-contained context window, whose structure includes messages (standard alternating user/assistant turns representing the generation targets for SFT), meta.turns (formatted turn-level strings that simulate dynamic context stream processing), and meta.evidence_turns (zero-based indices pointing to specific historical turns containing real evidence, serving as positive targets for contrastive loss).

创建时间:
2026-06-16
原始信息汇总

数据集概述

项目名称:EvoEmbedding
发布机构:MiG-NJU
核心概念:通过“原生记忆 + 隐式嵌入”(Native Memory + Latent Embedding)生成可演化的上下文感知文本表示,专为长上下文检索设计。


数据集:EvoTrain-180K

  • 规模与用途:包含约 180K 训练样本,采用对话式微调格式(chat-style),适用于联合监督微调(SFT)与检索优化。
  • 数据格式:每个训练实例为一个自包含的上下文窗口,包含以下关键字段:
    • messages:标准的用户/助手交替对话,作为 SFT 生成目标。
    • meta.turns:按顺序拼接的回合级字符串(用户与助手消息),供检索路径模拟动态上下文流。
    • meta.evidence_turns:基于零的索引列表,指向包含真实证据的回合,作为对比学习中的正样本。
  • 设计特点
    • 训练时无需复杂的向量数据库设置。
    • 支持自定义数据集,用户只需按以下步骤构建:
      1. 将文档块、段落或对话轮次按顺序填入 meta.turns
      2. 标记包含答案的块,将索引填入 meta.evidence_turns
      3. meta.turns 末尾放置最终查询,并确保 messages 数组包含完整上下文及助手的正确回复。

模型与性能

  • 模型大小:提供 0.8B、2B、4B 三种规模(4B 版本已在 Hugging Face 发布)。
  • 检索性能
    • 在 10 个基准测试上达到领先水平,超越部分更大规模的专业模型(如 Qwen3-Embedding-8B、KaLM-Embedding-Gemma3-12B)。
  • Naive RAG 能力
    • 使用 EvoEmbedding-4B 的简单 RAG(检索增强生成)流程,性能超过复杂的专用记忆架构(如 Mem0、MemoryOS),且无需在推理时消耗显式的记忆构建 Token。
  • 插件兼容性
    • 可直接替换现有框架(如 A-MEM、LightMem)中的嵌入模型,无需修改核心生成 LLM,并带来显著性能提升(分别 +19.2% 和 +13.5%)。
  • 时间敏感性
    • 隐式空间对时间顺序高度敏感,能够有效解耦时间意图,在处理含时间关键词(如“首先”、“最后”)的查询时表现优异。

使用与训练

  • 仓库结构

    • model/:模型实现与客户端代码。
    • train/:训练入口。
    • eval/:评估脚本。
    • docs/:项目页面与可视化资源。
  • 环境配置

    • 根据模型大小选择对应的依赖文件:requirements-evoembedding-lite.txt(0.8B/2B)或 requirements-evoembedding-4b.txt(4B)。
    • 使用 conda 环境 evoemb,并执行 pip install -r <requirements>
  • 快速使用

    • 作为嵌入模型:通过 EvoEmbeddingClient 输入对话消息列表,返回归一化的嵌入向量。
    • 作为重排序器:提供候选文本列表与查询,返回按相关性排序的结果。
  • 训练命令示例(4B 模型): bash PYTHONPATH=. torchrun --nproc_per_node=8 train/train.py --dataset_name MiG-NJU/EvoTrain-180K --base_model Qwen/Qwen3-4B-Instruct-2507 --output_dir ./output/evoembedding-4b

  • 评估命令示例: bash PYTHONPATH=. python eval/eval.py --eval_method rag --model_name EvoEmbedding --eval_bench locomo --rag_sentence_num 16 --embedding_model Qwen/Qwen3-Embedding-0.6B


引用信息

bibtex @article{nie2026evoembedding, title={EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory}, author={Nie, Chang and Fu, Chaoyou and Feng, Junlan and Shan, Caifeng}, journal={arXiv preprint}, year={2026} }


相关资源链接

  • 项目主页:https://clare-nie.github.io/EvoEmbedding/
  • 论文:https://arxiv.org/abs/0000.00000
  • Hugging Face 模型:https://huggingface.co/MiG-NJU/EvoEmbedding-4B
  • Hugging Face 训练数据:https://huggingface.co/datasets/MiG-NJU/EvoTrain-180K
搜集汇总
数据集介绍
EvoTrain-180K 数据集图片
构建方式
EvoTrain-180K采用一种直观的对话式微调格式构建,旨在同时支持监督式微调(SFT)与检索优化。每个训练实例为一个自包含的上下文窗口,其核心结构包含三部分:messages字段以标准的用户/助手交替轮次表示SFT生成目标;meta.turns字段将对话轮次格式化为字符串列表,由检索器路径按序处理以模拟动态上下文流;meta.evidence_turns字段则通过零基索引标注包含真实证据的历史轮次,作为对比学习中的正样本目标。这种设计规避了训练时复杂的向量数据库配置,使模型能直接消费该格式进行微调。
特点
该数据集最显著的特征在于其旨在赋能EvoEmbedding模型生成可演化的上下文感知嵌入。区别于传统静态嵌入模型将文本段孤立编码的做法,EvoEmbedding会维护一个持续更新的潜在记忆队列,在顺序处理输入流时动态融合历史记忆与当前内容,从而生成对时间顺序与语义变迁高度敏感的表征。EvoTrain-180K通过明确的证据轮次标注和流式上下文结构,专门强化模型的时序检索能力,使其能精准解耦诸如“首先”、“最后”等时间关键词约束下的复杂查询,并在长文本检索任务中展现卓越性能。
使用方法
使用者可轻松适配EvoTrain-180K的JSON格式以构建自定义训练数据。具体步骤包括:将文档块、段落或对话轮次顺序映射至meta.turns列表;识别包含答案的证据块并将其索引填入meta.evidence_turns;将最终查询置于meta.turns末尾,并确保messages数组反映完整的上下文序列及助手的正确回复。预训练代码通过torchrun方式启动,需指定数据集名称、基础模型路径与输出目录。模型调用则通过EvoEmbeddingClient实现,支持encode_messages方法生成序列化嵌入,以及rerank方法进行候选重排序,简洁易用。
背景与挑战
背景概述
EvoTrain-180K数据集由南京大学MiG团队于2026年创建,主要研究人员包括Nie Chang、Fu Chaoyou等。该数据集旨在解决传统嵌入模型在处理长上下文检索时的本质缺陷——静态编码方式忽视文本时序与上下文关联。通过构建包含180K条对话式样本的监督微调与检索优化联合训练数据,每个实例整合了标准对话消息、逐轮字符串序列及证据标注索引,为EvoEmbedding模型提供动态状态追踪与可进化表征生成的训练基础。数据集显著提升了长文本检索的精准度,在10项基准测试中超越更大规模的静态模型,对检索增强生成(RAG)与智能体记忆领域产生了深远影响。
当前挑战
其核心挑战在于克服静态嵌入模型对长历史上下文中时序信息与语义演变不敏感的根本局限。传统方法将文本片段编码为孤立静态向量,导致时间意图(如“首先”“最后”)与语义变化的表征严重混淆。数据构建过程中面临精确标注跨多个轮次的证据索引、确保随机插入的无关轮次不破坏动态流式处理的模拟逼真度、以及平衡检索优化与生成任务联合训练的损失权重等难点。此外,该数据集需在有限参数量下实现超长上下文(如对话历史与文档块序列)的高效内存追踪,避免显存开销过大的同时保持时序敏感性与检索鲁棒性。
常用场景
经典使用场景
在长上下文检索与对话记忆追踪领域,EvoTrain-180K 数据集被设计为一种创新的微调语料,旨在训练模型生成可演化的嵌入表示。其经典用法在于通过结构化的对话式样本,将历史事实、用户偏好与后续查询封装于同一上下文窗口,并利用‘证据轮次’标注机制引导模型进行时序敏感的密集检索。研究者通常将其用于需要持续跟踪动态语义流的场景,例如多轮对话中的关键信息回溯或长文档中的跨段落线索定位。该数据集将静态的孤立编码范式打破,使得嵌入能够随着对话的推进而同步更新,从而实现对时间顺序与语义变迁的高度敏感。这种设计不仅提升了检索精度,还为构建能感知上下文演变的推理系统提供了坚实的训练基础。
解决学术问题
EvoTrain-180K 数据集有效解决了传统静态嵌入模型在处理长时间跨度对话或文档时面临的表示纠缠与时序失敏问题。在学术研究中,常见困境在于:同一语义片段在不同上下文中的含义可能截然不同,而静态模型无法捕捉这种语境演化。该数据集通过融合监督微调与对比学习,迫使模型在生成嵌入时同时利用历史记忆队列与当前输入,从而解耦时间意图。它使得长期历史中的‘首次提及’与‘最后提及’等时序约束查询得以精确响应,显著提升了长上下文检索的召回率与准确性。这一突破为信息检索、主动记忆系统以及时序推理等研究方向提供了重要的数据支撑与基准验证,推动领域向更贴近人类认知的动态记忆机制迈进。
衍生相关工作
围绕 EvoTrain-180K 数据集及其背后的 EvoEmbedding 框架,衍生了一系列具有影响力的学术与工程工作。研究者们将其与主流静态嵌入模型(如 Qwen3-Embedding、KaLM-Embedding)进行对比,验证了其在多项长上下文基准上的领先优势。此外,该工作在朴素 RAG 机制上的应用超越了专有代理记忆架构(如 Mem0、MemoryOS),揭示了无显式记忆构造开销下的检索潜力。另一项重要衍生是将 EvoEmbedding 作为增强组件嵌入现有系统,如集成至 A-MEM 与 LightMem 后带来了超过 13% 的性能增益,证明了框架的通用性与可迁移性。这些后续探索共同推动了动态嵌入在对话系统、知识管理乃至智能体决策链条中的深化应用,形成了一条从数据构建到模型评估再到系统适配的完整研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务