遇见数据集

financial-legal-synthetic-retrieval

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

金融与法律合成检索对数据集是一个大规模合成数据集,专门为训练非对称检索嵌入模型而设计,专注于法律和金融文档领域。它旨在解决在对称条款匹配数据上训练的领域模型在实际检索任务(即用简短自然语言查询检索长篇幅答案段落)中表现不佳的问题。数据内容由人工构造的(查询 → 段落)训练对组成,涵盖广泛的金融和法律文档类型,如保密协议、投资管理协议、信贷协议、并购协议、金融科技/SaaS合同、衍生品、证券、房地产金融以及监管文件等。每条数据样本是一个三元组,包括一个自然语言查询、一个正向相关段落和一个困难负样本(即看起来相似但未回答查询的段落),这种结构为对比学习提供具有挑战性的训练信号。数据通过大语言模型(Qwen/Qwen3.6-35B-A3B-FP8)生成,采用分类法驱动的提示方法,基于一个庞大的分类体系(10个主要类别 × 75种文档类型 × 106个条款主题),并交叉采样行业、管辖法律、主要参与方和交易背景等维度,确保内容多样性和广泛覆盖。每个生成调用产生一个包含一段正文和三个不同粒度查询的簇,从而每个段落可衍生出三个训练三元组。数据集格式为JSON Lines,每条记录包含anchor(带[QUERY]前缀的查询)、positive(带[PASSAGE]前缀的答案段落)、negative_0(带[PASSAGE]前缀的LLM生成的困难负样本,可能缺失)、label(段落ID)、source(来源标识)和meta(元数据,包含类别、子类型和条款信息)等字段。这些前缀旨在让模型明确区分查询和段落。该数据集主要用于法律和金融检索场景下的句子嵌入模型的对比学习或Matryoshka训练,特别适合与sentence-transformers库中的损失函数结合使用,利用批内负样本和困难负样本进行训练。重要注意事项:数据集内容是模型生成的合成数据,具有 plausibility 但非真实的法律文书,可能包含事实、法律或数字上的不准确以及风格痕迹,因此不可作为法律或财务建议,也不能替代真实文档;其核心价值在于为检索模型的几何表示学习提供高质量训练信号,其中近似的真实性和困难的负样本比绝对的权威正确性更为重要。

The Financial and Legal Synthetic Retrieval Pairs Dataset is a large-scale synthetic dataset specifically constructed for training asymmetric retrieval embedding models, focusing on the legal and financial document domains. It aims to address the poor performance of domain models trained on symmetric clause-matching data in real-world retrieval tasks (i.e., retrieving long answer paragraphs with short natural language queries). The data consists of artificially constructed (query → passage) training pairs covering a wide range of financial and legal document types, including but not limited to confidentiality agreements, investment management agreements, credit agreements, merger and acquisition agreements, fintech/SaaS contracts, derivatives, securities, real estate finance, and regulatory documents. Each data sample is a triplet containing: a natural language query, a positively relevant passage that answers the query, and a hard negative sample (a passage that appears similar, such as from adjacent clauses or related document types, but does not actually answer the query). This structure is designed to provide challenging training signals for contrastive learning. The data is generated using a large language model (Qwen/Qwen3.6-35B-A3B-FP8) with a taxonomy-driven prompting approach. The generation process is based on an extensive taxonomy (10 main categories × 75 document types × 106 clause topics) and cross-samples dimensions such as industry, governing law, key parties, and transaction context, ensuring diversity and broad coverage. Each generation call produces a cluster containing one passage and three queries of varying granularity, allowing each passage to derive three training triplets. The dataset format is JSON Lines. Each record includes the following fields: anchor (query with a [QUERY] prefix), positive (answer passage with a [PASSAGE] prefix), negative_0 (LLM-generated hard negative sample with a [PASSAGE] prefix, possibly missing), label (passage ID), source (source identifier, e.g., synth_<category>), and meta (metadata containing category, subtype, and clause information). These prefixes are intended to help models clearly distinguish between queries and passages. This dataset is primarily used for contrastive learning or Matryoshka training of sentence embedding models in legal and financial retrieval scenarios, particularly suitable for use with loss functions in the sentence-transformers library (such as MultipleNegativesRankingLoss, CachedMultipleNegativesRankingLoss, MatryoshkaLoss), leveraging in-batch negatives and hard negatives for training. Important note: The dataset content is model-generated synthetic data with plausibility but is not authentic legal documentation; it may contain factual, legal, or numerical inaccuracies and stylistic artifacts. Therefore, it should not be used as legal or financial advice and cannot replace real documents. Its core value lies in providing high-quality training signals for geometric representation learning in retrieval models, where approximate authenticity and hard negative samples are more important than absolute authoritative correctness.

创建时间:
2026-07-15
原始信息汇总

数据集概述

Financial & Legal Synthetic Retrieval Pairs 是一个面向金融和法律文档领域的合成检索训练数据集,专门用于训练非对称检索(asymmetric retrieval)的嵌入模型。

核心内容

  • 数据对结构:每条数据包含一个三元组:查询(query)、正例段落(positive passage)和难负例(hard negative)。难负例是看似相似但不包含查询答案的段落。
  • 数据格式:JSON Lines 格式,每行包含 anchor(查询,带有 [QUERY] 前缀)、positive(正例段落,带有 [PASSAGE] 前缀)、negative_0(可选难负例,带有 [PASSAGE] 前缀)、label(段落级 ID)、source(数据来源,格式为 synth_<category>)和 meta(包含 category、subtype、clause 等元信息)。
  • 数据规模:超过 100K 条但少于 1M 条(100K < n < 1M)。

领域与分类

  • 语言:英文。
  • 文档类型覆盖:包含 10 个类别,涵盖金融和法律文档的核心领域:
    • M&A(并购)
    • Investment Management(投资管理)
    • Lending & Credit(借贷与信用)
    • NDAs & Confidentiality(保密协议)
    • Fintech & Technology(金融科技与技术)
    • Corporate & Securities(公司治理与证券)
    • Derivatives & Structured(衍生品与结构化产品)
    • Real Estate & Project Finance(房地产与项目融资)
    • Regulatory & Compliance(监管与合规)
    • Asset Management Ops(资产管理运营)
  • 生成多样性:基于 10 个类别 × 75 种文档类型 × 106 个条款主题的矩阵,结合行业、管辖法律、主要当事人和交易背景进行条件生成,形成约 2070 万个不同的提示组合。

生成方式

  • 生成模型:使用 Qwen/Qwen3.6-35B-A3B-FP8(35B 参数混合专家模型,约 3B 活跃参数),通过 vLLM 本地服务。
  • 生成策略:基于分类树驱动的提示工程,一次调用生成一个聚类,返回一个包含段落、三个查询(按粒度分为具体事实型、主题关键词型、实务从业者提问型)和一个难负例的 JSON 对象。
  • 温度设置:0.9,以增加同一细胞内的多样性。

预期用途

  • 训练目标:用于法律和金融领域的句子嵌入模型的对比学习或 Matryoshka 训练。
  • 兼容框架:可直接用于 sentence-transformers 框架,支持 MultipleNegativesRankingLossCachedMultipleNegativesRankingLossMatryoshkaLoss 等损失函数。
  • 训练信号:为检索几何(retrieval geometry)提供训练信号,注重近似真实性和难负例的重要性。

限制与责任声明

  • 合成性质:所有段落均为模型生成,可能包含事实、法律或数字上的不准确及风格化痕迹,不构成法律或财务建议,不能替代真实文档。
  • 偏见问题:内容反映了生成模型的知识和偏见;管辖权和行业标签仅作为提示条件,不保证准确性。
  • 使用意图:仅供检索模型训练使用,不适用于权威性文档的替代。

许可证与来源

  • 许可证:Apache-2.0。
  • 生成模型:Qwen3.6-35B-A3B(Apache-2.0 许可)。
  • 关联项目:作为开源法律/金融领域 ModernBERT 嵌入项目的一部分,项目地址为:https://github.com/sakshamio/legal-financial-modernbert-150m
搜集汇总
数据集介绍
financial-legal-synthetic-retrieval 数据集图片
构建方式
该数据集聚焦金融与法律文档领域的非对称检索训练,通过精细化分类驱动生成策略构建。基于Qwen3.6-35B-A3B混合专家模型(约30亿活跃参数),在10大类别、75种文档类型与106个条款主题的交叉组合中随机采样,并融入行业、管辖法律、主体身份及交易背景等维度,形成约2070万个独立提示单元。每个生成调用返回一组包含一条正例段落、三条粒度各异的自然语言查询及一条难负例段落的JSON簇,确保数据多样性与任务适配性。
特点
数据集以三重结构组织:一条简洁的自然语言查询、对应的详细段落正例,以及语义邻近但不相关的硬负例,精准模拟真实检索场景。查询涵盖具体事实、主题关键词与实务表达三种粒度,契合E5-mistral等模型非对称任务分类。数据覆盖并购、投资管理、信贷、保密协议、金融科技、衍生品及监管申报等广泛领域,弥补传统语料库缺乏合同类型与自然查询的缺陷,专用于训练嵌入模型在不对称检索中的段落匹配能力。
使用方法
数据集以JSON Lines格式提供,每条记录包含查询、正例段落及可能的硬负例,并带有[QUERY]与[PASSAGE]前缀以明确非对称特性。适用于对比学习或Matryoshka嵌入训练,可直接接入sentence-transformers库的MultipleNegativesRankingLoss、CachedMultipleNegativesRankingLoss或MatryoshkaLoss损失函数,利用批次内负例与硬负例优化检索几何。使用时可裁去前缀以适配不支持前缀感知的编码器,数据集专为法律与金融领域的检索模型训练设计。
背景与挑战
背景概述
在法律与金融领域,文档检索技术对于合同审查、合规分析及尽职调查等任务至关重要。该数据集由研究者Saksham等人创建,旨在解决现有语料库(如SEC文件、判例法)中缺乏自然语言查询与不对称检索训练数据的难题。通过合成涵盖NDA、投资管理协议、信贷安排等10大类别、75种文档类型与106个条款主题的查询-段落对,该数据集为训练面向企业级检索的嵌入模型提供了丰富资源。其设计借鉴了E5-mistral、Gecko等前沿方法,通过分类学驱动生成约2070万个唯一提示单元,确保了数据的多样性与覆盖面,对法律与金融领域的检索模型发展具有重要推动作用。
当前挑战
该数据集面临的挑战包括:首先,在法律与金融领域,真实文本语料库(如SEC文件)内容狭隘且偏向条款匹配,难以支持不对称检索(即短查询需匹配长答案段落),而现有模型在对称的条款相似性数据上训练后,在此任务中表现不佳;其次,生成过程需克服合成数据的内在局限,即模型生成的段落虽具合理性但可能包含事实或法律错误,且无法替代真实文档,同时需确保硬负例的有效性以提升检索几何结构训练的信号质量。
常用场景
经典使用场景
在金融与法律文本密集交织的领域,非对称检索——即用简短自然语言查询匹配长篇法律条款——是极为关键的技术挑战。financial-legal-synthetic-retrieval数据集专为此场景而设计,每条样本包含一个查询、一条正向段落以及一条硬负样本,后者通常是与查询极为相似但无法回答该问题的邻近条款。研究人员可利用该数据集训练基于对比学习的嵌入模型,如通过MultipleNegativesRankingLoss或MatryoshkaLoss,显著提升模型在合同条款检索、监管文件匹配等任务中的表现。其精心构造的非对称结构使其成为评估和优化金融法律领域密集检索系统的标准基准。
解决学术问题
该数据集首先回应了真实金融法律语料库中缺乏自然语言查询的困境,解决了传统模型只擅长段落间匹配、却不擅长回答式检索的学术痛点。通过覆盖并购、投资管理、信贷、衍生品等十个大类、逾百个子类别的合成样本,研究得以系统性探索非对称检索在高度专业化领域中的表征学习难题。数据集的意义在于揭示了领域嵌入模型在对称训练数据下的性能瓶颈,并提供了一个可复现、可扩展的高质量训练信号,推动了对比学习、Matryoshka表征学习及非对称检索的理论纵深发展。
衍生相关工作
基于该数据集,衍生了一系列有影响力的研究工作。首先,它延续了E5-Mistral、Gecko及Qwen3-Embedding等前沿嵌入模型的合成数据生成范式,为非对称检索提供了领域专用实例。其次,研究人员以此数据为基础,结合ModernBERT架构训练了金融法律领域的专用嵌入模型,进一步验证了合成数据在密集检索中的有效性。此外,该数据集还激发了对硬负样本构造策略的讨论,推动了难例挖掘与对比损失函数的优化工作。围绕此数据集,相关学术论文正逐步建立起面向法律和金融文本的检索评估新基准,成为该子领域的重要资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务