遇见数据集

Text2Receipt

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

Text2Receipt是一个希伯来语合成数据集,用于文本生成任务,旨在将杂乱的自由文本希伯来语收入记录转换为完整、有效的以色列财政文档(如收据和税务发票)。该数据集通过基于规则的生成流程和LLM释义层创建,确保地面真实标签精确无误。生成过程模拟现实场景,包括类别、发行方状态、文档类型等采样,并严格编码以色列财政规则(如增值税率、税号校验算法)。数据集包含四个核心字段:raw_text(杂乱的希伯来语自由文本,作为模型输入)、parse(结构化的解析对象,作为预测目标)、completed(完整财政文档)和meta(元信息)。总规模约10,000个样本,划分为训练集(7,200行)、验证集(900行)、同分布测试集(900行)和分布外测试集(1,000行),后者用于测试词汇泛化能力。探索性数据分析验证了规则一致性和释义层效果(约17.2%样本经过LLM改写)。该数据集适用于训练和评估NLP模型,特别是从非结构化文本到结构化财政文档的信息提取和生成任务。

Text2Receipt is a Hebrew synthetic dataset for text generation tasks, designed to convert messy free-text Hebrew income records into complete and valid Israeli fiscal documents (such as receipts and tax invoices). The dataset is created through a deterministic, rule-based generation process with an added bounded large language model (LLM) paraphrasing layer to ensure precise ground truth labels. The generation process simulates real-world scenarios, including sampling of categories, issuer status, document types, customer types, years, payment methods, and amounts, and strictly encodes Israeli fiscal rules such as VAT rates (0% for exempt dealers, 17% for authorized dealers in 2024, and 18% after reform in 2025-2026), trigger conditions for allocation numbers (`מספר הקצאה`), and the check digit algorithm for Israeli 9-digit tax IDs. The dataset includes four core fields: `raw_text` (messy Hebrew free text as model input), `parse` (structured parsing object containing customer, items, document type, amount basis, payment, date, currency, etc., as model prediction target), `completed` (complete fiscal document determined by the generator, including issuer, line items, subtotals, VAT, total, and allocation number), and `meta` (metadata including data pool, category, year, issuer status, whether paraphrased, etc.). The total size is approximately 10,000 samples, divided into training set (7,200 rows), validation set (900 rows), in-distribution test set (900 rows), and out-of-distribution test set (1,000 rows). The out-of-distribution test set uses a completely disjoint vocabulary entity pool from the training set, specifically designed to test the models vocabulary generalization ability. Exploratory data analysis verifies the rule consistency of the data generator, structural integrity of the out-of-distribution pool, and the effect of the paraphrasing layer (approximately 17.2% of samples are rewritten by LLM while 100% preserving key facts such as amounts and customer names). The dataset is suitable for training and evaluating natural language processing models, particularly for information extraction and generation tasks from unstructured text to structured fiscal documents.

创建时间:
2026-06-09
原始信息汇总

数据集概述

数据集名称:Text2Receipt
语言:希伯来语(he)
许可协议:MIT
任务类别:文本生成
标签:希伯来语、收据、发票、以色列税务、合成数据、结构化输出
数据规模:1K 到 100K 条记录

数据内容与结构

该数据集旨在将杂乱的自由文本希伯来语收入笔记转换为合规、完整的以色列财政文档(收据和税务发票)。数据为合成生成,包含以下字段:

  • raw_text:模型输入,即杂乱的非结构化希伯来语笔记。
  • parse:模型目标,包含客户、项目、文档类型、金额基础、支付方式、日期、货币等结构化信息。
  • completed:确定性生成的完整文档,包括发行人、行项、小计、增值税、总额、分配号等。
  • meta:元数据,记录数据池、类别、年份、发行人状态、是否经过改写等信息。

数据生成过程

数据通过确定性规则生成器结合有限的大语言模型改写层合成产生,确保真实标签准确无误。主要生成流程包括:

  1. 场景采样:从两个不重叠的实体/模板池(A 为训练家族,B 为分布外家族)中抽取类别、发行人状态、文档类型、客户类型、年份、支付方式和金额。
  2. 规则生成:确定性生成器输出完美的真实标签,包括 parse 对象和 completed 文档。complete() 函数自动完成所有税务计算(增值税、分配号、以色列身份证校验位)。
  3. 希伯来语渲染:生成模板化的、故意杂乱的希伯来语 raw_text 作为模型输入。
  4. 有限改写:约 17% 的行通过指令模型改写 raw_text,并设置事实保留守卫,拒绝任何丢失金额或客户名称的改写。

编码的以色列税务规则

  • 增值税:豁免经销商为 0%;授权经销商为 17%(2024年)或 18%(2025-2026年,2025年1月改革)。
  • 分配号:当授权经销商向企业客户开具税务发票且小计达到年度门槛(2024-2026年从 25,000 降至 20,000 再降至 10,000 新谢克尔)时,必须包含分配号。
  • 身份证校验位:所有发行人/客户的税务 ID 均符合以色列 9 位身份证算法。

数据划分

划分 行数 数据池 用途
train 7,200 A 训练
validation 900 A 调优
iid_test 900 A 分布内测试
ood_test 1,000 B 词汇泛化测试

探索性数据分析(EDA)

基于 10,000 行数据进行了探索性分析,主要发现包括:

支柱 结果
生成器验证 0 次硬规则违反(增值税/身份证/脚本);分配号规则在 99.97% 的行中成立。
增值税日历 发行人状态与增值税率之间的 Cramers V = 1.00,2025年1月从 17% 到 18% 的改革精确匹配。
分布外完整性 池 A 和 B 在词汇层面完全不相交(Jaccard 系数为 0),但分布上相同(小计 KS 检验 p = 0.41)。
类别经济学 小计 η² 按类别为 0.185;类别与增值税率之间的 V = 0.24,实际为豁免经销商市场份额效应。
改写层 17.2% 的行经大语言模型改写;金额保留率为 100%,客户名称在改写行中保留率为 100%。

模型局限性分析 v1.0

  1. 在 10,000 新谢克尔分配线附近无阈值聚集现象。
  2. 支付方式独立于金额和类别(V < 0.05)。
  3. 类别与增值税的关联仅由豁免份额驱动(在授权经销商内,17/18 的划分是平坦的)。
  4. 约 7% 的行包含拉丁字符(真实的品牌/产品名称,非数据污染)。

可视化图表

  • Categorical Dashboard
  • Amount Distribution
  • Verification Battery
  • VAT Calendar
  • Cramers V Heatmap
  • Subtotal By Category
  • Gap Bunching
  • VAT Composition By Category
  • OOD Disjointness
  • Pool Distribution Match
  • Paraphrase Analysis
  • t-SNE Raw Text

使用示例

python from datasets import load_dataset

ds = load_dataset("yonilev/Text2Receipt") print(ds["train"][0]["raw_text"]) # 模型输入 print(ds["train"][0]["parse"]) # 模型目标

搜集汇总
数据集介绍
Text2Receipt 数据集图片
构建方式
Text2Receipt数据集通过一种确定性的、基于规则的生成器与受限的大语言模型释义层相结合的方式构建而成,确保了数据真实性的精确无误。其构建流程始于场景采样,从两个互不相交的实体模板池中提取类别、开票方身份、文档类型、客户类型、年份、付款方式及金额等要素。随后,一个确定性的生成器输出完美的数据真值,即'parse'对象与'completed'文档,其中'complete()'函数自动完成所有财税计算,包括增值税、分配号码及以色列身份证校验位,使模型无需学习算术运算。在此之后,系统将生成模板化的、有意杂乱的希伯来语自由文本作为模型输入。最后,约17%的行会经过一个受限的大语言模型释义环节,由Qwen2.5-1.5B-Instruct等模型改写文本,并通过事实保留守卫机制确保改写不会遗漏金额或客户名称等信息。
特点
该数据集的核心特点在于其深刻的财税规则编码与精密的分布设计。它精准反映了以色列的增值税规则:豁免经销商税率为0%,授权经销商则依据年份适用17%或18%的税率(2025年改革后)。分配号码的触发条件严格遵循阈值规定,且每张发票的税务编号均符合以色列9位算法。数据集在分布上展现出显著的同分布与异分布分离特性:训练、验证与同分布测试集来自池A,而异分布测试集则来自词汇上完全不相交的池B,但两者在金额分布上高度一致(KS检验p=0.41)。尤为重要的是,整个数据集经过严格的生成器验证,未发现任何硬性规则违反,增值税日历的Cramer's V值达到完美的1.00,充分验证了其构建规则的内在一致性。
使用方法
使用Text2Receipt数据集进行模型训练与评估极为便捷。研究人员可通过HuggingFace的datasets库直接加载数据集:'ds = load_dataset("yonilev/Text2Receipt")'。加载后,数据集包含'raw_text'、'parse'、'completed'和'meta'四个关键字段。其中,'raw_text'字段存储的是杂乱无章的希伯来语自由文本收入记录,作为模型的输入数据;'parse'字段则包含标准化的解析结果,包括客户信息、项目、文档类型、金额基础、付款方式、日期和货币等结构化输出,是模型需要预测的目标数据。数据集提供了四个分割:训练集含7200条记录,验证集900条,同分布测试集900条,异分布测试集1000条。这种结构化的分割设计使研究者能够全面评估模型在同分布与异分布场景下的泛化能力,特别适合用于序列到序列的文本生成任务,如将非结构化的收入笔记转化为符合以色列财税规定的正式发票。
背景与挑战
背景概述
在自然语言处理与税务自动化的交叉领域中,从非结构化文本到结构化财务文档的转换是一项具有挑战性的任务。Text2Receipt数据集由Yoni Lev于近年内创建,旨在解决希伯来语自由文本收入记录向以色列合规财政单据(收据与税务发票)的自动化生成问题。该数据集通过确定性规则生成器与大语言模型有限释义层相结合的方式,合成了10,000条样本,并严格编码了以色列复杂的增值税规则(如2014年17%税率至2025年18%税率的改革)、分配号码机制及身份证校验算法。作为首个专注希伯来语税务文档生成的标准基准,Text2Receipt为低资源语言的结构化输出任务提供了可复现的验证平台,推动了多语言税务合规领域的研究进程。
当前挑战
Text2Receipt所面临的核心挑战体现在领域问题与构建过程两个维度。在领域问题层面,该数据集需应对希伯来语非规范文本的歧义性消解,例如用户输入的随意缩写、拼写错误及口语化表达,同时需精确执行以色列税务规则中增值税减免判定、分配号码门槛计算(2024-2026年间从25,000降至10,000新谢克尔)及身份证校验位验证,模型必须在无显式算术引导下学习这些隐性规章。在构建过程中,挑战在于确保合成数据的真实性:通过池A与池B的零词汇重叠设计实现词汇泛化测试的严格性,同时保持分布一致性(如类别经济关联度η²=0.185);此外,17.2%的LLM释义层需在不丢失金额与客户名称的前提下引入语言多样性,而事实保留守卫的误拒绝率与宽松度平衡仍是尚未完全解决的问题。
常用场景
经典使用场景
在自然语言处理与结构化信息抽取的交叉领域中,Text2Receipt数据集为从非结构化希伯来语文本到标准以色列财税凭证的转换任务提供了高度逼真且精确标注的基准。该数据集包含逾万条合成样本,每条样本均由一段杂乱自由文本形式的希伯来语收入记录作为输入,并对应一个结构化解析对象及一份完整的税务发票或收据作为输出。其经典应用场景聚焦于训练和评估序列到序列模型在特定领域信息抽取上的能力,尤其是面对含有多元实体、金额计算及财税合规规则的复杂转换需求时,模型需准确提取客户、商品明细、发票类型、金额基础、支付方式及日期等关键字段,并遵循增值税率、分配号码及以色列身份校验位等法定规则。
实际应用
在实际产业应用中,Text2Receipt所承载的任务直接映射至中小型企业的财务自动化管理流程。众多商户、自由职业者及小型会计事务所仍依赖手写或口述记录交易信息,而这些零散的非结构化工单需要专业人员手动整理为符合税务机关要求的正式发票。基于该数据集训练出的模型能够自动将杂乱文本片段转化为完整合规的以色列税务收据或发票,显著降低人工录入的出错率与时间成本。此外,由于数据集精确模拟了增值税率随年份调整(如2025年从17%上调至18%)及分配号码阈值变动等真实财税政策,模型在部署后即可无缝适应法规迭代,为税务合规管理提供了可扩展的智能化解决方案。
衍生相关工作
围绕Text2Receipt数据集已催生出一系列富有启示性的衍生工作,尤其集中在结构化文本解析、受控文本生成与大模型能力边界探究等方向。一方面,研究者利用其精确标注的解析目标设计了基于Transformer的序列标注与填充模型,探讨了在弱监督或无算术辅助下模型对数值与规则的内在表示能力。另一方面,该数据集的OOD测试机制为词汇外泛化研究提供了可靠基准,驱动了关于分布外检测、数据增强策略以及符号推理与神经模型融合方法的深入探索。此外,数据集中引入的有界LLM改写层及其事实保留守护规则,也为探究大模型在改写过程中对关键实体信息的保真度,以及如何构建更鲁棒的噪声容错训练范式提供了丰富素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务