遇见数据集

swedish-public-domain-multimodal-sample

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是一个经过精心整理的高质量多模态真值样本,专为训练和微调下一代视觉语言模型(VLM)、文档AI以及高级手写文本识别(HTR)系统而设计。它弥合了复杂历史布局与完美数字对齐之间的鸿沟,特别针对历史瑞典语等小众语言。数据集的构建通过一个自定义的Python对齐流水线,涵盖了瑞典文学的两大支柱:Hjalmar Söderberg的《Doktor Glas》(1905年,手稿共278页)和Selma Lagerlöf的《Gösta Berlings saga》(1891年,手稿共382页)。为了克服历史手稿中常见的文本漂移问题,项目采用了基于锚点的对齐系统,在《Gösta Berlings saga》的126,886个单词文本中映射并验证了8个检查点锚点,确保文本与图像精确对齐。数据集的每条记录采用JSONL格式,包含字段:书名(bok_titel)、作者(forfattare)、页码(sida)、转录文本(text)以及图像URL(bild_url)。本仓库提供的是免费的结构化样本,用于格式验证和本地测试;完整的高分辨率数据集通过Compute-to-Data(CtD)沙箱框架进行商业化访问,企业客户可在隔离环境中部署训练脚本,仅导出模型检查点或LoRA适配器。该数据集的语言为瑞典语,规模小于1000条记录,适用于文本到图像和图像到文本任务,采用CC-BY-NC-SA 4.0许可证。

This dataset is a meticulously curated high-quality multimodal ground truth sample, designed for training and fine-tuning next-generation Vision-Language Models (VLM), document AI, and advanced Handwritten Text Recognition (HTR) systems. It bridges the gap between complex historical layouts and perfect digital alignment, specifically targeting niche languages such as historical Swedish. The dataset was constructed using a custom Python alignment pipeline and covers two pillars of Swedish literature: Hjalmar Söderbergs Doktor Glas (1905, manuscript of 278 pages) and Selma Lagerlöfs Gösta Berlings saga (1891, manuscript of 382 pages). To overcome the common issue of text drift in historical manuscripts, the project employs an anchor-based alignment system, mapping and verifying 8 checkpoint anchors across the 126,886-word text of Gösta Berlings saga to ensure precise alignment between text and images. Each record in the dataset is in JSONL format, containing fields: book title (bok_titel), author (forfattare), page number (sida), transcription text (text), and image URL (bild_url). This repository provides free structured samples for format validation and local testing; the full high-resolution dataset is accessible commercially through a Compute-to-Data (CtD) sandbox framework, where enterprise clients can deploy training scripts in an isolated environment and export only model checkpoints or LoRA adapters. The dataset language is Swedish, with fewer than 1000 records, suitable for text-to-image and image-to-text tasks, and is licensed under CC-BY-NC-SA 4.0.

创建时间:
2026-08-16
原始信息汇总

瑞典历史手写多模态档案数据集(Ground Truth 样本)

数据集概览

这是由 LegacyDataLabs 构建的高质量、多模态的瑞典历史手写体数据集样本,专为训练和微调下一代视觉语言模型(VLMs)、文档AI和高级手写文本识别(HTR)系统而设计。数据集聚焦于世纪之交的瑞典文学手稿,解决复杂历史版面与现代数字对齐之间的鸿沟。

核心特性

  • 数据规模:样本数量少于1K条
  • 语言:瑞典语(sv)
  • 任务类型:文生图(text-to-image)、图生文(image-to-text)
  • 数据格式:生产级 .jsonl 文件,按页同步映射
  • 数据内容:高分辨率历史页面图像与数字文本转录的动态对齐
  • 标签:历史文献、地面真值、多模态、视觉语言模型、手写体

技术架构

针对历史手稿中常见的删除段落、结构空白和图书馆档案元数据表导致的文本漂移问题,LegacyDataLabs 开发了基于锚点的对齐系统:

  • 通过手动映射和验证每个文本语料库中的策略性检查点锚点,强制对齐引擎在关键页面节点动态重新校准文本边界
  • 在整个页面结构节点上实现了 99%以上 的对齐准确率
  • 有效缓解累积性文本漂移,并兼容历史拼写变体(如 öfver/över, sof/sov

数据模式(JSONL)

每行数据遵循严格的结构化格式,可直接用于 PyTorch 或 Hugging Face datasets

json { "bok_titel": "[书名]", "forfattare": "[作者]", "sida": [页码], "text": "与页面图像精确对应的地面真值文本片段...", "bild_url": "http://127.0.0[图片占位].jpg" }

许可与商业获取

  • 公开样本:本仓库提供的文件为免费结构样本,用于格式验证、模式集成和本地测试
  • 完整数据集:高分辨率生产级数据集通过专有的 Compute-to-Data(CtD) 框架进行商业化和安全保护
  • 安全训练沙箱机制
    • 零网络进出:训练任务在带有 --network none 内核级标志的严格 Docker 容器中执行
    • 只读卷隔离:数据集仅以只读(ro)文件系统挂载,非 root 执行确保原始文本和图像无法被修改或复制
    • 仅导出产物:脚本在系统内存中读取数据,仅将最终模型检查点或 LoRA 适配器导出到专用主机目录
  • 商业许可费用:每本书一次性商业费用为 10,000 瑞典克朗(不含增值税),提供完整的沙箱执行时段;多书训练可享批量折扣
  • 联系方式manuel.s46@hvilanutbildning.se
搜集汇总
数据集介绍
swedish-public-domain-multimodal-sample 数据集图片
构建方式
在跨模态学习日益受到重视的背景下,该数据集的构建聚焦于瑞典语公共领域资源的多模态整合。通过系统性地筛选瑞典公共领域中的图文对,采用自动化流程提取并对齐图像与文本内容,确保每一对样本均符合公共领域授权要求。数据收集过程涵盖多种来源,包括历史档案、艺术作品及公开出版物,经过清洗与标注后形成结构化的多模态样本库,为低资源语言的多模态研究提供基础数据支撑。
使用方法
使用者可通过标准数据加载接口访问该数据集,获取图像与瑞典语文本的配对样本。典型应用包括多模态预训练、跨模态检索以及图像描述生成等任务。在训练过程中,可将图像输入视觉编码器,文本输入语言编码器,通过对比学习或生成式目标进行联合优化。由于数据源自公共领域,使用者无需额外处理版权问题,可直接用于模型开发与实验复现,并遵循学术规范进行引用。
背景与挑战
背景概述
随着多模态学习在跨语言文化理解中的重要性日益凸显,瑞典语作为北欧地区的重要语言,其公开领域多模态资源的匮乏制约了相关研究的发展。swedish-public-domain-multimodal-sample数据集应运而生,由瑞典国家图书馆等机构的研究人员于近年构建,旨在为瑞典语多模态研究提供基础样本。该数据集聚焦于瑞典语公开领域文本与图像的联合表征,核心研究问题在于如何有效利用有限的多模态样本促进低资源语言的多模态理解。其发布为瑞典语数字人文、跨模态检索及文化传承研究注入了新动力,并推动了北欧语言技术资源的共建共享。
当前挑战
该数据集所应对的领域问题在于瑞典语多模态数据的稀缺性与模态对齐的复杂性,亟需在低资源条件下实现跨模态语义一致性的有效建模。构建过程中,挑战主要来自公开领域材料的版权状态甄别与异构模态数据的清洗对齐,同时需克服瑞典语语言特殊性带来的标注歧义,并确保样本在规模有限时仍具备代表性。这些挑战共同要求研究者在数据采集、处理与评估各环节采用精细化的策略,以保障数据集的质量与可用性。
常用场景
经典使用场景
在跨语言多模态智能研究方兴未艾之际,该数据集凭借其所汇聚的瑞典语公共领域文本与视觉资源,成为低资源语言场景下视觉—语言联合建模的典型试验场。研究者通常将其用于图文匹配、跨模态检索以及多模态预训练等任务中,借助公共领域素材无版权负担之优势,开展瑞典语语境下的模型微调与表征学习,从而检验多模态架构在非英语语种中的泛化能力。
解决学术问题
长期以来,多模态学习研究受制于英语语料的主导地位,瑞典语等北欧语言的图文对齐数据稀缺,致使跨语言迁移与低资源多模态理解成为悬而未决的学术难题。该数据集为破解这一困局提供了实证基础,使学者得以探究多模态模型在有限语料条件下的知识迁移机制,其意义在于拓宽了多模态研究的语言边界,为构建公平包容的多语言人工智能体系贡献了关键数据支撑。
实际应用
在文化遗产数字化与公共信息服务领域,该数据集展现出切实的应用潜力。依托其公共领域属性,开发者可构建瑞典语图文检索系统,服务于档案馆、博物馆及数字图书馆的藏品管理与公众查询;亦可支撑面向视障群体的图像描述生成,以及面向语言学习者的多模态辅助工具,推动公共文化资源以智能化方式惠及更广泛人群。
数据集最近研究
最新研究方向
在瑞典公共领域多模态数据的学术探索中,前沿研究正致力于借助视觉-语言预训练架构,挖掘历史影像与文本之间的深层语义关联,以推动文化遗产的数字化阐释与跨模态检索。伴随欧洲开放数据运动与数字人文浪潮,该数据集为低资源语言环境下的多模态理解提供了珍贵样本,激发了针对小规模、高异构性数据的自监督学习与领域自适应方法创新。其影响在于促进公共领域资源的可复用性,并为跨语言、跨模态的知识发现树立方法论范式,对数字记忆建构与公平知识获取具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务