登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
docling-project/performance-dataset-cornercases
docling-project/performance-dataset-cornercases
收藏
Hugging Face
2026-05-22 更新
2026-06-14 收录
数据链接:
https://hf-mirror.com/datasets/docling-project/performance-dataset-cornercases
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
docling-project
相关数据集
docling-project/DocLayNet-v1.2
文档布局分析
文档智能
--- dataset_info: features: - name: image dtype: image - name: bboxes sequence: sequence: float64 - name: category_id sequence: int64 - name: segmentation sequence:
Hugging Face
2025-02-10 更新
19
0
docling-project/SynthCodeNet
多模态学习
代码理解
SynthCodeNet是一个包含超过930万合成图像-文本对的多模态数据集,用于训练SmolDocling模型。这些图像-文本对包含56种不同编程语言的代码片段。图像是使用LaTeX和Pygments合成的,以实现视觉多样性。数据集分为训练集、验证集和测试集,每个数据条目都包含图像和文本信息。
Hugging Face
2025-07-16 更新
12
0
docling-project/SynthChartNet
图表理解
OCR
SynthChartNet是一个多模态数据集,专为训练SmolDocling模型用于图表文档理解任务而设计。该数据集包含1,981,157个合成样本,每个样本包括一个图表(例如线图、条形图、饼图、堆叠条形图)及其OTSL格式的地面真实数据。图表使用Matplotlib、Seaborn和Pyecharts等可视化库以120 DPI渲染,以实现布局、风格和颜色方案的视觉多样性。
Hugging Face
2025-07-15 更新
8
0
docling-project/MarkushGrapher-2-Datasets
专利化学结构识别
Markush结构解析
--- dataset_info: - config_name: ip5-markush features: - name: id dtype: string - name: page_image_path dtype: string - name: annotation dtype: string - name: cxsmiles_dataset
Hugging Face
2026-03-27 更新
15
0
docling-project/SynthFormulaNet
文档理解
数学公式识别
SynthFormulaNet是一个包含640万个合成渲染的数学公式图像及其对应LaTeX表示的多模态数据集,用于训练文档理解的多模态模型,特别是用于公式片段的提取和转录为Latex。
Hugging Face
2025-07-31 更新
12
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广