遇见数据集

dipta007/BartaLens

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

BartaLens(বার্তা + Lens)是一个大规模多模态孟加拉语新闻语料库,将文章与相关新闻图像配对,旨在用于孟加拉语标题生成的训练和评估。关键特征包括:超过120万篇文章,每篇文章都配有相关的新闻照片;数据集分为训练集(1,219,442行)、验证集(5,000行)和测试集(15,000行),以确保可重复评估;多模态性质,结合了文本和视觉信息;数据来源多样,来自孟加拉国的主要新闻媒体。数据字段包括:唯一标识符(id)、完整的孟加拉语文章正文(article)、孟加拉语文章标题(headline)、新闻媒体名称(source)、孟加拉语新闻类别(category)以及相关新闻照片(image)。该数据集适用于多模态标题生成、视觉语言模型微调(如Gemma、Qwen VLMs与LoRA)、图像引导摘要、孟加拉语VLM基准测试和跨模态检索等任务。

--- 许可协议:CC BY 4.0(知识共享署名4.0国际许可协议) 任务类别: - 文本生成 - 摘要生成 - 图像到文本 语言: - 孟加拉语(bn) 标签: - 孟加拉语 - 新闻 - 标题生成 - 多模态 - 视觉语言(Vision-Language) - 自然语言处理(NLP) 样本规模: - 100万 < 样本数 < 1000万 --- # BartaLens:孟加拉语多模态新闻语料库 <p align="center"> <a href="https://arxiv.org/abs/0000.00000"> <img src="https://img.shields.io/badge/%F0%9F%93%84_Paper-Coming_Soon-b12a00?style=for-the-badge&labelColor=ffb300" alt="论文即将发布"> </a> </p> [![Paper](https://img.shields.io/badge/arXiv-即将发布-red)](https://arxiv.org/abs/0000.00000) [![GitHub](https://img.shields.io/badge/GitHub-代码-blue)](https://github.com/dipta007/bengali-news-headline) [![Text-Only Version](https://img.shields.io/badge/HuggingFace-Barta(纯文本版)-yellow)](https://huggingface.co/datasets/dipta007/Barta) ## 项目概述 **BartaLens**(বার্তা意为“新闻”,搭配Lens即“镜头”)是一个大规模多模态孟加拉语新闻语料库,将新闻文章与对应的配套新闻图像进行配对。本数据集专为孟加拉语标题生成任务的视觉语言模型训练与评估而设计。 核心特性: - **120万+篇配套新闻图像的文章** - **包含训练、验证、测试三个划分集**,支持可复现的模型评估 - **多模态属性**:每篇文章均搭配其对应的新闻照片 - **来源多元**:涵盖孟加拉国主流新闻媒体的内容 ## 数据集统计 | 划分集 | 样本数量 | |-------|-----:| | 训练集 | 1,219,442 | | 验证集 | 5,000 | | 测试集 | 15,000 | ## 数据集加载 python from datasets import load_dataset # 加载训练集划分 dataset = load_dataset("dipta007/BartaLens", split="train") # 加载测试集划分 test = load_dataset("dipta007/BartaLens", split="test") # 访问单条样本 example = dataset[0] image = example["image"] # PIL图像格式 headline = example["headline"] article = example["article"] ## 数据字段 | 字段名 | 数据类型 | 字段说明 | |-------|------|-------------| | `id` | 字符串 | 唯一标识符 | | `article` | 字符串 | 孟加拉语完整新闻正文 | | `headline` | 字符串 | 孟加拉语新闻标题 | | `source` | 字符串 | 发布该新闻的媒体名称 | | `category` | 字符串 | 孟加拉语新闻分类标签 | | `image` | 图像 | 配套新闻照片(PIL图像格式) | ## 预期应用场景 - **多模态标题生成**:基于新闻文本与配套图像生成对应标题 - **视觉语言模型(Vision-Language Model, VLM)微调**:例如支持LoRA的Gemma、Qwen视觉语言模型 - **图像引导式摘要生成**:利用视觉上下文优化摘要生成质量 - **孟加拉语视觉语言模型基准测试**:评估孟加拉语场景下的多模态理解能力 - **跨模态检索**:实现新闻图像与新闻文章的匹配检索 ## 相关数据集 - [**Barta**](https://huggingface.co/datasets/dipta007/Barta) — 纯文本版本(包含170万篇文章,为未经过图像筛选的完整语料库) ## 引用格式 bibtex @article{BartaLens2025, title={BartaLens: A Multimodal Bengali News Corpus for Headline Generation}, author={Shubhashis Roy Dipta}, year={2025} }

提供机构:
dipta007
二维码
社区交流群
二维码
科研交流群
商业服务