Starscream-11813/BanglaBook
收藏资源简介:
BanglaBook是一个大规模的孟加拉语书籍评论数据集,用于情感分析。该数据集包含158,065个样本,分为正面、负面和中性三类。数据集中的每个样本包含书籍名称、作者姓名、书籍类别、评分、评论文本、在线书店名称以及情感标签。数据集的构建过程包括从在线书店收集数据、翻译非孟加拉语评论、手动验证翻译准确性等步骤。该数据集旨在为孟加拉语情感分析提供丰富的训练资源,并支持跨领域的适应性研究。
BanglaBook is a large-scale Bangla dataset for sentiment analysis from book reviews. The dataset consists of 158,065 samples classified into three broad categories: positive, negative, and neutral. Each sample in the dataset includes the book title, author name, book category, rating, review text, online bookstore name, and sentiment label. The dataset construction process involves collecting data from online bookstores, translating non-Bangla reviews, and manually verifying the accuracy of translations. The dataset aims to provide rich training resources for Bangla sentiment analysis and support cross-domain adaptability research.
BanglaBook 数据集概述
基本信息
- 许可证: Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International
- 任务类别:
- 文本分类
- 零样本分类
- 语言:
- 孟加拉语 (bn)
- 标签:
- 情感分析
- 书籍评论
- 产品评论
- 孟加拉语
- 孟加拉文
- 数据集
- 数据集名称: BanglaBook
- 数据集规模: 100K < n < 1M
数据格式
每行包含一个书籍评论样本,各列的含义如下:
| 列标题 | 描述 |
|---|---|
id |
样本的唯一标识号 |
Book_Name |
被评论书籍的标题 |
Writer_Name |
书籍作者的姓名 |
Category |
书籍所属的类别 |
Rating |
评分值 (r),范围为 (1 leq r leq 5),反映评论者对书籍质量的主观评价 |
Review |
评论者撰写的评论文本 |
Site |
在线书店的名称 |
sentiment |
评论传达的情感和类别标签,具体标签如下:<br>$$ S_i =egin{cases} ext{Negative}, & ext{if } r_i leq 2\ ext{Neutral}, & ext{if } r_i = 3\ ext{Positive}, & ext{if }r_i geq 4 end{cases} $$ |
label |
情感标签的数值表示,具体标签如下:<br>$$ label_i = egin{cases} 0, & ext{if } S_i = ext{Negative} \ 1, & ext{if } S_i = ext{Neutral} \ 2, & ext{if } S_i = ext{Positive} \ end{cases} $$ |
数据构建
数据收集过程
- 从在线书店收集作者和书籍的URL。
- 通过这些URL抓取书籍标题、作者姓名、书籍类别、评论文本、评论者姓名、评论日期和评分等信息。
标注、翻译和验证
- 未评分的评论被视为未标注。
- 评分1或2的评论被分类为负面,评分3的评论被视为中性,评分4或5的评论被分类为正面。
- 最终数据集包含158,065条标注评论,其中89,371条完全用孟加拉语撰写,其余68,694条用罗马化孟加拉语、英语或混合语言撰写,并被翻译成孟加拉语。
- 翻译结果经过手动审查和验证以确保准确性。




