遇见数据集

avramandrei/RoIt-XMASA

收藏
Hugging Face2026-03-21 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - ro - it license: cc-by-4.0 task_categories: - text-classification task_ids: - sentiment-classification pretty_name: RoIt-XMASA size_categories: - 100K<n<1M tags: - sentiment-analysis - cross-lingual - cross-domain - romanian - italian - reviews --- # RoIt-XMASA **Romanian–Italian Cross-domain Multi-domain Sentiment Analysis** RoIt-XMASA is a multilingual, cross-domain sentiment analysis dataset containing user reviews in Romanian (RO) and Italian (IT) across three domains: Books, Movies, and Music. Reviews are annotated with 1–5 star ratings (excluding 3). ## Dataset Summary | Split | Rows | Labeled | |------------|---------|---------| | train | 12,000 | yes | | validation | 12,000 | yes | | test | 12,000 | yes | | unlabeled | 202,141 | no | ### Splits breakdown (labeled) Each labeled split is perfectly balanced: - **Domains**: 4,000 reviews per domain (Books / Movies / Music) - **Languages**: 6,000 reviews per language (RO / IT) ## Data Fields | Field | Type | Description | |------------|--------|---------------------------------------------------| | `id` | int64 | Unique review identifier | | `title` | string | Review title (may be empty) | | `text` | string | Review body | | `domain` | string | Domain: `Books`, `Movies`, or `Music` | | `language` | string | Language code: `RO` (Romanian) or `IT` (Italian) | | `rating` | int64 | Star rating: 1, 2, 4, or 5 (null for unlabeled) | ## Usage ```python from datasets import load_dataset ds = load_dataset("avramandrei/RoIt-XMASA") # Labeled splits train = ds["train"] val = ds["validation"] test = ds["test"] # Filter by language or domain ro_books = train.filter(lambda x: x["language"] == "RO" and x["domain"] == "Books") ```

--- language: - 罗马尼亚语 - 意大利语 license: cc-by-4.0 task_categories: - 文本分类(text-classification) task_ids: - 情感分类(sentiment-classification) pretty_name: RoIt-XMASA size_categories: - 100K<n<1M tags: - 情感分析(sentiment-analysis) - 跨语言(cross-lingual) - 跨领域(cross-domain) - 罗马尼亚语 - 意大利语 - 评论 --- # RoIt-XMASA **罗马尼亚语-意大利语跨域多领域情感分析** RoIt-XMASA是一个多语言跨域情感分析数据集,涵盖罗马尼亚语(RO)与意大利语(IT)的用户评论,涉及书籍、电影、音乐三大领域。所有评论均标注1至5星评分(不含3星)。 ## 数据集概览 | 拆分集 | 样本量 | 是否标注 | |------------|---------|---------| | 训练集 | 12,000 | 是 | | 验证集 | 12,000 | 是 | | 测试集 | 12,000 | 是 | | 未标注集 | 202,141 | 否 | ### 标注样本拆分详情 每个标注拆分集均实现完美样本平衡: - **领域维度**:每个领域(书籍、电影、音乐)各含4000条评论 - **语言维度**:每种语言(RO、IT)各含6000条评论 ## 数据字段 | 字段名 | 数据类型 | 描述说明 | |------------|---------|---------------------------------------------------| | `id` | int64 | 唯一评论标识符 | | `title` | string | 评论标题(可留空) | | `text` | string | 评论正文 | | `domain` | string | 所属领域:`Books`(书籍)、`Movies`(电影)或`Music`(音乐) | | `language` | string | 语言代码:`RO`(罗马尼亚语)或`IT`(意大利语) | | `rating` | int64 | 星级评分:1、2、4或5(未标注样本为null) | ## 使用方法 python from datasets import load_dataset ds = load_dataset("avramandrei/RoIt-XMASA") # Labeled splits train = ds["train"] val = ds["validation"] test = ds["test"] # Filter by language or domain ro_books = train.filter(lambda x: x["language"] == "RO" and x["domain"] == "Books")

提供机构:
avramandrei
二维码
社区交流群
二维码
科研交流群
商业服务