homersimpson/opensubtitles_fr
收藏官方服务:
资源简介:
该数据集包含电影相关的元数据和翻译信息,具体包括电影的ID、年份、IMDb ID、字幕ID及其对应的语言(加泰罗尼亚语和法语)。数据集分为训练集、验证集和测试集,分别包含240000、30000和30000个示例。数据集的总下载大小为26004408字节,总大小为36369003字节。
该数据集包含电影相关的元数据和翻译信息,具体包括电影的ID、年份、IMDb ID、字幕ID及其对应的语言(加泰罗尼亚语和法语)。数据集分为训练集、验证集和测试集,分别包含240000、30000和30000个示例。数据集的总下载大小为26004408字节,总大小为36369003字节。
提供机构:
homersimpson原始信息汇总
数据集信息
特征
- id: 数据类型为字符串。
- meta: 结构化数据,包含以下字段:
- year: 数据类型为无符号32位整数。
- imdbId: 数据类型为无符号32位整数。
- subtitleId: 结构化数据,包含以下字段:
- ca: 数据类型为无符号32位整数。
- fr: 数据类型为无符号32位整数。
- sentenceIds: 结构化数据,包含以下字段:
- ca: 数据类型为无符号32位整数序列。
- fr: 数据类型为无符号32位整数序列。
- translation: 数据类型为翻译,支持的语言包括加泰罗尼亚语(ca)和法语(fr)。
数据分割
- train: 包含240000个样本,大小为29095202.4字节。
- validation: 包含30000个样本,大小为3636900.3字节。
- test: 包含30000个样本,大小为3636900.3字节。
数据集大小
- 下载大小: 26004408字节
- 数据集大小: 36369003.0字节
配置
- default: 数据文件路径如下:
- train:
data/train-* - validation:
data/validation-* - test:
data/test-*
- train:



