Egor123213131312/tiny_conversations
收藏资源简介:
--- dataset_info: features: - name: text sequence: string splits: - name: train num_bytes: 327344603 num_examples: 668582 - name: validation num_bytes: 8406146 num_examples: 17144 download_size: 189165954 dataset_size: 335750749 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* --- # Tiny Conversations ## Overview This dataset consists of dialogue samples sourced from two main resources: the **Cornell Movie Dialogs** and the **Taiga TV Series Subtitles**. The dataset primarily contains Russian language dialogues and is designed for various natural language processing tasks such as language modeling, and dialogue systems. ### Sources 1. **Cornell Movie Dialogs**: - **Source**: [Cornell Movie Dialogs](https://github.com/Koziev/NLP_Datasets) - **License**: CC0-1.0 - **Description**: This dataset includes cleaned subtitles from a collection of movie dialogues. Notably, many dialogues are sampled from the middle of conversations. 2. **Taiga TV Series Subtitles**: - **Source**: [Russian Subtitles Dataset](https://github.com/dbklim/Russian_subtitles_dataset) - **License**: Apache-2.0 - **Description**: The dataset is based on the Taiga corpus, specifically from a collection of subtitles across 347 TV series in multiple languages. For this dataset, only the Russian language subtitles were retained.
数据集信息: 特征: - 名称:text 类型:字符串序列 数据划分: - 名称:train(训练集) 字节数:327344603 样本数:668582 - 名称:validation(验证集) 字节数:8406146 样本数:17144 下载大小:189165954 数据集总大小:335750749 配置项: - 配置名称:default 数据文件: - 划分:train 路径:data/train-* - 划分:validation 路径:data/validation-* # 微型对话数据集(Tiny Conversations) ## 概述 本数据集包含两类核心来源的对话样本:康奈尔电影对话语料库(Cornell Movie Dialogs)与泰加电视剧字幕语料库(Taiga TV Series Subtitles)。该数据集以俄语对话为主体,可用于语言建模、对话系统等多种自然语言处理任务。 ### 数据源 1. **康奈尔电影对话语料库(Cornell Movie Dialogs)**: - 来源:[康奈尔电影对话语料库](https://github.com/Koziev/NLP_Datasets) - 许可协议:CC0-1.0 - 描述:该数据集收录了经过清洗处理的电影对话字幕集合,其显著特点是多数对话样本取自对话流程的中间片段。 2. **泰加电视剧字幕语料库(Taiga TV Series Subtitles)**: - 来源:[俄语字幕数据集](https://github.com/dbklim/Russian_subtitles_dataset) - 许可协议:Apache-2.0 - 描述:本数据集基于泰加语料库构建,素材取自覆盖347部影视剧的多语言字幕合集,本数据集仅保留其中的俄语字幕内容。




