遇见数据集

Solenopsisbot-movie-dialogue-qa

收藏
魔搭社区2026-04-28 更新2026-07-15 收录
官方服务:

资源简介:

# Movie Dialogue Q&A Dataset A conversational question-answer dataset extracted from the [Cornell Movie-Dialogs Corpus](https://www.cs.cornell.edu/~cristian/Cornell_Movie-Dialogs_Corpus.html). ## Dataset Details - **Source**: Cornell Movie-Dialogs Corpus (617 movies, 304,713 utterances) - **Total Conversations**: ~70,000 Q&A pairs - **Format**: Chat messages with user/assistant roles - **Multi-turn**: Includes both single-turn and multi-turn conversations ## Dataset Structure ```json { "messages": [ {"role": "system", "content": "You are a helpful assistant."}, {"role": "user", "content": "What time is it?"}, {"role": "assistant", "content": "It's almost midnight."} ], "num_turns": 1, "movie_id": "m42" } ``` ## Usage ```python from datasets import load_dataset dataset = load_dataset("your-username/movie-dialogue-qa") # access examples train = dataset['train'] print(train['messages']) ``` ## Intended Use This dataset is designed for: - Instruction fine-tuning base language models - Training conversational AI systems - Dialogue understanding and generation ## Limitations - Movie dialogue may contain context-dependent references - Quality varies across different movies and genres - Some conversations may be incomplete or lack context ## Citation ```bibtex @inproceedings{danescu-niculescu-mizil-lee:11a, author={Cristian Danescu-Niculescu-Mizil and Lillian Lee}, title={Chameleons in imagined conversations: A new approach to understanding coordination of linguistic style in dialogs}, booktitle={Proceedings of the Workshop on Cognitive Modeling and Computational Linguistics, ACL 2011}, year={2011} } ``` ## License The Cornell Movie-Dialogs Corpus is provided for research purposes. Please refer to the [original corpus](https://www.cs.cornell.edu/~cristian/Cornell_Movie-Dialogs_Corpus.html) for licensing information. ```

提供机构:
maas
创建时间:
2026-02-26
二维码
社区交流群
二维码
科研交流群
商业服务