遇见数据集

lindazeng979/bilingual-babyLM

收藏
Hugging Face2026-05-11 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个合成的双语和语码转换对话数据集,旨在为多语言和语码转换环境中的小型语言模型训练和评估提供支持。它包含平行英语、西班牙语、句间语码转换(语言在句子或对话轮次间交替)和句内语码转换(英语和西班牙语可能在同一个句子或对话轮次内混合)版本的亲子对话。对话按说话者身份(如母亲或父亲)和对话语境(如家庭或社区)进行分类。

The dataset is a synthetic bilingual and code-switching dialogue dataset designed for training and evaluating small language models in multilingual and code-switched settings. It contains parallel English, Spanish, inter-sentential code-switching, and intra-sentential code-switching versions of parent-child dialogues. Dialogues are categorized by speaker identity and conversational context.

提供机构:
lindazeng979
二维码
社区交流群
二维码
科研交流群
商业服务