遇见数据集

lightonai/Dolci-Think-SFT-32B-Multilingual

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- license: odc-by task_categories: - text-generation language: - en - fr - de - es - zh - sw tags: - reasoning - chain-of-thought - multilingual - sft pretty_name: Dolci-Think-SFT-32B-Multilingual size_categories: - 1M<n<10M --- # Dolci-Think-SFT-32B-Multilingual `Dolci-Think-SFT-32B-Multilingual` is a large-scale **multilingual long chain-of-thought (CoT) reasoning corpus** spanning **six languages**: English, French, German, Spanish, Chinese, and Swahili. Each sample includes a question, a long-form reasoning trace, and a final answer, **all translated into the target language**, with sequences up to **32,768 tokens**. It is released alongside the paper [**Rethinking the Multilingual Reasoning Gap with Layer Swap**](https://arxiv.org/abs/2605.26735). ## Dataset details - **Source corpus:** [`allenai/Dolci-Think-SFT-32B`](https://huggingface.co/datasets/allenai/Dolci-Think-SFT-32B). - **Languages:** English (source) + 5 translated languages (French, German, Spanish, Chinese, Swahili). - **Samples per language:** ~500k - **Max sequence length:** 32,768 tokens. - **Translation model:** [`google/gemma-3-27b-it`](https://huggingface.co/google/gemma-3-27b-it). ## Per-language statistics The table below reports sample counts and token volumes for each of the six languages. | Language | Samples | Mean tokens / sample | Total tokens | |---|:---:|:---:|:---:| | English | 485,873 | 10,848 | 5.27B | | Chinese | 484,078 | 10,890 | 5.27B | | Spanish | 479,748 | 13,400 | 6.43B | | French | 483,588 | 13,702 | 6.63B | | German | 480,529 | 13,846 | 6.65B | | Swahili | 473,582 | 16,208 | 7.68B | ## Category distribution (English source) The English source mixes seven task categories, dominated by math and code. | Category | % | Mean tokens | |---|:---:|:---:| | Math | 37.93% | 19,369 | | Code | 34.80% | 7,340 | | Instruction-following | 14.31% | 2,310 | | Science | 5.21% | 9,089 | | Safety | 3.98% | 739 | | General chat | 3.55% | 3,076 | | Structured data | 0.21% | 2,228 | ## Models trained on this dataset | Language | Native specialist | English-pivoted specialist | Layer Swap model | |---|---|---|---| | English | [`Qwen3-8B-EN`](https://huggingface.co/lightonai/Qwen3-8B-EN) | — | — | | French | [`Qwen3-8B-FR`](https://huggingface.co/lightonai/Qwen3-8B-FR) | [`Qwen3-8B-FR-Pivot-EN`](https://huggingface.co/lightonai/Qwen3-8B-FR-Pivot-EN) | [`Qwen3-8B-FR-Swap`](https://huggingface.co/lightonai/Qwen3-8B-FR-Swap) | | German | [`Qwen3-8B-DE`](https://huggingface.co/lightonai/Qwen3-8B-DE) | [`Qwen3-8B-DE-Pivot-EN`](https://huggingface.co/lightonai/Qwen3-8B-DE-Pivot-EN) | [`Qwen3-8B-DE-Swap`](https://huggingface.co/lightonai/Qwen3-8B-DE-Swap) | | Spanish | [`Qwen3-8B-ES`](https://huggingface.co/lightonai/Qwen3-8B-ES) | [`Qwen3-8B-ES-Pivot-EN`](https://huggingface.co/lightonai/Qwen3-8B-ES-Pivot-EN) | [`Qwen3-8B-ES-Swap`](https://huggingface.co/lightonai/Qwen3-8B-ES-Swap) | | Chinese | [`Qwen3-8B-ZH`](https://huggingface.co/lightonai/Qwen3-8B-ZH) | [`Qwen3-8B-ZH-Pivot-EN`](https://huggingface.co/lightonai/Qwen3-8B-ZH-Pivot-EN) | [`Qwen3-8B-ZH-Swap`](https://huggingface.co/lightonai/Qwen3-8B-ZH-Swap) | | Swahili | [`Qwen3-8B-SW`](https://huggingface.co/lightonai/Qwen3-8B-SW) | [`Qwen3-8B-SW-Pivot-EN`](https://huggingface.co/lightonai/Qwen3-8B-SW-Pivot-EN) | [`Qwen3-8B-SW-Swap`](https://huggingface.co/lightonai/Qwen3-8B-SW-Swap) | ## Citation If you find our work helpful, feel free to give us a cite. ```bibtex @misc{lasbordes2026rethinking, title = {Rethinking the Multilingual Reasoning Gap with Layer Swap}, author = {Lasbordes, Maxence and Chatelain, Amélie and Seddah, Djamé}, year = {2026}, eprint = {2605.26735}, archivePrefix= {arXiv}, primaryClass = {cs.CL} } ```

Dolci-Think-SFT-32B-Multilingual is a large-scale multilingual long chain-of-thought (CoT) reasoning corpus spanning six languages: English, French, German, Spanish, Chinese, and Swahili. Each sample includes a question, a long-form reasoning trace, and a final answer, all translated into the target language, with sequences up to 32,768 tokens. It is released alongside the paper Rethinking the Multilingual Reasoning Gap with Layer Swap. The source corpus is allenai/Dolci-Think-SFT-32B, with languages including English (source) plus five translated languages, approximately 500k samples per language, max sequence length of 32,768 tokens, and translation model google/gemma-3-27b-it. The English source mixes seven task categories dominated by math and code, with per-language statistics provided (e.g., English: 485,873 samples, mean tokens 10,848, total tokens 5.27B). Models trained on this dataset include native specialists, English-pivoted specialists, and Layer Swap models for each language.

提供机构:
lightonai
搜集汇总
数据集介绍
lightonai/Dolci-Think-SFT-32B-Multilingual 数据集图片
构建方式
该数据集以allenai/Dolci-Think-SFT-32B英文语料为源,借助google/gemma-3-27b-it翻译模型,将每个样本中的问题、长链推理轨迹与最终答案整体迁移至法语、德语、西班牙语、中文和斯瓦希里语五种目标语言,从而构建一个覆盖六种语言的大规模多语种长链思维推理语料库,每种语言的样本量约50万条,序列长度上限为32768个token。
使用方法
该数据集可直接用于多语种长链思维推理的监督微调训练,研究者既能以单语方式训练某一语言的原生专家模型,也能采用英语枢轴或层交换策略开展跨语言迁移实验。使用时可按语言字段筛选目标语料,或将推理轨迹与最终答案分别提取以适配不同训练目标,并依据任务类别进行数据混合与采样,从而支撑多语种推理能力的评估与模型对比研究。
背景与挑战
背景概述
大规模语言模型在多语言推理场景中的表现差异,长期是跨语言迁移研究的核心关切。既有资源多聚焦英语,非英语语种的思维链数据相对匮乏,尤以低资源语言为甚。2026年,Lasbordes、Chatelain与Seddah发布Dolci-Think-SFT-32B-Multilingual,以allenai/Dolci-Think-SFT-32B为源语料,经gemma-3-27b-it译入法、德、西、中、斯瓦希里五种语言,每种约五十万样本,序列上限三万二千余token。该数据集为检验层级交换等跨语言适配方法提供了可比的多语种长思维链监督信号,亦推动了对多语言推理鸿沟成因的实证探察。
当前挑战
该数据集面向长思维链推理的跨语言迁移问题,其核心挑战在于:如何在不牺牲推理深度与逻辑连贯性的前提下,将英语监督信号有效投射至结构迥异的目标语言。构建过程中,翻译模型需处理高达三万余token的长序列,保持数学与代码等专业内容的语义精确性,避免推理链条在跨语言转换时发生断裂或漂移;不同语种在样本量与平均长度上呈现显著不均衡,斯瓦希里语样本量最低而平均长度最高,折射出低资源语言在长文本生成中的对齐难度。此外,多语种监督能否真正弥合推理能力差距,而非仅复制英语表层模式,仍待进一步验证。
常用场景
经典使用场景
在大规模语言模型的多语言推理能力研究中,该数据集最经典的使用场景在于为六种语言(英语、法语、德语、西班牙语、中文和斯瓦希里语)的监督微调提供长链思维推理语料。每个样本均包含问题、长篇推理轨迹与最终答案,且全部翻译至目标语言,序列长度可达32,768个标记,从而使研究者能够在统一框架下训练和评估模型在多语言环境中的逐步推理表现,尤其适用于数学与代码等复杂任务。
解决学术问题
该数据集直面多语言推理能力不均衡这一长期困扰学术界的难题。过往研究多聚焦于英语推理,其他语言因缺乏高质量长链思维数据而表现显著落后。此数据集通过提供约五十万条每语言的翻译推理样本,使研究者能够系统探究语言迁移、思维链跨语言一致性以及低资源语言(如斯瓦希里语)的推理瓶颈,为缩小多语言推理差距提供了关键的实证基础。
实际应用
在实际应用中,该数据集支撑了多语言推理专用模型的开发,如基于Qwen3-8B的六种语言原生专家模型、英语枢轴模型以及层交换模型。这些模型可部署于跨语言问答、多语言代码生成、数学解题辅助以及安全指令遵循等场景,尤其适用于需要以用户母语进行复杂推理的服务,如多语言教育平台、跨国客户支持与低资源语言信息获取工具。
数据集最近研究
最新研究方向
在多语言推理能力均衡化的前沿探索中,Dolci-Think-SFT-32B-Multilingual数据集正推动着长链思维推理从英语中心向多语言生态的范式迁移。围绕该数据集的最新研究聚焦于“层交换”(Layer Swap)策略,旨在缓解非英语语言在复杂推理任务中的性能鸿沟。相关实验表明,通过将英语推理层的表征与目标语言层进行选择性交换,模型在法语、德语、西班牙语、中文及斯瓦希里语等语言上的数学与代码推理表现显著提升。该方向不仅回应了多语言大模型在低资源场景下的推理公平性议题,也为跨语言思维链的迁移学习与参数高效微调提供了可复用的数据基础设施与评估基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务