SYNTH Initiative Multilingual Open Data Corpus
收藏资源简介:
SYNTH计划旨在通过创建一个尖端的开源数据语料库来解决开源AI开发中的关键空白,用于训练主权AI模型和高级AI代理。这涉及策划许可许可的高质量多语言数据集,重点关注代表性不足的语言,并生成专门设计用于增强这些语言前沿推理能力的合成数据。最终使命是通过培育支持复杂AI系统完整训练流程的包容性数据生态系统,实现全球对高级AI推理的访问,从而减少对专有数据和封闭模型的依赖。
The SYNTH Program aims to address critical gaps in open-source AI development by creating a cutting-edge open-source data corpus for training sovereign AI models and advanced AI Agents. This involves curating high-quality, properly licensed multilingual datasets with a focus on underrepresented languages, and generating synthetic data specifically designed to enhance the state-of-the-art reasoning capabilities of these languages. Its ultimate mission is to democratize global access to advanced AI reasoning and reduce reliance on proprietary data and closed-source models, by fostering an inclusive data ecosystem that supports the full training pipeline for complex AI systems.
SYNTH 倡议数据集概述
数据集定位
终极合成多语言开放数据语料库,面向前沿主权AI模型和智能体应用
核心问题
当前开源AI开发存在根本性不对称,从基础模型向前沿系统和卓越智能体应用过渡需要专门数据集:
- 中期训练:领域特定、多模态、高质量数据
- 强化学习:培养高级推理能力的数据
- 前沿推理开发:复杂推理链、逻辑推理模式和系统问题分解的高质量示例
主要目标
1. 精选许可授权的种子集合
- 识别和聚合具有许可授权的卓越质量、多语言、领域特定数据集
- 重点关注东欧、亚洲、非洲等地区代表性不足的语言
- 基于Pleias的Common Corpus等基础资源进行扩展
2. 为多语言前沿推理模型生成合成数据
- 开发系统方法创建高质量合成数据集
- 专门针对多种语言(特别是资源较少语言)的高级推理能力
- 利用多样化、高质量的多语言开放种子数据
3. 支持主权AI和智能体应用开发
- 创建必要的数据基础设施
- 开发具有文化语言对齐性的先进AI模型和智能体
- 在母语中提供强大的推理能力
预期影响
- 提供开源AI开发中缺失的关键环节
- 将基础模型转变为前沿级推理系统所需的专门高质量数据集
- 确保整个流程中的许可授权
- 支持全球研究人员、组织和地区构建、审计和定制AI系统
技术特点
- 支持模型预训练和高级训练技术的完整数据生态系统
- 技术上先进且全球包容的复杂推理能力AI系统
- 减少对专有数据和封闭模型的依赖
许可信息
- 代码贡献:Apache 2.0许可证
- 文档贡献:知识共享署名4.0国际许可
- 数据贡献:社区数据许可协议-宽松-2.0版
项目文档
完整文档发布于:https://the-ai-alliance.github.io/SYNTH-initiative/




