遇见数据集

saudi-llm

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集基于Apache-2.0许可证,任务类别为文本生成,适用于大规模语言模型的训练和评估。

The dataset is licensed under Apache-2.0, the task category is text generation, and it is suitable for training and evaluation of large-scale language models.

创建时间:
2026-08-13
原始信息汇总

Saudi-LLM 数据集概述

基本信息

  • 许可证:Apache-2.0
  • 任务类型:文本生成(text-generation)
  • 标签:saudi-llm、codebase、vast-ai

数据集性质

该数据集是 vast.ai 云端 GPU 实例(pod)的公共 Hugging Face 镜像仓库,主要托管与 Saudi-LLM 模型训练、评估及部署相关的脚本、配置文件和工具代码。

核心工作流说明

生产环境(direct 合并方案)

  • 基础模型:unsloth/Qwen3.5-4B
  • 适配器:aziz9788/qwen35-saudidraft-full-final-adapter(lora_alpha=22)
  • 训练方式:使用 transformers + PEFT bf16 LoRA,不依赖 Unsloth 或 bitsandbytes
  • 推荐硬件:CUDA 13 + vLLM、RTX PRO 6000(96GB)

端到端测试(checkpoint-1650)

  • 默认基础模型:SaudF/qwen35-4b-sft-rebuild-v1
  • 默认检查点:checkpoint-1650,lora_alpha=22
  • 执行流程:合并 → 基准测试 → 身份 SFT → 基准测试 → 生成对比 Excel → 推送合并模型

关键流程步骤

  1. 合并流程:将 LoRA 适配器合并到 unsloth/Qwen3.5-4B(特定提交版本),或直接复制已合并的完整模型
  2. 身份 SFT:使用 SFT/scripts/run_identity_replay_winner.sh 脚本(r32/alpha32、3 个 epoch、学习率 1e-5、5% 回放、合并缩放 1.0、禁用思考模式)
  3. 评估:使用 RTX PRO 6000 vLLM 配置(GPU 利用率 0.92、max_num_seqs 512、max_num_batched_tokens 65536、最大长度 16384)
  4. 结果输出:生成三个 Excel 工作簿(结果、失败、身份差异对比)
  5. 模型推送:评估完成后将合并的身份模型上传至 Hugging Face

环境配置要点

  • 必须使用 CUDA 13 镜像,不可使用 CUDA 12
  • vLLM 版本固定为 0.25.1,不建议升级
  • 安装依赖使用 uv,基于 pod 现有的 /venv/main Python 环境
  • 不重新安装 Torch、vLLM、CUDA

相关脚本与资源

  • dialect/vast/run_identity_then_eval.sh:身份训练与评估流程
  • dialect/vast/run_fresh_pod_e2e_recipe_direct.sh:全新 pod 直接合并端到端流程
  • dialect/vast/run_fresh_pod_e2e_checkpoint1650.sh:checkpoint-1650 端到端测试
  • dialect/vast/push_direct_merged_hf.sh / push_identity_merged_hf.sh:模型推送脚本
  • RL/DPO/scripts/run_pod_final_suite_opd_v5.sh:本地评估脚本
  • RL/DPO/scripts/run_pod_reasoning_native_opd_v5_legacyfix.sh:原生推理脚本

评估模式

  • 直接/似然评估:使用顶层 vLLM,禁用思考模式(enable_thinking=False)
  • 原生推理:采用先思考后回答的两阶段解码(think-then-answer)
搜集汇总
数据集介绍
saudi-llm 数据集图片
构建方式
该数据集是作为vast.ai pod的公共Hugging Face镜像而构建的,其核心在于提供一套完整的训练与评估流水线脚本。构建方式涉及多个层次的整合:从基础的LoRA适配器微调,到全模型合并,再到身份SFT(Supervised Fine-Tuning)与评估阶段。具体而言,数据集内嵌了如`run_identity_then_eval.sh`、`run_fresh_pod_e2e_ecipe_direct.sh`等自动化脚本,这些脚本通过Hugging Face Hub下载并执行,涵盖了模型合并(如将`unsloth/Qwen3.5-4B`与`aziz9788/qwen35-saudidraft-full-final-adapter`合并)、基准测试、身份微调(采用transformers与PEFT的bf16 LoRA)以及前后评估结果的Excel报告生成。整个流程旨在高效利用RTX PRO 6000 GPU资源,遵循CUDA 13与vLLM的标准配置,确保可复现性与工程严谨性。
特点
数据集的主要特点在于其高度的工程化与自动化水平,它不仅仅是一组静态数据,而是一个动态的训练与评估框架。其特色包括:支持直接合并(direct merge)与分阶段合并(merge-only模式),提供了从LoRA适配器到全模型合并的灵活路径;内置身份SFT流程,通过特定参数(如rank=32, alpha=32, 3个epochs)针对特定任务进行优化;集成了详细的评估套件,能够生成前后对比的Excel报告,便于分析模型性能变化;此外,数据集中的脚本对运行环境有严格要求(如CUDA 13、vLLM版本限制),体现了对生产级可靠性的追求,同时通过环境变量(如`HF_TOKEN`、`ADAPTER_HF`)允许用户自定义配置,增强了灵活性。
使用方法
使用该数据集时,用户需先拥有Hugging Face的访问令牌(HF_TOKEN),并通过Python脚本调用`hf_hub_download`或`snapshot_download`获取所需的脚本或文件。根据目标,用户可选择运行不同的端到端流水线脚本,如`run_fresh_pod_e2e_ecipe_direct.sh`(用于直接合并)或`run_fresh_pod_e2e_checkpoint1650.sh`(用于基于checkpoint-1650的全面测试)。这些脚本会自动处理模型合并、基准测试、身份微调、评估与模型上传。对于仅需评估的场景,可通过设置环境变量(如`USE_LOCAL_EVAL=1`、`SKIP_MERGE=1`)跳过合并步骤。数据集特别强调在具备RTX PRO 6000与CUDA 13的环境下运行,并提示保持vLLM版本不变,以确保兼容性。所有脚本均需在Linux环境下执行,且需去除Windows行尾符(CRLF)以保证正确运行。
背景与挑战
背景概述
Saudi-LLM数据集由aziz9788等研究人员于2025年创建,旨在推动阿拉伯语大语言模型的发展,特别是在沙特阿拉伯方言处理上。该数据集依托HuggingFace平台发布,集成了大量阿拉伯语文本与代码,用于微调如Qwen3.5-4B等基础模型,以提升其在阿拉伯语场景下的指令跟随与生成能力。其核心研究问题在于如何利用有限的高质量方言数据,通过LoRA等参数高效微调技术,构建出在阿拉伯语基准测试中表现优异的模型。该数据集的出现,为阿拉伯语NLP社区提供了宝贵的资源,促进了多语言模型在低资源语言上的性能提升,对区域语言技术发展具有重要影响力。
当前挑战
Saudi-LLM数据集所面临的挑战涉及多个层面。在领域问题层面,阿拉伯语及其方言的丰富形态与句法差异,使得通用多语言模型难以精准捕捉沙特方言的独特表达,加之高质量注释数据稀缺,模型易出现过拟合或泛化不足。在构建过程中,团队需处理复杂的分布式计算环境,如基于vast.ai的GPU集群配置,以及不同CUDA版本与vLLM的兼容性问题,同时要平衡模型合并、评估与微调的多阶段流程,确保各环节的无缝衔接。此外,数据集的实时更新与版本管理,以及伦理合规性考量,也是持续存在且亟待解决的挑战。
常用场景
经典使用场景
沙特阿拉伯语大语言模型(Saudi-LLM)数据集作为一个综合性代码库与模型微调资源,其核心使用场景在于为阿拉伯语方言(尤其是沙特阿拉伯方言)的自然语言处理任务提供端到端的模型训练与评估流水线。该数据集集成了从基座模型选择(如unsloth/Qwen3.5-4B)、低秩适配(LoRA)合并、身份指令微调(Identity SFT)到多阶段基准测试的完整工具链,并适配于特定硬件(如RTX PRO 6000)与推理框架(vLLM),使得研究者能够在统一框架下复现和优化针对该方言的生成式语言模型。
衍生相关工作
基于该数据集所衍生的相关工作集中在方言迁移学习、模型压缩与高效推理的交叉领域。其公开的LoRA合并与身份微调交互流程,启发了对于参数高效微调(PEFT)技术在方言模型上鲁棒性的深入探讨,并促使研究者探索不同基座模型(如Qwen系列)在阿拉伯语上的适应性迁移。后续工作可能包括基于该数据集的扩展版本,用于多方言统一建模、跨语言知识蒸馏,或是将其中验证过的评估方法论应用于其他低资源语种,从而形成一套可推广的方言NLP研究范式。
数据集最近研究
最新研究方向
当前,沙特阿拉伯正积极推动阿拉伯语大语言模型的自主研发,以增强本国在人工智能领域的主权与竞争力。该数据集聚焦于沙特方言的LoRA微调与身份对齐,采用Qwen3.5-4B作为基座模型,通过两阶段SFT与DPO训练,在保持推理能力的同时强化模型对沙特文化背景的应答。研究前沿包括基于vLLM的高效推理部署、LoRA融合策略优化,以及针对阿拉伯语评估基准(如AraIFEval)的系统性评测。其意义在于为低资源语言的大模型本土化提供可复现的工程范式,并推动阿拉伯语NLP技术从通用向地域化、精细化方向发展,对构建阿拉伯世界自主可控的AI生态具有重要战略价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务