遇见数据集

Qwen3.5-2B-Text2SQL

收藏
魔搭社区2026-08-15 更新2026-08-23 收录
官方服务:

资源简介:

# Text2SQL 训练与评测数据 本数据集用于复现 `Qwen3.5-2B-Text2SQL` 的 reasoning SFT、execution-guided PPO 和 SQL-Mix benchmark 评测。项目基于 DeepRetrieval 改造,统一使用 Bird、Spider 和 WikiSQL 三个 Text-to-SQL 任务。 对应资源: - 模型:[Dingawa/Qwen3.5-2B-Text2SQL](https://www.modelscope.cn/models/Dingawa/Qwen3.5-2B-Text2SQL) - 数据集:[Dingawa/Qwen3.5-2B-Text2SQL](https://www.modelscope.cn/datasets/Dingawa/Qwen3.5-2B-Text2SQL) - 代码仓库:[Lanerawa/Text2SQL_Based_Qwen3.5-2B](https://github.com/Lanerawa/Text2SQL_Based_Qwen3.5-2B) ## 文件说明 ```text text2sql-sft-v1.tar.zst text2sql-ppo-v2.tar.zst text2sql-evaluation-v1.tar.zst SHA256SUMS ``` ### `text2sql-sft-v1.tar.zst` 包含三组 reasoning SFT 源数据: ```text sft/bird_reason_sft_train.jsonl sft/spider_reason_sft_train.jsonl sft/wikisql_reason_sft_train.jsonl ``` 三组数据共 24,811 条原始记录。SFT 训练脚本会依次完成格式校验、拒答和低质量 reasoning 过滤、2,048 token 长度过滤,再按任务等量保留 8,000 条。因此最终用于 SFT 的数据为 24,000 条,其中 23,520 条训练、480 条验证。 SFT 的 480 条验证样本由训练脚本使用 `seed=42` 和 `eval_ratio=0.02` 动态划分,未 单独保存为文件。使用相同参数运行项目中的 SFT 脚本即可得到相同划分。 ### `text2sql-ppo-v2.tar.zst` 包含正式 PPO 使用的数据: ```text ppo/train.parquet # 6,000 条 PPO 训练数据 ppo/val.parquet # 300 条 PPO validation 数据 ppo/manifest.json # 任务配额、哈希和数据构建信息 ``` 训练任务配额为 Bird/Spider/WikiSQL = `2100/2100/1800`,PPO validation 为 `100/100/100`。PPO 数据按难度和 rollout 审计结果采样,包含 `sample_fingerprint` 用于检查数据重叠。 ### `text2sql-evaluation-v1.tar.zst` 包含模型评估数据: ```text evaluation/checkpoint_selection_300.parquet evaluation/heldout_benchmark_2700.parquet evaluation/source_manifest.json ``` 其中: - `checkpoint_selection_300.parquet`:Bird、Spider、WikiSQL 各 100 条,用于比较 PPO step 75、150、225、300 并选择最终 checkpoint; - `heldout_benchmark_2700.parquet`:三个任务各 900 条,只用于最终正式评测; - 两部分合计 3,000 条,任务之间没有重叠。 checkpoint 选择集与 PPO validation 不是同一份数据,不能混用。 ## 下载与校验 下载三个压缩包后,在同一目录执行: ```bash sha256sum -c SHA256SUMS ``` 校验通过后解压: ```bash tar --zstd -xf text2sql-sft-v1.tar.zst tar --zstd -xf text2sql-ppo-v2.tar.zst tar --zstd -xf text2sql-evaluation-v1.tar.zst ``` ## SQLite 数据库说明 本数据包**不包含 SQLite 数据库文件**。Parquet 文件中的 `extra_info.db_path` 保留了项目运行时的相对路径,因此这些文件可以直接用于查看 prompt、训练 SFT 和构建数据,但不能单独完成: - PPO 的 SQL execution reward; - benchmark 的 execution accuracy; - 依赖真实数据库内容的执行评测。 如需完整复现实验,请按照项目代码中的数据准备说明下载并解压官方数据集,然后保持 以下目录结构: ```text data/raw_data/bird/ data/raw_data/spider/ data/raw_data/wikisql/ ``` 官方来源: - Bird:<https://bird-bench.github.io/> - Spider:<https://yale-lily.github.io/spider> - WikiSQL:<https://github.com/salesforce/WikiSQL> 公开数据库前请分别确认 Bird、Spider 和 WikiSQL 的再分发条款。本仓库不将原始数据 集的许可证合并为一个新的许可证。 ## 数据格式 SFT JSONL 的 `new_prompt` 字段包含统一的 system/user/assistant 消息。模型输出协议 为: ```text <think> [reasoning process] </think> <answer> { "sql": "SELECT ..." } </answer> ``` PPO 和 benchmark Parquet 包含问题、schema prompt、gold SQL、任务名、样本指纹、难度 标签以及数据库路径等字段。SQL 方言为 SQLite,正式评测只接受只读查询。 ## 许可证与致谢 其中的 reasoning 数据为本项目基于公开 Text-to-SQL 数据和教师模型生成的派生数据。 使用原始 Bird、Spider、WikiSQL 数据时,请同时遵守各数据集的许可证、署名和使用条款。 本数据包不授予超出原始数据集许可证范围的权利。

提供机构:
maas
创建时间:
2026-08-15
二维码
社区交流群
二维码
科研交流群
商业服务