遇见数据集

Implicit_ImageEdit_Eval_and_PaternDiscover

收藏
魔搭社区2026-05-03 更新2026-07-15 收录
官方服务:

资源简介:

## 目录结构(一级) ``` PreparedforWrapUp/ Code/ Dataset/ requirement/ ``` --- ## Dataset/(数据与产物) ``` Dataset/ PrimaryOutput/ # 已有输出(按数据源/配置分目录归档) SelectedData/ # 选取/清洗后的数据(含 RealWorld、ReasonEdit) Tools/ # 数据处理小工具(切分、路径替换等) visualization/ # 可视化 HTML + 本地浏览服务 ``` - `Dataset/PrimaryOutput/ExistOutput/` - `gpt4o_high/`、`gpt4o_normal/`、`OmniEdit/`、`ShareGPT/`:按来源/配置归档的“已生成输出/结果”目录(通常体积较大,主要用于回看与对比)。 - `Dataset/SelectedData/RealWorld/` - `Primary/`、`Source/`:原始来源与主版本数据 - `_selected/`、`_pure/`、`_output/`:筛选/清洗/导出后的数据与中间产物 - `_eval_V4/`、`_eval_V5/`:对应评测版本的输入/输出或汇总 - `normalize_punct_batch.jsonl`:批量规范化/清洗相关的配置或记录文件 - `Dataset/SelectedData/ReasonEdit/` - `Output/`:ReasonEdit 流程导出的数据/结果 - `_eval_V5/`:评测相关数据 - `Dataset/Tools/` - `split_csv_by_label.py`:按标签列切分 CSV - `replace_csv_image_path_prefix.py`:批量替换 CSV 中图片路径前缀(便于迁移/镜像路径) - `run_split.sh`:切分示例脚本(**注意**:其中路径可能引用旧工作区位置,使用时请按本目录实际路径调整) - `Dataset/visualization/` - `_View_ALL_*.html`:汇总/对比用的可视化页面(通常可直接打开,但若需要读取“绝对路径文件/图片”,建议用下方 `server.py`) - `server.py`:轻量 HTTP 服务,支持: - 静态资源(HTML/JS/CSS) - `GET /api/text?path=ABS_PATH` 读取文本 - `GET /api/bin?path=ABS_PATH` 读取图片等二进制(自动猜测 Content-Type) - `--allow-prefix` 白名单限制,避免误读全盘 ### 快速使用:启动可视化本地服务 在 `Dataset/visualization/` 目录下: ```bash python3 server.py \ --bind 127.0.0.1 --port 8008 \ --static-dir /mnt/workspace/xiepeixing/WorkSpace/PreparedforWrapUp/Dataset/visualization \ --allow-prefix /mnt/workspace/xiepeixing ``` 然后在浏览器打开 `http://127.0.0.1:8008/`,选择或直接访问某个 `_View_ALL_*.html`。 --- ## requirement/(环境与依赖) ``` requirement/ _EnvSetup/ # 环境迁移、差异分析、requirements 清单 condapack/ # 环境克隆/打包脚本与若干 requirements 变体 ``` - `requirement/_EnvSetup/` - `ppu2_0321_requirements.txt`:一份 requirements 固定版本清单(用于复现) - `PPUbase_pip_list.txt`、`QwenPlusBagel_pip_list.txt`:两套环境 pip 列表 - `analyze_env_diff.py`:环境差异分析脚本 - `migrate_PPUbase_to_QwenPlusBagel.sh`:迁移脚本 - `环境差异分析报告.md`:差异结论(例如新增 `diffusers/openpyxl` 等) - `requirement/condapack/` - `clone*.sh` 与 `BU_package_*.py`:用于环境克隆/打包/备份的辅助脚本 - 多份 `*requirements*.txt`:面向不同机器/约束条件的依赖清单变体 --- ## Code/(训练/评测/基线/调度) ``` Code/ DataProductandEval/ # 数据产出与评测主流程(含 baseline、评测、调度、数据准备等) Finetuning/ # 微调相关(OFT 等) Draft/ # 草稿/备份版本(不保证可直接运行) ``` ### Code/DataProductandEval/ - `00Task/`:任务脚本入口与历史日志(如 `*EditCall*.sh`、模板脚本等) - `PrepareData/`:数据准备工具与流程 - `Baseline/`:多个 baseline 的代码与其各自 README(不同模型/框架各自独立) - `RealWorld/`、`ReasonEdit/`:面向不同数据集/评测范式的评测与工具(`ReasonEdit/Judger/` 下含多版本实现与文档) - `Scheduler/`:**GPU 常驻 + 队列调度 + 代码热更新执行** 的作业调度方案 - 推荐先读:`Code/DataProductandEval/Scheduler/README.md` ### Scheduler(强烈推荐从这里开始看) 该模块通过队列文件投递VLLM作业,调度器用新的子进程执行作业。 - 入口:`Code/DataProductandEval/Scheduler/resident_task.sh` - 文档:`Code/DataProductandEval/Scheduler/README.md` - 队列:`Code/DataProductandEval/Scheduler/queue/{pending,priority,running,done,failed,history}/` - 控制:`Code/DataProductandEval/Scheduler/control/{PAUSE,STOP,INTERRUPT,RELOAD}/` ### Code/Finetuning/ - `ExampleData/TrainImagesforSDOFT.tar.gz`:示例训练图像数据包 - `OFT_for_SD/`:OFT 用于 Stable Diffusion 的示例流程(含 `README.md`) - `OFT_based/`:OFT 的基础实现/实验目录(含数据、预处理、可视化等子模块) --- ## 从哪里开始(建议阅读顺序) 如果你是“接手/复现”视角,建议按下面顺序: 1. `requirement/_EnvSetup/环境差异分析报告.md`:先确认环境与依赖差异 2. `Code/DataProductandEval/Scheduler/README.md`:理解如何常驻占用 GPU 并用队列跑批任务 3. `Dataset/visualization/`:打开 `_View_ALL_*.html` 回看结果(必要时用 `server.py`) 4. 进入具体任务目录(如 `RealWorld/` 或 `ReasonEdit/`)阅读各自模块内的 README/脚本

提供机构:
maas
创建时间:
2026-03-25
二维码
社区交流群
二维码
科研交流群
商业服务