ltx23-refiner-solattn-highres
收藏官方服务:
资源简介:
该数据集是一个用于演示视频质量增强(超分辨率)模型LTX-2.3 Refiner性能的高分辨率视频示例集合。核心数据内容为一段时长约7.56秒(121帧,16帧/秒)的视频,其原始低质量(LQ)输入和经过不同注意力机制(密集注意力与块稀疏SOL-Attention)处理后的增强版本均以2688×1792像素(4.8兆像素)的高分辨率提供。数据规模体现为一个关键的处理序列长度指标,即T=75,264个tokens,这对应于处理该段高分辨率视频所需的计算单元数量。该数据集主要用于比较不同注意力机制在高质量视频增强任务中的处理速度、计算效率和输出保真度,适用于视频超分辨率、质量修复等计算机视觉任务的研究与模型性能评估。
创建时间:
2026-07-24
原始信息汇总
数据集概述:LTX-2.3 Refiner — high-res SOL-Attention demo (last tier: 2688×1792, T=75k)
这是一个用于视频质量增强的精炼器(refiner)演示数据集,基于LTX-2.3模型(22B参数,23步调度),在2688×1792分辨率(4.8百万像素,121帧,16 fps)下运行。主要对比了块稀疏SOL-Attention与密集注意力(dense attention)的性能,单卡H100运行。
视频内容
- sidebyside_1792_input_dense_sol.mp4:并排对比:输入(低质量)| 密集注意力精炼结果 | SOL-Attention精炼结果(1.59倍加速)
- cropzoom_dense_vs_sol.mp4:中心裁剪原生像素对比:密集注意力 vs SOL-Attention细节差异
- fullres_SOL_refined_2688x1792.mp4:全分辨率SOL-Attention输出
- fullres_INPUT_lq_2688x1792.mp4:全分辨率低质量输入(已升采样)
性能数据(1× H100,单视频,T = 75,264 tokens)
| 指标 | 密集注意力 | SOL-Attention(密度0.15) |
|---|---|---|
| 去噪/采样时间 | 689.2秒 | 434.6秒 → 1.59倍加速 |
- 保真度:潜在空间余弦相似度(SOL, dense)= 0.946;像素PSNR-y ≈ 27.5 dB
- 注意力占比:在该序列长度下约为57%
加速效果与分辨率/时长关系
SOL-Attention加速比随分辨率/时长变化:0.88倍 @ T=11.6k → 1.08倍 @ 26k → 1.22–1.45倍 @ 48k → 1.59倍 @ 75k。单H100上限约为75k tokens(T=98k时内存溢出);约2倍加速需要多GPU上下文并行。
搜集汇总
数据集介绍

构建方式
本数据集专为视频质量增强任务设计,基于LTX-2.3 22B参数量的精炼模型构建,采用23步调度策略,在2688×1792分辨率下运行,支持121帧视频以16帧/秒的帧率处理。数据集的核心构建围绕块稀疏的SOL-Attention机制与标准密集注意力机制的对比展开,通过单张H100 GPU生成四类视频样本:包含输入低质量与两种精炼输出的并排对比、原生像素级的中心裁剪细节对比、全分辨率SOL-Attention精炼结果及对应的低质量输入,形成了T=75,264 token的完整评估序列。
特点
该数据集的显著特色在于其高分辨率与长序列的处理能力,在4.8百万像素下实现了121帧视频的并行注意力机制对比。SOL-Attention以0.15的稀疏密度运行,相较于密集注意力在75k token长度下获得1.59倍的加速,同时保持极高的保真度,潜在空间余弦相似度达0.946,像素级PSNR-Y值约27.5 dB。注意力计算占比随序列长度增长而上升,在此序列长度下约占57%,充分展现了SOL-Attention在大规模视觉任务中的效率优势。
使用方法
使用者可直接下载四组已生成的视频文件,包括并排对比(sidebyside_1792_input_dense_sol.mp4)、像素级细节缩放对比(cropzoom_dense_vs_sol.mp4)、全分辨率SOL-Attention输出(fullres_SOL_refined_2688x1792.mp4)及对应低质量输入(fullres_INPUT_lq_2688x1792.mp4),用于视觉质量评估与注意力机制性能分析。数据集附带的性能数据表提供了单张H100上的推理时间对比,支持研究者按需复现加速比与保真度指标,并可作为高分辨率视频精炼任务的基准测试集。
背景与挑战
背景概述
在高分辨率视频增强与生成领域,随着模型参数规模与序列长度的急剧膨胀,传统全注意力机制面临计算开销激增的瓶颈。该数据集基于LTX-2.3 Refiner模型(22B参数,23步调度),由研究机构于2024年发布,聚焦于2688×1792超高分辨率视频的质量提升,核心研究问题在于如何利用块稀疏SOL-Attention机制替代密集注意力,以在单张H100 GPU上高效处理高达75k令牌的序列。该工作通过对比实验展示了SOL-Attention在保持高保真度(像素PSNR-y约27.5 dB,潜在余弦相似度0.946)的同时,实现了1.59倍加速,对高分辨率视频增强的实时应用具有重要推动作用。
当前挑战
当前数据集所解决的核心领域挑战在于超高分辨率视频增强中的计算效率与质量平衡问题:传统密集注意力随分辨率与时长呈二次增长,在2688×1792、121帧、16fps的视频上,单GPU处理75k令牌的推理时间高达689.2秒,远无法满足实际应用需求。构建过程中的挑战包括:设计稀疏注意力模板以在密度0.15下维持重建保真度,避免因注意力稀疏化引入的细节损失;处理令牌数超过单GPU显存上限(98k令牌导致内存溢出)时的极致内存优化;以及验证SOL-Attention加速比随序列长度缩放的非线性特性(从0.88×到1.59×),为多GPU上下文并行方案提供基准。
常用场景
经典使用场景
在视频质量增强领域,高分辨率与高帧率的实时处理一直是技术攻坚的难点。该数据集专为视频质量提升的精炼器(refiner)设计,聚焦于将低质量视频源(如压缩伪影严重或分辨率不足的素材)复原至2688×1792超高分辨率,并保持121帧、16帧/秒的流畅度。其经典使用场景涵盖影视后期修复、监控视频增强及高清直播内容优化,尤其适合需要在单张H100显卡上高效运行的场景,通过对比密集注意力与稀疏块状SOL-Attention机制,验证了在超长序列(T=75,264 tokens)下加速1.59倍的显著优势。
实际应用
在实际应用中,该数据集支撑着影视工业中的超高清内容生产、远程视频会议的实时画质优化以及安防监控的细节增强。例如,电影后期团队可利用其精炼器将老胶片素材快速提升至4K以上分辨率,同时保持运动流畅;直播平台能通过单卡加速实现低延迟的边缘侧画质渐进式增强。此外,其在单H100显卡上处理的极限序列长度(≈75k tokens)为短视频平台的大规模视频增强提供了低硬件门槛的解决方案,而稀疏注意力带来的1.5倍以上速度提升直接转化为更低的云服务成本与更快的用户响应。
衍生相关工作
该数据集衍生了多项开创性工作,例如基于SOL-Attention的多GPU上下文并行方案,突破了单卡约75k tokens的瓶颈,使处理98k以上序列成为可能;后续研究进一步将稀疏注意力与扩散模型结合,提出了时序一致性增强的视频精炼框架。此外,该数据集对比的密集注意力与稀疏注意力结果被用作基准,催生了混合注意力机制(如分层稀疏化与动态密度调度)的探索,以及面向可变分辨率视频的归一化序列长度方案,推动了视频质量增强领域从实验室走向大规模工业部署的进程。
以上内容由遇见数据集搜集并总结生成



