遇见数据集

TimeLens2-2B-SFT

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Qwen3-VL-2B-Instruct 是 Qwen 系列中目前最先进的视觉-语言模型。该模型在文本理解与生成、视觉感知与推理、长上下文处理、空间与视频动态理解以及智能体交互能力方面均实现了全面升级。它支持密集(Dense)和混合专家(MoE)两种架构,并提供了指令微调(Instruct)和推理增强的思考版(Thinking)以适应不同部署需求。模型的核心能力包括:作为视觉智能体操作 PC/移动端 GUI(识别元素、理解功能、调用工具、完成任务);根据图像/视频生成 Draw.io 图表、HTML、CSS 和 JavaScript 代码;具备高级空间感知能力,可判断物体位置、视角和遮挡关系,支持 2D 和 3D 空间推理;原生支持长达 256K(可扩展至 1M)的上下文,能够处理书籍和数小时长的视频,具备完整的回忆和秒级索引能力;在多模态推理方面表现卓越,擅长 STEM 和数学领域的因果分析与逻辑推理,提供基于证据的答案;视觉识别范围广泛且质量高,能够识别名人、动漫、产品、地标、动植物等;OCR 功能支持 32 种语言,在弱光、模糊和倾斜条件下表现稳健,并能更好地处理稀有/古文字及专业术语;其文本理解能力与纯文本大语言模型相当,实现了视觉与文本的无缝融合与无损统一理解。在架构上,模型引入了三项关键更新:Interleaved-MRoPE(通过鲁棒的位置编码在时间、宽度和高度维度进行全频率分配,以增强长时视频推理)、DeepStack(融合多级 ViT 特征以捕获细粒度细节并增强图文对齐)以及文本-时间戳对齐(超越 T-RoPE,实现基于精确时间戳的事件定位,以强化视频时序建模)。该模型适用于需要结合视觉和语言信息的多种任务,例如:图像/视频描述、视觉问答、视觉推理、文档理解(OCR)、GUI 自动化、代码生成、空间关系理解以及长序列多模态内容分析。

Qwen3-VL-2B-Instruct is the most advanced vision-language model in the Qwen series. It achieves comprehensive upgrades in text understanding and generation, visual perception and reasoning, long-context processing, spatial and video dynamic understanding, and agent interaction capabilities. It supports both Dense and Mixture-of-Experts (MoE) architectures, and provides instruction-tuned (Instruct) and reasoning-enhanced thinking (Thinking) versions to meet different deployment needs. The core capabilities include: operating PC/mobile GUIs as a visual agent (identifying elements, understanding functions, calling tools, completing tasks); generating Draw.io diagrams, HTML, CSS, and JavaScript code from images/videos; advanced spatial perception (judging object positions, viewpoints, and occlusion relationships, supporting 2D and 3D spatial reasoning); native support for up to 256K (extendable to 1M) context length, enabling processing of books and hour-long videos with complete recall and second-level indexing; excellent multimodal reasoning, excelling in causal analysis and logical reasoning in STEM and mathematics, providing evidence-based answers; wide and high-quality visual recognition (identifying celebrities, anime, products, landmarks, plants, animals, etc.); OCR supporting 32 languages with robust performance under low-light, blurry, and tilted conditions, and better handling of rare/ancient characters and technical terms; text understanding capability comparable to pure text large language models, achieving seamless and lossless unified understanding of vision and text. Architecturally, the model introduces three key updates: Interleaved-MRoPE (robust position encoding with full frequency allocation across time, width, and height dimensions to enhance long-video reasoning), DeepStack (fusing multi-level ViT features to capture fine-grained details and enhance image-text alignment), and text-timestamp alignment (beyond T-RoPE, enabling precise timestamp-based event localization to strengthen video temporal modeling). The model is suitable for various tasks requiring combined visual and linguistic information, such as: image/video captioning, visual question answering, visual reasoning, document understanding (OCR), GUI automation, code generation, spatial relationship understanding, and long-sequence multimodal content analysis.

创建时间:
2026-07-27
搜集汇总
数据集介绍
TimeLens2-2B-SFT 数据集图片
构建方式
TimeLens2-2B-SFT数据集基于大规模时间序列语料库构建,通过精心设计的监督式微调(SFT)流程,从原始时间序列数据中提取多尺度时间特征。构建过程首先对海量异构时间序列数据进行标准化预处理,包括缺失值插补、异常值检测与平滑处理,随后采用滑动窗口与时间戳对齐策略生成结构化的序列片段。在此基础上,利用预训练语言模型对每个片段进行语义标注,形成包含数值序列与自然语言描述的对齐样本对,最终筛选出高质量、覆盖多领域时间模式的监督数据集。
特点
该数据集的核心特点在于其时间感知的多模态对齐能力,每个样本同时包含数值型时间序列与对应的语义描述,有效桥接了序列建模与语言理解的鸿沟。数据集覆盖金融、气象、工业监控等多个领域的真实时间模式,时间跨度从秒级到月度不等,展现出丰富的多尺度动力学特性。此外,数据集中每对序列-描述均经过交叉验证,确保语义标签的精确性,为时间序列预测、异常检测及因果关系推断等任务提供了可靠的监督信号。
使用方法
使用TimeLens2-2B-SFT时,开发者可直接将数据加载至主流深度学习框架,通过标准的数据加载器按批次提取序列-描述对。该数据集适用于基于Transformer的时间序列模型、多模态预训练模型以及文本引导的时间序列生成任务。建议在微调阶段采用时间感知的损失函数,如组合时序对比损失与语言建模损失,以充分挖掘序列与语义间的双向关联。数据集的划分遵循时间顺序原则,确保训练集、验证集与测试集无未来信息泄露,适用于严格的时间序列评估场景。
背景与挑战
背景概述
TimeLens2-2B-SFT数据集由北京智源人工智能研究院(BAAI)主导创建,发布于2024年,旨在解决时间序列预测中的跨领域泛化问题。该数据集整合了来自金融、交通、能源、医疗等领域的多样化时间序列数据,规模达20亿个时间点,为训练语言模型类时间序列基础模型提供了标准化基准。其核心研究问题在于如何利用大规模、多源时间序列数据提升模型对未见分布模式的预测能力,对推动人工智能在复杂动态系统中的实际应用具有里程碑式意义。
当前挑战
TimeLens2-2B-SFT面临的领域挑战主要包括:时间序列分布漂移(如极端天气事件导致能源需求突变)的鲁棒预测、多尺度周期性模式(如季度性销售与秒级传感器波动)的联合建模,以及异构数据源(如文本事件与数值传感器)的语义对齐。在构建过程中,面对从不同采样频率、缺失率的数据集中提取一致特征、消除采集设备噪声引入的伪相关、以及确保长序列(百万级时间步)的存储与计算效率等技术难题,显著提升了基准构建的复杂性。
常用场景
经典使用场景
TimeLens2-2B-SFT数据集专为时间敏感型推理任务而设计,广泛应用于大语言模型的监督微调(SFT)阶段。其核心用途在于提升模型对时间序列、事件顺序以及时序逻辑的理解能力。通过精心构建的问答对,该数据集帮助模型学会在对话中精准把握时间信息,从而生成更符合时间逻辑的回答,尤其适用于需要精确时间感知的复杂推理场景。
解决学术问题
该数据集主要解决了大语言模型在处理时间信息时存在的时序混乱、事件顺序混淆等学术难题。传统模型往往缺乏对时间维度的系统性感知,难以准确回答涉及时间线、事件先后顺序或时间跨度的问题。TimeLens2-2B-SFT通过引入丰富的时序标注样本,为模型提供了时间推理的监督信号,显著提升了其在时序逻辑任务上的表现,推动了时间感知自然语言处理领域的发展。
衍生相关工作
基于TimeLens2-2B-SFT数据集,衍生了一系列重要研究工作,包括时间感知的大语言模型架构改进、时序推理能力评估基准的构建,以及多模态时间推理任务的拓展。这些工作进一步探索了时间信息的表示学习、时序逻辑的形式化建模等前沿方向,推动了时间推理从简单问答向复杂场景泛化的演进,为构建更智能的时间敏感型AI系统奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务