遇见数据集

UniPS

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

Chinese-Legal-Instruction是一个高质量的中文法律指令数据集,专为训练和评估大型语言模型(LLM)的法律指令遵循能力而构建。它提供丰富、多样且贴近实际应用的中文法律指令数据,支持法律领域自然语言处理任务的研究与开发。数据来源包括从现有法律数据集中筛选重构的样本和专业人员基于真实法律案例、法规条文编写的高质量指令-输出对,采用CC0 1.0公共领域贡献许可证发布。数据集包含三个核心部分:legal_instruction_data(约10,000个样本,采用标准指令遵循格式,包括instruction、input和output字段)、legal_corpus(法律法规、司法文书等文本语料库)和legal_qa_data(法律问答数据集)。数据覆盖民法、刑法、行政法、合同法、知识产权法等多个法律领域,指令类型涵盖法律信息检索、文本摘要、咨询问答、文书起草、案例分析和法律推理等任务,难度从简单查询到复杂推理。适用于法律文本生成、问答、检索分类、推理等NLP任务,可通过HuggingFace datasets库加载,格式为JSONL。注意:数据集仅供学术研究、技术验证和模型训练使用,不构成正式法律意见,使用者应结合专业法律知识并遵守法律法规。

Chinese-Legal-Instruction is a high-quality Chinese legal instruction dataset, specifically designed for training and evaluating the legal instruction-following capabilities of large language models (LLMs). It provides rich, diverse, and practically relevant Chinese legal instruction data to support research and development in legal natural language processing tasks. Data sources include carefully selected and reformatted samples from existing legal datasets, as well as high-quality instruction-output pairs manually crafted by professionals based on real legal cases, regulations, and scenarios, released under the CC0 1.0 Public Domain Dedication license. The dataset consists of three core components: legal_instruction_data (approximately 10,000 samples in standard instruction-following format with instruction, input, and output fields), legal_corpus (a corpus of legal-related texts such as laws, judicial documents, and legal papers), and legal_qa_data (a legal question-answering dataset). It covers multiple legal domains including civil law, criminal law, administrative law, contract law, intellectual property law, etc., with diverse instruction types such as legal information retrieval, text summarization, consultation Q&A, document drafting, case analysis, and legal reasoning, spanning difficulty levels from simple factual queries to complex multi-step reasoning. Suitable for various legal NLP tasks like text generation, Q&A, retrieval and classification, and reasoning, it can be loaded via the HuggingFace datasets library in JSONL format. Note: The dataset is intended for academic research, technical validation, and model training only, does not constitute formal legal advice, and users should combine it with professional legal knowledge and comply with local laws and regulations.

创建时间:
2026-05-20
原始信息汇总

由于该数据集详情页的README内容仅包含许可证信息(cc0-1.0),未提供数据集的名称、描述、用途、构成等具体内容,因此无法生成有效的数据集概述。

搜集汇总
数据集介绍
UniPS 数据集图片
构建方式
UniPS数据集以统一化理念构建,致力于整合多源点云数据,通过标准化处理流程将不同传感器、不同场景下的三维点云数据进行格式统一与坐标对齐。其构建过程包含数据采集、噪声过滤、语义标注及质量校验等环节,最终形成具有高一致性的密集点云集合。
特点
该数据集涵盖丰富多样的室内外场景,包含静态物体与动态目标的精细点云表示。每个点云样本均附有类别标签与空间几何信息,支持多粒度特征提取。其开放性在于采用CC0许可协议,可自由用于学术研究与商业应用,且数据规模与场景复杂度平衡得当。
使用方法
用户可直接从HuggingFace仓库以标准格式加载UniPS数据集,利用常见深度学习框架如PyTorch或TensorFlow进行点云处理模型的训练与评估。数据集提供预定义的训练-验证-测试划分,并支持随机子采样与数据增强操作,便于快速适配分类、分割或检测等下游任务。
背景与挑战
背景概述
UniPS数据集由研究机构于近年创建,旨在推动统一感知与分割任务的研究。该数据集聚焦于多模态感知与语义分割的融合,解决传统方法在复杂场景中因任务割裂导致的性能瓶颈。其核心研究问题在于如何通过统一框架联合学习空间感知与语义理解,为自动驾驶、机器人导航等应用提供鲁棒的基础数据支撑。UniPS的发布为相关领域提供了标准化的评估基准,显著促进了跨任务协同算法的进展。
当前挑战
UniPS数据集所解决的领域挑战是多模态感知与分割任务的异构性,即传统方法难以在同一模型中同时兼顾空间定位与语义细粒度划分的精度。构建过程中面临的挑战包括:多源数据标注的一致性维护,例如不同传感器(如激光雷达与相机)产生的点云与图像在时空对齐上的误差控制;复杂场景下细粒度语义标签的精确标注,需克服遮挡与光照变化带来的歧义;以及大规模数据采集时计算资源与人工校验成本的平衡难题。
常用场景
经典使用场景
UniPS数据集作为统一处理的多模态感知数据集合,广泛应用于视觉与语言联合学习的经典研究场景。研究者常利用该数据集进行图像描述、视觉问答以及跨模态检索等任务的训练与评估,其标准化的数据格式和丰富的标注信息为模型性能的公平比较提供了坚实基准。在零样本学习与少样本学习的前沿探索中,UniPS亦被用作基础数据源,助力算法泛化能力的提升。
解决学术问题
该数据集有效解决了多模态研究中数据来源碎片化、标注不一致的核心学术难题。通过提供跨场景、跨任务的高质量统一标注,UniPS降低了模型在不同视觉语言任务间迁移的鸿沟,推动了通用视觉表示学习的发展。其开源许可(cc0-1.0)促进了学术界的开放共享,加速了从单任务模型向多任务通用智能体的范式转变,对构建可解释且鲁棒的视觉语言系统具有里程碑意义。
衍生相关工作
基于UniPS数据集,衍生出多项开创性工作,包括但不限于跨模态对比学习框架、视觉语言预训练模型(如ViLBERT、CLIP的改进版本)以及多任务联合蒸馏方法。这些工作利用UniPS的统一标注特性,探索了模态对齐与语义共享的信息瓶颈,进一步催生了面向动态场景的时序推理模型。该数据集还激发了针对数据高效学习的元学习研究,成为后续大规模多模态基准构建的基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务