遇见数据集

masifan/CSL-News

收藏
Hugging Face2026-02-28 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - zh license: cc-by-nc-4.0 tags: - sign-language task_categories: - video-text-to-text --- # Summary This is the dataset proposed in our paper "[**Uni-Sign: Toward Unified Sign Language Understanding at Scale**](https://arxiv.org/abs/2501.15187)". CSL-News is a large-scale Chinese Sign Language dataset designed for developing robust sign language understanding models. **Code**: [https://github.com/ZechengLi19/Uni-Sign](https://github.com/ZechengLi19/Uni-Sign) # Download Please refer to [**download script**](https://github.com/ZechengLi19/Uni-Sign/blob/main/download_scripts/download_CSL_News.py) to download CSL_News. You can also download each file by ```wget```, for instance: ``` wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_001.zip wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_002.zip wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_003.zip ... ``` # Usage You can unzip each archive_*.zip file by ```unzip```, for instance: ``` unzip -j archive_001.zip -d ./CSL_News/rgb_format unzip -j archive_002.zip -d ./CSL_News/rgb_format unzip -j archive_003.zip -d ./CSL_News/rgb_format ... ``` ``CSL_News_Labels.json`` and ``CSL_News_Labels.csv`` contains the text-annotations for CSL-News. They can easily be read by ```python # Read CSL_News_Labels.json import json with open('CSL_News_Labels.json', 'r', encoding='utf-8') as f: data = json.load(f) # Read CSL_News_Labels.csv import pandas data = pandas.read_csv("CSL_News_Labels.csv") ``` # Other format We also provide the CSL-News dataset in a pose format. Please refer to [**here**](https://huggingface.co/datasets/ZechengLi19/CSL-News_pose). # License CSL-News is released under the CC-BY-NC-4.0 license. The video samples in this dataset are collected from publicly available web videos. Users must ensure that their use of these video samples is strictly non-commercial. # Why Non-Commercial? The video samples in CSL-News are sourced from web videos, and their copyright belongs to the original content creators. While this dataset is provided for research purposes under the CC-BY-NC-4.0 license, commercial use of these videos may infringe upon the rights of the original creators. To respect their rights and ensure ethical use, we strictly enforce a non-commercial usage policy for CSL-News. # Citation ``` @article{li2025uni-sign, title={Uni-Sign: Toward Unified Sign Language Understanding at Scale}, author={Li, Zecheng and Zhou, Wengang and Zhao, Weichao and Wu, Kepeng and Hu, Hezhen and Li, Houqiang}, journal={arXiv preprint arXiv:2501.15187}, year={2025} } ```

--- 语言: - 中文(zh) 许可协议:CC-BY-NC-4.0 标签: - 手语(sign-language) 任务类别: - 视频-文本到文本(video-text-to-text) --- # 概述 本数据集源自论文《**Uni-Sign:面向大规模统一手语理解**》(链接:https://arxiv.org/abs/2501.15187)。CSL-News是一款大规模中文手语数据集,旨在助力鲁棒性手语理解模型的研发。 **代码仓库**:[https://github.com/ZechengLi19/Uni-Sign](https://github.com/ZechengLi19/Uni-Sign) # 下载 请参照[下载脚本](https://github.com/ZechengLi19/Uni-Sign/blob/main/download_scripts/download_CSL_News.py)获取CSL-News数据集。您也可通过`wget`命令单独下载各文件,示例如下: wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_001.zip wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_002.zip wget https://huggingface.co/datasets/ZechengLi19/CSL-News/resolve/main/archive_003.zip ... # 使用方法 您可通过`unzip`命令解压各`archive_*.zip`压缩包,示例如下: unzip -j archive_001.zip -d ./CSL_News/rgb_format unzip -j archive_002.zip -d ./CSL_News/rgb_format unzip -j archive_003.zip -d ./CSL_News/rgb_format ... `CSL_News_Labels.json`与`CSL_News_Labels.csv`包含了CSL-News的文本标注信息,可通过以下代码轻松读取: python # 读取CSL_News_Labels.json import json with open('CSL_News_Labels.json', 'r', encoding='utf-8') as f: data = json.load(f) # 读取CSL_News_Labels.csv import pandas data = pandas.read_csv("CSL_News_Labels.csv") # 其他数据格式 我们还提供了姿态格式的CSL-News数据集,请参阅[此处](https://huggingface.co/datasets/ZechengLi19/CSL-News_pose)。 # 许可协议 CSL-News采用CC-BY-NC-4.0许可协议发布。本数据集内的视频样本均采集自公开网络视频,使用者必须确保对这些视频样本的使用严格遵循非商业性原则。 # 为何采用非商业许可? CSL-News中的视频样本来源于网络公开视频,其版权归原内容创作者所有。尽管本数据集以CC-BY-NC-4.0许可协议提供,仅用于研究目的,但对这些视频的商业使用可能会侵犯原创作者的合法权益。为尊重其权益并确保伦理合规使用,我们对CSL-News严格执行非商业使用政策。 # 引用格式 @article{li2025uni-sign, title={Uni-Sign: Toward Unified Sign Language Understanding at Scale}, author={Li, Zecheng and Zhou, Wengang and Zhao, Weichao and Wu, Kepeng and Hu, Hezhen and Li, Houqiang}, journal={arXiv preprint arXiv:2501.15187}, year={2025} }

提供机构:
masifan
搜集汇总
数据集介绍
构建方式
在数字人文与无障碍交互技术蓬勃发展的当下,手语理解研究亟需大规模、高质量的数据支撑。CSL-News数据集应运而生,其构建依托于公开网络视频资源,通过系统化采集与精细化标注流程完成。原始视频素材经多轮筛选与质量控制后,以压缩包形式(archive_*.zip)存储,并辅以JSON与CSV两种格式的文本标注文件(CSL_News_Labels.json与CSL_News_Labels.csv),确保数据完整性与可访问性。此外,数据集还额外提供了姿态格式版本,以满足不同研究场景的需求。
特点
该数据集的核心特色在于其庞大规模与领域专精性,专为中国手语新闻场景设计,为构建鲁棒的手语理解模型奠定了坚实基础。其视频样本涵盖丰富多样的新闻播报内容,语言标签均为中文,且采用CC-BY-NC-4.0许可协议,明确限定非商业用途,以尊重原始内容创作者的版权。这种严格的伦理规范确保了研究使用的合法性,同时促进了学术社区内的开放共享。
使用方法
使用CSL-News数据集时,研究者可通过官方提供的下载脚本或wget命令获取压缩文件,随后利用unzip工具解压至指定目录以提取RGB格式视频。文本标注可通过Python的json模块或pandas库轻松读取,便于快速集成至模型训练流程。对于需要提取人体姿态特征的研究,还可直接访问同名的姿态格式版本,实现灵活的实验配置。
背景与挑战
背景概述
手语作为听障人士沟通的核心媒介,其自动理解技术对于打破语言壁垒、推动社会包容性具有深远意义。然而,现有手语数据集多集中于词汇级或简单句子级任务,难以支撑真实场景中复杂新闻播报的翻译与理解。在此背景下,由中国科学技术大学李泽成、周文罡等研究人员于2025年提出的CSL-News数据集应运而生,作为Uni-Sign框架的重要组成部分,旨在解决大规模中文手语新闻视频与文本对齐的挑战。该数据集从公开网络视频中收集,涵盖多样化的新闻主题与播报风格,为构建鲁棒的手语理解模型提供了海量标注样本。其发布迅速成为手语领域的研究焦点,推动了从孤立词识别向连续语句级翻译的范式跃迁,显著提升了模型在真实新闻场景下的泛化能力与实用性。
当前挑战
CSL-News所应对的核心领域挑战在于:现有手语模型在连续新闻播报场景中面临长时序依赖建模、手势与面部表情多模态融合,以及新闻领域特有专业术语的准确翻译等难题。构建过程中,研究人员遭遇了多重障碍:首先,网络新闻视频的版权归属复杂,必须严格限定非商业用途以尊重原创者权益;其次,大规模视频的清洗与标注极为耗时,需从海量原始素材中筛选出高画质、无遮挡且手语动作清晰的有效片段;此外,文本对齐的准确性直接影响模型性能,标注人员需在缺乏统一手语书写系统的情况下,依赖专家经验完成音视频与文本的精细对齐,这构成了数据质量控制的重大挑战。
常用场景
经典使用场景
在计算机视觉与自然语言处理交叉领域,CSL-News作为大规模中文手语视频-文本数据集,常用于构建与评测手语识别、翻译及理解等统一模型。研究者借助其丰富的新闻播报场景视频与对应文本标注,训练模型从连续手语动作序列中精准解码语义信息,推动多模态对齐与序列学习技术的进步。
衍生相关工作
围绕CSL-News,衍生出多项前沿工作,如基于统一框架的Uni-Sign模型,实现手语识别与翻译的协同学习;以及利用姿态关键点表示的轻量化方法,降低计算开销的同时保持高精度。这些工作推动了手语理解从特定场景向通用领域的跨越,为多模态大模型在少数语言上的应用开辟新路径。
数据集最近研究
最新研究方向
CSL-News数据集聚焦于大规模中文手语理解的前沿探索,其最新研究方向围绕统一化手语理解模型Uni-Sign展开,该模型旨在通过多模态视频-文本对齐技术,突破传统手语翻译与识别任务的界限。随着生成式AI与多模态大模型的蓬勃发展,手语研究正从孤立词汇识别迈向复杂连续语句的语义理解,CSL-News通过收集新闻场景下的大规模真实手语视频,为模型提供了丰富的上下文语境与多样化表达,显著推动了手语理解在无障碍通信、智能助残等社会热点领域的应用。该数据集的发布不仅填补了中文手语大规模基准的空白,更为构建包容性AI系统奠定了关键数据基础,对促进听障群体信息获取平等具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务