Spider|语义解析数据集|文本到SQL数据集
收藏
- Spider数据集首次发表,由Yu等人提出,旨在评估自然语言到SQL查询的转换能力。
- Spider数据集首次应用于自然语言处理领域的研究,特别是在语义解析和数据库查询生成任务中。
- Spider数据集的扩展版本发布,增加了更多的数据库和查询类型,以提升数据集的多样性和挑战性。
- Spider数据集在多个国际会议和竞赛中被广泛使用,成为评估自然语言到SQL转换模型性能的标准数据集之一。
- 1Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL TaskUniversity of Washington, AI2, Google Research, McGill University · 2018年
- 2RAT-SQL: Relation-Aware Schema Encoding and Linking for Text-to-SQL ParsersUniversity of Washington, AI2 · 2019年
- 3Global Reasoning over Database Structures for Text-to-SQL ParsingUniversity of Washington, AI2 · 2020年
- 4Towards Complex Text-to-SQL in Cross-Domain Database with Intermediate RepresentationUniversity of Washington, AI2 · 2019年
- 5Improving Text-to-SQL Evaluation MethodologyUniversity of Washington, AI2 · 2018年
HazyDet
HazyDet是由解放军工程大学等机构创建的一个大规模数据集,专门用于雾霾场景下的无人机视角物体检测。该数据集包含383,000个真实世界实例,收集自自然雾霾环境和正常场景中人工添加的雾霾效果,以模拟恶劣天气条件。数据集的创建过程结合了深度估计和大气散射模型,确保了数据的真实性和多样性。HazyDet主要应用于无人机在恶劣天气条件下的物体检测,旨在提高无人机在复杂环境中的感知能力。
arXiv 收录
中国气象数据
本数据集包含了中国2023年1月至11月的气象数据,包括日照时间、降雨量、温度、风速等关键数据。通过这些数据,可以深入了解气象现象对不同地区的影响,并通过可视化工具揭示中国的气温分布、降水情况、风速趋势等。
github 收录
52,435条上海方言发音词典【数据堂】
上海方言发音词典包含5万多条词条,所有词语及发音均由上海话语言学专家制作,包含410个国际音标音素和74个上海话音素,上海话拼音共包含5个单字调,分别为阴平,阴去,阳去,阴入,阳入,标音准确。适用于上海话识别技术研发
OpenDataLab 收录
RAVDESS
情感语音和歌曲 (RAVDESS) 的Ryerson视听数据库包含7,356个文件 (总大小: 24.8 GB)。该数据库包含24位专业演员 (12位女性,12位男性),以中性的北美口音发声两个词汇匹配的陈述。言语包括平静、快乐、悲伤、愤怒、恐惧、惊讶和厌恶的表情,歌曲则包含平静、快乐、悲伤、愤怒和恐惧的情绪。每个表达都是在两个情绪强度水平 (正常,强烈) 下产生的,另外还有一个中性表达。所有条件都有三种模态格式: 纯音频 (16位,48kHz .wav),音频-视频 (720p H.264,AAC 48kHz,.mp4) 和仅视频 (无声音)。注意,Actor_18没有歌曲文件。
OpenDataLab 收录
Traditional-Chinese-Medicine-Dataset-SFT
该数据集是一个高质量的中医数据集,主要由非网络来源的内部数据构成,包含约1GB的中医各个领域临床案例、名家典籍、医学百科、名词解释等优质内容。数据集99%为简体中文内容,质量优异,信息密度可观。数据集适用于预训练或继续预训练用途,未来将继续发布针对SFT/IFT的多轮对话和问答数据集。数据集可以独立使用,但建议先使用配套的预训练数据集对模型进行继续预训练后,再使用该数据集进行进一步的指令微调。数据集还包含一定比例的中文常识、中文多轮对话数据以及古文/文言文<->现代文翻译数据,以避免灾难性遗忘并加强模型表现。
huggingface 收录