Ironic error and overcompensation error under pressure
收藏Granary
Granary是一个包含25种欧洲语言的大规模语音识别和翻译数据集,由NVIDIA等多家机构联合创建。数据集通过伪标签技术生成,旨在解决低资源语言的语音处理问题。数据集包含约643,237.57小时的语音数据,经过精心筛选和处理,旨在提高数据质量并减少数据中的错误。该数据集可用于自动语音识别(ASR)和自动语音翻译(AST)等领域的研究,有助于提高语音模型在低资源语言上的准确性和鲁棒性。
arXiv 收录
giovannidemuri__sharegpt-ex50000-seed5_llama8b-er-v573-seed2-hx_256_ngt0.7_tp0.9
该数据集包含了用户与助手之间的对话,其中包含两个字段:用户发言和助手回应,均为字符串类型。训练集大小为38646852字节,共有44096条对话记录。
huggingface 收录
波士顿房价数据集
波士顿房价数据集是一个经典的机器学习数据集,通常用于回归任务,尤其是房价预测。下方文档中有所有字段顺序的描述。
阿里云天池 收录
Materials Project 在线材料数据库
Materials Project 是一个由伯克利加州大学和劳伦斯伯克利国家实验室于 2011 年共同发起的大型开放式在线材料数据库。这个项目的目标是利用高通量第一性原理计算,为超过百万种无机材料提供全面的性能数据、结构信息和计算模拟结果,以此加速新材料的发现和创新过程。数据库中的数据不仅包括晶体结构和能量特性,还涵盖了电子结构和热力学性质等详尽信息,为研究人员提供了丰富的材料数据资源。相关论文成果为「Commentary: The Materials Project: A materials genome approach to accelerating materials innovation」。
超神经 收录
FlowBench
FlowBench是由爱荷华州立大学创建的一个大规模流体模拟数据集,包含超过10,000个样本,旨在评估神经PDE求解器在复杂几何形状上的性能。数据集涵盖了多种复杂几何形状(参数化和非参数化)和流体条件(雷诺数和格拉晓夫数),捕捉了从稳态到瞬态的各种流体现象。每个样本都包含速度、压力和温度场的数据,以及升力、阻力和努塞尔数等工程特征。FlowBench的创建过程包括使用高保真模拟器进行直接数值模拟,确保数据的准确性和可靠性。该数据集主要应用于工程领域,如航空航天、汽车设计和生物流体学,旨在解决复杂几何形状上的流体动力学问题。
arXiv 收录
