遇见数据集

cmu-lti/osim-mid-training

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是ODYSSIM行为基础模型实验中使用的中期训练语料库。数据以按数据集/来源分组的parquet分片形式存储,包含训练分片和对应来源的保留测试文件。该版本将之前暂存的数据集Xuhui/sft_processed_large_split_v3转移到CMU-LTI组织用于论文发布。统计摘要显示:2140万训练行,约106亿估计词元,166个存储库文件总计约21GB。语料库聚合了多个上游数据集,具有不同的许可证和使用条款,建议在重新分发或商业使用前查阅ODYSSIM论文中的来源级文档和引用。

This repository contains the midtraining corpus used for ODYSSIM behavioral foundation model experiments. The corpus is stored as parquet shards grouped by dataset/source, with train shards and held-out test files for the corresponding sources. The release mirrors the previously staged dataset `Xuhui/sft_processed_large_split_v3` into the CMU-LTI organization for the paper release. Summary statistics from the audit pass: 21.4M train rows, approximately 10.6B estimated tokens, and 166 repository files totaling about 21GB on Hugging Face. The corpus aggregates many upstream datasets with different licenses and use terms. Please consult the source-level documentation and citations in the ODYSSIM paper before redistribution or commercial use.

提供机构:
cmu-lti
搜集汇总
数据集介绍
cmu-lti/osim-mid-training 数据集图片
构建方式
ODYSSIM Midtraining Corpus是为了支持ODYSSIM行为基础模型实验而构建的中期训练语料库。该语料库以Parquet分片形式存储,按数据集或来源进行分组,每个顶层目录对应一个来源或衍生来源家族。大型来源被分割为多个训练分片文件,而较小来源通常包含单一训练分片及对应的测试文件。此版本将先前分阶段的数据集`Xuhui/sft_processed_large_split_v3`镜像至CMU-LTI组织下,用于论文发布。经审计,该语料库包含约2140万条训练数据,估算约106亿个token,总计166个仓库文件,在Hugging Face上占用约21GB存储空间。
特点
该数据集具有显著的规模与多样性优势,整合了多个上游数据集,涵盖不同许可与使用条款,为行为模拟研究提供了丰富的对话数据基础。语料库结构清晰,通过分片与测试文件分离的设计,便于大规模训练与评估。其来源广泛,支持跨领域的行为建模与对话系统研究,但用户需注意上游数据集的原始许可条款,并在再分发或商业使用时参考ODYSSIM论文中的来源文档与引用信息,确保合规使用。
使用方法
使用该数据集时,可通过Hugging Face的`datasets`库加载所需的数据分片。用户需指定配置或路径,例如使用`load_dataset("cmu-lti/osim-mid-training", data_files="alignx_v2/train_shard_000.parquet", split="train")`来加载特定来源的训练数据。由于语料库按来源组织,建议根据研究需求选择对应的顶层目录。对于训练与测试分离的语料,可分别使用训练分片和测试文件进行模型训练及效果评估。注意遵守上游数据集的许可条款,并在相关出版物中引用ODYSSIM论文。
背景与挑战
背景概述
ODYSSIM Midtraining Corpus(简称osim-mid-training)是由卡内基梅隆大学语言技术研究所(CMU-LTI)于近期构建并发布的中期训练数据集,旨在支撑ODYSSIM行为基础模型的实验研究。该数据集聚焦人类行为模拟与对话领域,汇集了超过21.4万条训练样本,预计包含约106亿个token,存储规模约21GB。其核心研究问题在于通过大规模多源对话数据的整合,提升基础模型对复杂人类行为模式的建模与泛化能力。作为ODYSSIM项目的重要组成部分,该数据集为行为模拟基础模型的研究提供了关键的数据支撑,对推动人机交互与行为科学交叉领域的发展具有显著影响力。
当前挑战
该数据集面临的核心挑战包括:在领域问题层面,如何从多源异构对话数据中有效提取并建模复杂的人类行为模式,尤其是兼顾行为的多样性、情境依赖性与时序一致性,是当前行为模拟基础模型亟待突破的瓶颈。在构建过程中,数据聚合面临着上游数据集许可条款与使用协议的兼容性问题,需要严格遵循各来源的文档与引用规范,确保合法合规使用。此外,大规模数据的分片存储与高效加载、训练与测试集划分的合理性,以及数据质量的审计与清洗,均构成了具体的技术与工程挑战。
常用场景
经典使用场景
在社会智能与人类行为建模的前沿领域,ODYSSIM Midtraining Corpus(osim-mid-training)作为行为基础模型的关键训练语料,被广泛应用于人类行为仿真与对话系统的预训练阶段。该数据集汇聚了超过2100万条训练样本,涵盖多样化的交互场景与语言表达形式,为构建能够模拟人类复杂行为模式的神经架构提供了丰富的数据支撑。研究者常将其作为中间训练阶段的核心数据源,以增强模型对真实世界对话语境与行动序列的深层理解,从而在后续任务中实现更自然、更连贯的行为生成。
实际应用
在实际落地层面,该数据集驱动的行为基础模型可赋能智能客服系统、虚拟角色扮演、社交机器人及自动驾驶中的人类意图预测等应用。例如,在对话式AI中,模型借助osim-mid-training习得的丰富行为模式,能够更精准地识别用户的潜在需求并生成具有上下文感知的响应;在游戏与元宇宙场景中,训练后的模型可驱动非玩家角色(NPC)展现更逼真、更具个性的行为序列,提升用户沉浸感。此外,该数据集还适用于人机协作中的任务规划与异常检测,助力构建更具适应性的智能交互系统。
衍生相关工作
osim-mid-training的发布催生了一系列围绕行为基础模型的经典工作,包括对其数据构成与训练策略的分析研究,以及基于该语料改进模型架构与迁移学习方法的探索。相关研究聚焦于如何从大规模异构行为数据中提取通用表征,并验证了中间训练阶段对于下游任务性能提升的显著贡献。此外,该数据集还成为了衡量行为仿真系统鲁棒性与多样性的重要评估平台,推动了诸如多源数据融合技术、行为分布对齐以及长尾场景泛化等方向的深入发展,为构建下一代通用智能体奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务