遇见数据集

coachtwin-workouts

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集包含10,393个合成的、结构化的锻炼计划,由小型开放语言模型Qwen2.5-Instruct生成,用于驱动CoachTwin应用——一个锻炼推荐器加AI锻炼生成器。数据集的生成过程包括:使用参数化的一次性提示在1,920个单元格的网格(目标×设备×时长×难度×身体焦点)上进行生成,然后通过确定性的修复-验证后处理流程。数据集来自两个运行版本,由`source`列标记:`v1_prompt`(无练习计数目标,7,223行)和`duration_aware`(包含按时长练习计数目标,3,170行)。两个版本都通过相同的修复-验证合约,确保所有行符合统一标准。修复步骤通过修复可确定性修复的缺陷将产量提高了一个数量级。类别平衡通过身体焦点的逆频率加权采样实现,将54.8倍的不平衡修正到2.4倍。数据集包含以下列:`title`(锻炼名称,无数字)、`warm_up`(热身描述)、`exercises`(JSON字符串,包含`{name, sets, reps, rest_seconds}`列表)、`cool_down`(冷却描述)、`notes`(教练笔记)、`goal`(类别:力量/减重/耐力/柔韧性/一般健身)、`equipment`(类别:自重/哑铃/阻力带/全套健身房)、`duration_minutes`(整数:15/30/45/60)、`difficulty`(类别:初学者/中级/高级)、`body_focus`(类别:全身/上半身/下半身/核心/有氧/推/拉/腿)、`source`(类别:来源)。EDA总结:10,393行,零缺失值;身体焦点不平衡比2.40倍;平均每个锻炼2.9个练习(范围2-9);时长与练习数无相关性(相关系数0.06);练习词汇表包含4,707个独特名称;零真正重复;休息时间均在15-120秒范围内。已知限制:标题词汇较窄;内容非专家验证(合成数据,非健身或医疗建议);练习与身体焦点匹配基于关键词规则,可能导致合适练习被丢弃。预期用途:作为基于嵌入的锻炼推荐器的检索语料库,以及AI锻炼生成器的少样本上下文。

The CoachTwin Workouts dataset contains 10,393 synthetic, structured workout plans generated by the small open language model Qwen2.5-Instruct for powering the CoachTwin application—a workout recommender plus AI workout generator. The generation process includes generating on a 1,920-cell grid (goal × equipment × duration × difficulty × body focus) using parameterized one-shot prompts, followed by a deterministic fix-validate post-processing pipeline. The dataset comes from two runs, marked by the `source` column: `v1_prompt` (no exercise count target, 7,223 rows) and `duration_aware` (with duration-aware exercise count target, 3,170 rows). Both versions pass through the same fix-validate contract, ensuring all rows meet uniform standards. The fix step increases yield by an order of magnitude by fixing deterministically fixable defects. Class balance is achieved via inverse frequency weighting for body focus, reducing imbalance from 54.8x to 2.4x. The dataset includes columns: `title` (workout name, no numbers), `warm_up` (warm-up description), `exercises` (JSON string with list of `{name, sets, reps, rest_seconds}`), `cool_down` (cool-down description), `notes` (coach notes), `goal` (categories: strength/weight loss/endurance/flexibility/general fitness), `equipment` (categories: bodyweight/dumbbells/resistance bands/full gym), `duration_minutes` (integers: 15/30/45/60), `difficulty` (categories: beginner/intermediate/advanced), `body_focus` (categories: full body/upper body/lower body/core/cardio/push/pull/legs), `source` (categories: source). EDA summary: 10,393 rows, zero missing values; body focus imbalance ratio 2.40x; average 2.9 exercises per workout (range 2-9); no correlation between duration and exercise count (correlation coefficient 0.06); exercise vocabulary of 4,707 unique names; zero exact duplicates; rest seconds all within 15-120s. Known limitations: narrow title vocabulary; content not expert-validated (synthetic data, not fitness or medical advice); exercise-body focus matching based on keyword rules may discard suitable exercises. Intended use: as retrieval corpus for embedding-based workout recommenders and few-shot context for AI workout generators.

创建时间:
2026-08-15
原始信息汇总

CoachTwin Workouts 数据集概述

基本信息

  • 数据集名称: CoachTwin Workouts
  • 许可证: MIT
  • 语言: 英语
  • 数据规模: 约10K-100K条记录(实际包含10,393条记录)
  • 数据格式: CSV文件(coachtwin_workouts.csv),包含单个训练集(train split)
  • 任务类别: 文本生成、句子相似度
  • 标签: 健身、合成数据、锻炼计划

数据内容与结构

该数据集包含10,393个合成的、结构化的锻炼计划,由开源小型语言模型生成,用于支持CoachTwin应用(一个锻炼推荐及AI锻炼生成器)。

数据模式(Schema)

列名 类型 描述
title 字符串 锻炼名称(按构造规则不含数字)
warm_up 字符串 热身描述
exercises JSON字符串 一组{name, sets, reps, rest_seconds}列表
cool_down 字符串 冷却描述
notes 字符串 教练备注
goal 类别 力量/减重/耐力/柔韧性/综合健身
equipment 类别 自重/哑铃/阻力带/全健身房
duration_minutes 整数 15/30/45/60
difficulty 类别 初级/中级/高级
body_focus 类别 全身/上肢/下肢/核心/有氧/推/拉/腿
source 类别 数据来源标识:v1_promptduration_aware

数据生成方法

数据使用 Qwen2.5-Instruct 模型生成,采用参数化一次性提示(one-shot prompting),覆盖一个1,920单元格的参数网格(目标 × 设备 × 时长 × 难度 × 身体部位),随后经过确定性的修复-验证后处理流程。

数据来源于两个批次,由source列区分:

来源 行数 模型 提示特点
v1_prompt 7,223 Qwen/Qwen2.5-0.5B-Instruct 无锻炼数量目标
duration_aware 3,170 Qwen/Qwen2.5-1.5B-Instruct 指定每时长的锻炼数量目标

两个批次均通过相同的修复-验证合约,所有发布行均符合统一标准。

探索性数据分析(EDA)摘要

数据质量与完整性

  • 10,393行0缺失值
  • 0个真正重复项(0.0%)
  • 3,953行与其他行共享标题但内容与参数不同
  • 休息时间全部在预期的15-120秒范围内

类别平衡(按身体部位)

身体部位 数量
全身 1,905
1,538
上肢 1,396
有氧 1,352
下肢 1,192
核心 1,128
1,087
795

类别平衡通过逆频率加权采样实现,将body_focus的不平衡比从54.8倍修正至2.4倍。

数据丰富度

  • 每个锻炼计划平均含2.9个锻炼动作(范围:2-9个)
  • 4,707个独特锻炼名称,总条目30,270个(类型-标记比率为0.156)

关键发现

  • 锻炼数量与时长不相关duration_minutesnum_exercises的相关系数为0.06(负向结果),尽管提示中明确指定了不同时长的锻炼数量目标,模型响应仍不够强。
  • 两个EDA驱动的修复存在交互作用:逆频率采样通过集中生成push/pull/core(平均2.4-2.8个动作)来修正身体部位不平衡,但这些类别均值低于full body(3.5个),导致总体平均锻炼数量下降。
  • 修复层不是数量下降的原因:修复前后duration相关系数基本不变(+0.34 vs +0.35),修复主要成本在于整计划拒绝率约30%。

已知限制

  • 标题词汇比锻炼词汇更窄,例如"Strength Training Circuit"这类通用名称会出现在多个真正不同的锻炼计划中
  • 内容未经专家验证——这是用于机器学习演示的合成数据,并非健身或医疗建议
  • 锻炼动作到body_focus的匹配通过关键词规则强制执行,如果动作名称不含已识别的关键词,即使该动作合适也可能被删除

预期用途

用作基于嵌入的锻炼推荐器的检索语料库,以及AI锻炼生成器的少样本上下文(详见CoachTwin Space)。

附带文件

  • coachtwin_generation.ipynb:完整生成代码
  • coachtwin_eda.ipynb:完整EDA分析及绘图
搜集汇总
数据集介绍
coachtwin-workouts 数据集图片
构建方式
该数据集通过参数化的一次性提示,结合目标、设备、时长、难度和身体部位的五维网格(共1920种组合),利用Qwen2.5-Instruct系列模型生成初始方案,随后经过确定性的修复-验证后处理流程,确保所有条目符合统一标准。数据源自两轮生成,分别标记为v1_prompt和duration_aware,前者使用0.5B模型且无明确动作数量目标,后者采用1.5B模型并引入基于时长的动作数量指导。修复步骤显著提升了数据产量,将原先仅4.5%的接受率提升了约一个数量级。此外,通过逆频率加权采样对身体部位类别进行平衡,将原始54.8倍的不均衡降至2.4倍。
特点
该数据集包含10,393个结构化的合成训练计划,无缺失值,平均每个计划含2.9个动作(范围2-9),动作名称词汇丰富(4,707个唯一名称),无完全重复条目。数据特征揭示了时长与动作数量之间缺乏相关性(相关系数仅0.06),显式目标指令未能有效改变这一现象。身体部位平衡性得到显著改善,但高频生成部位(如push、pull)的平均动作数较低,反映了平衡性与内容丰富度之间的权衡。休息时间均控制在15-120秒的预期范围内,来源标记支持对提示变更影响的受控对比分析。
使用方法
该数据集主要用作基于嵌入的训练推荐系统的检索语料库,以及AI训练生成器的少样本上下文基础。用户可通过读取CSV文件并解析JSON字段(如exercises列表)轻松加载数据,示例代码提供了Pandas和ast模块的使用范式。数据集的来源列允许区分不同生成版本,便于进行消融研究。此外,数据集附带的EDA笔记本记录了生成和修复的详细信息,有助于深入理解数据特性与潜在局限。使用时需注意内容未经过专家验证,仅适用于机器学习演示,不构成健身或医疗建议。
背景与挑战
背景概述
CoachTwin Workouts数据集诞生于2024年末,由研究者OrDora等人利用Qwen2.5系列小型语言模型,通过参数化一次性提示生成,旨在为智能健身推荐与生成应用CoachTwin提供大规模结构化训练计划语料。该数据集包含10,393条合成训练计划,覆盖目标、器械、时长、难度、身体部位等多维度属性,填补了健身领域高质量合成数据稀缺的空白。其构建策略融合了网格参数化生成、确定性修复验证及逆频率加权采样,显著提升了类别平衡性与数据产量。作为文本生成与语义相似度任务的基准,该数据集为健身领域的机器学习研究与个性化服务开发提供了重要资源,促进了基于嵌入的推荐系统与少样本生成技术的实践探索。
当前挑战
该数据集面临多重挑战。领域层面,健身训练计划的结构化与多样性要求高,而现有数据往往缺乏细粒度标注,导致模型难以精准关联动作与身体部位;构建过程中,早期仅拒绝缺陷样本的管线产量极低(仅4.5%),促使开发确定性修复策略,通过剥离标题数字、限制休息时间等手段将产量提升一个量级,但代价是移除部分动作,可能损失信息。此外,时长与动作数不相关的负结果揭示了模型对显式数量指令响应不足,即便采用1.5B模型并调整提示仍难以修正。类别不平衡经逆频率采样从54.8倍降至2.4倍,却导致平均动作数下降,反映出平衡性与内容丰富度之间的权衡。内容未经专家验证,且动作与身体部位匹配依赖关键词规则,存在误匹配风险,限制了数据的实际应用可靠性。
常用场景
经典使用场景
CoachTwin Workouts数据集作为一份精心构建的合成健身计划语料库,其经典使用场景聚焦于检索增强生成(RAG)与语义相似度匹配任务。凭借10,393条结构化训练方案,涵盖多元目标、器械、时长与难度参数,该数据集为嵌入模型提供了充裕的训练与评估素材,能够支撑基于向量的健身推荐系统,实现对用户查询的精准匹配与排序。同时,其多维度标签体系亦便于构建语义嵌入空间,推动个性化训练方案的智能化检索与生成。
实际应用
在实际应用层面,CoachTwin Workouts可作为健身推荐系统与AI生成器的核心支撑。其丰富的参数组合使产品能够依据用户目标、可用器械及时间预算,快速输出定制化训练计划,提升用户参与度与满意度。数据集的修复机制确保了输出计划的结构完整性,如休息时间限制在15-120秒内,从而增强实际可用性。此外,该语料库还可用于训练或微调健身领域的语言模型,实现从自然语言描述到具体动作序列的自动转换,推动智能健身应用的发展。
衍生相关工作
该数据集的构建方法催生了若干衍生研究方向。一方面,其修复-验证后处理链为合成数据生成提供了可复用的范式,推动了对生成结果进行确定性修复以提升产出率的探索。另一方面,数据集中关于时长与练习数量相关性的负发现,激励了更精细的提示设计研究,旨在强化模型对显式数量指令的响应。此外,基于该语料库的嵌入模型与检索器,可能成为健身推荐基准测试的组成部分,促进该领域在个性化、可解释性等方面的后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务