遇见数据集

lolaby-traces

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Lolaby生成追踪数据集是一个从Lolaby应用中收集的端到端AI生成过程的完整记录集合,Lolaby是一个为Build Small Hackathon 2026(Backyard AI赛道)开发的AI驱动摇篮曲生成器。每个记录代表一次完整的生成过程,包含用户提供的所有输入(如姓名、恐惧、情绪、乐器等)、运行的每个模型(包括MiniCPM-V 4.6模型用于视觉解释、微调的Llama 3.2 3B模型用于生成歌词、和弦和节奏、Kokoro TTS和自定义DSP合成器用于音频合成)、每个阶段的提示和原始输出、所有时间测量以及最终生成的音频文件。数据集以子文件夹形式组织,每个文件夹包含trace.json(完整管道日志)、input_drawing.png(用户绘图,如果适用)和output_lullaby.wav(生成的音频文件,WAV格式,44.1 kHz,单声道)。数据集覆盖两种运行时路径:视觉路径(用户提供绘图,由模型解释后结合文本输入)和纯文本路径(仅基于文本输入)。记录是真实运行的见证,混合了确定性和随机性阶段,包含种子和参数以支持重放。数据以CC0许可证发布,允许研究、重放或重新混合生成管道,适用于文本到音频生成、文本生成、代理追踪分析和管道优化研究等任务。所有数据在本地生成,使用合成测试名称和开发者绘图,不包含真实儿童数据。

The Lolaby generation trace dataset contains complete end-to-end generation traces collected from the Lolaby app, an AI-powered lullaby generator built for the Build Small Hackathon 2026 (Backyard AI track). Each trace is a witness to a full generation, containing all user-provided inputs, every model run, every prompt and raw output, all timing measurements, and the final generated audio. The dataset is released under the CC0 license, allowing anyone to study, replay, or remix the entire generation pipeline. Each subfolder in the dataset represents a complete generation process and includes the following files: trace.json (full pipeline log recording user inputs, prompts and outputs for each stage, stage timings, parsed lyric structure, and audio rendering parameters), input_drawing.png (the drawing provided by the user to Lola, omitted if the user generated with text-only input), output_lullaby.wav (the audio file generated by Lola, in WAV format, 44.1 kHz, mono). The dataset covers two runtime paths of the Lolaby app: the vision path (where the user draws on a canvas or uploads a photo, interpreted by the MiniCPM-V model, with results fed into the lyric model alongside any text input) and the text-only path (no drawing provided, lyric model generates from text input only). Each path has representative trace folders, with the vision.source field in trace.json recording the type of path run. The generation pipeline includes stages such as user drawing interpretation via MiniCPM-V 4.6 model, combined with user-provided name, fear, mood, instrument, etc., input into a fine-tuned Llama 3.2 3B model to generate lyrics, chords, and rhythm, and finally synthesized into the final lullaby audio via Kokoro TTS and a custom DSP synthesizer. The traces in the dataset are witnesses to real runs, not recipes. The pipeline mixes deterministic and stochastic stages: deterministic stages (visual reasoning, DSP synthesizer rendering) are fully reproducible with the same inputs; stochastic stages (lyric model running at temperature=0.85, sampling in Kokoro TTS) produce similar but not identical outputs on reruns. Traces include seeds and parameters used, allowing exact replay of deterministic stages and spiritual comparison of stochastic ones. All traces were generated on the developers local laptop, with no cloud API calls used. The dataset uses synthetic test names and the developers own test drawings, containing no real child data. It is suitable for tasks such as text-to-audio generation, text generation, agent trace analysis, and pipeline optimization research.

创建时间:
2026-06-06
原始信息汇总

数据集概述:Lolaby — Generation Traces

数据集名称:Lolaby — Generation Traces
许可证:CC0 1.0 Universal(无版权保留)
数据集大小:少于1K条记录
任务类别:文本转音频、文本生成
语言:英语
主要标签:agent-trace, pipeline-trace, lullaby, audio-generation, small-models, build-small-hackathon, backyard-ai


数据集内容

数据集包含来自 Lolaby(AI驱动的摇篮曲生成器)的管道追踪记录。每条追踪记录是一次完整端到端生成过程的全程记录,包括:

  • 用户输入
  • 运行的所有模型
  • 每个阶段的提示词和原始输出
  • 每个阶段的计时数据
  • 最终生成的音频文件

每个子文件夹代表一次生成,包含以下文件:

  • trace.json:完整的管道日志,包含用户输入、每个阶段的提示词和输出、阶段计时、解析的歌词结构(和弦、节拍、换行)以及音频渲染参数。
  • input_drawing.png:用户提供的绘图(仅当用户通过绘图输入时存在;若仅通过文字输入则无此文件)。
  • output_lullaby.wav:Lola生成的音频文件(WAV格式,44.1 kHz,单声道)。

覆盖场景

数据集涵盖Lolaby的两种运行路径,每种路径均有代表性追踪记录:

  1. 视觉路径(Vision path):用户在画布上绘图或上传照片,MiniCPM-V模型解读图像,结果与用户输入的“所爱之物”文本共同输入歌词模型。
  2. 纯文本路径(Typed-only path):无绘图输入,歌词模型仅根据用户输入的“所爱之物”文本生成歌词。

trace.json中,通过vision.source字段记录运行路径(值为visiontyped_only)。


管道流程概览

绘图 ─▶ MiniCPM-V 4.6 ─▶ "Lola看到的内容" │ + 姓名、恐惧、情绪、乐器 ▼ Fine-tuned Llama 3.2 3B (GGUF, llama.cpp) │ 解析后的歌词 + 和弦 + 节奏 │ ┌─────────────────┴─────────────────┐ ▼ ▼ Kokoro TTS DSP合成器(自定义) └─────────────────┬─────────────────┘ ▼ output_lullaby.wav


可复现性说明

每条追踪记录是真实运行的一次见证,而非可复现的食谱。管道包含确定性阶段随机性阶段

  • 确定性阶段:视觉推理(do_sample=False)、基于解析歌词的DSP合成渲染。给定相同输入可完全复现。
  • 随机性阶段:歌词模型以temperature=0.85运行,Kokoro TTS具有自身采样机制。重新运行时输出相似但不完全相同

追踪记录中保存了使用的随机种子和参数,可以精确复现确定性阶段,并在精神层面上比较随机性阶段。


相关资源

  • 应用:https://huggingface.co/spaces/build-small-hackathon/lolaby(实时Gradio空间)
  • 歌词模型:https://huggingface.co/build-small-hackathon/lolaby-llama-3b(Fine-tuned Llama 3.2 3B)
  • 视觉模型:https://huggingface.co/openbmb/MiniCPM-V-4_6(解读绘图)
  • 语音模型:https://huggingface.co/hexgrad/Kokoro-82M(朗读歌词)

来源与隐私

  • 来源:这些追踪记录在开发者本地笔记本电脑上生成,所有模型均在设备本地运行,未调用任何云API。
  • 隐私:所有追踪记录使用合成测试名称和开发者自己的测试绘图,不包含任何真实儿童数据。若需从真实用户处收集追踪记录,请先清除可识别信息。

许可证

CC0 1.0 Universal:无版权保留,可用于研究、教学、比较或其他任何用途,无需署名。但追踪记录中引用的模型和代码有其自身许可证,请参见相关资源部分。

搜集汇总
数据集介绍
lolaby-traces 数据集图片
构建方式
Lolaby — Generation Traces数据集源于为Build Small Hackathon 2026开发的AI摇篮曲生成应用Lolaby,收录了其端到端生成管线的完整运行轨迹。每条轨迹对应一次完整生成过程,详细记录了用户输入的绘画或文本、各阶段模型运行的提示词与原始输出、推理时间测量以及最终音频文件。数据集按运行路径分类,涵盖视觉路径(用户绘图经MiniCPM-V解读后馈入歌词模型)与纯文本路径(仅基于用户输入生成歌词),每个路径均包含代表性轨迹样本,确保对管线组合方式的全面覆盖。
特点
该数据集的独特之处在于其作为真实生成过程的完整见证,而非可复现的配方。每条轨迹中的管线混合了确定性与随机性阶段:视觉推理与DSP合成渲染在相同输入下可精确复现,而歌词模型(temperature=0.85)与Kokoro TTS的随机采样则会产生相似但不完全一致的结果。数据集记录了所有种子与参数,允许研究者精确复现确定性环节,并在精神层面对随机性环节进行比较研究。所有轨迹均源自开发者个人设备本地运行,未调用任何云API,真实反映了用户自行运行Lolaby时的完整产出。
使用方法
使用该数据集时,每个子文件夹代表一次独立生成,包含三个核心文件:trace.json提供完整的管线日志,涵盖用户输入、各阶段提示词与输出、歌词结构解析(和弦、节拍、换行)及音频渲染参数;input_drawing.png保存用户绘制的图像(若存在);output_lullaby.wav为最终生成的44.1kHz单声道WAV音频。研究者可依据trace.json中的vision.source字段区分视觉与纯文本路径,通过解析结构化日志复现管线行为,或将音频与文本输出用于多模态生成任务的训练与评估。数据集采用CC0许可,无任何版权限制,适用于研究、教学与二次创作。
背景与挑战
背景概述
Lolaby-traces 数据集诞生于 2026 年由 Backyard AI 主办的 Build Small Hackathon,由该黑客松开发者团队创建,旨在记录并公开 Lolaby 这一 AI 摇篮曲生成器的完整端到端运行痕迹。该数据集的核心研究问题在于为多模型流水线(pipeline)提供一种透明、可复现的记录范式,涵盖从用户输入(绘画或文字)到多模态模型推理(视觉理解、歌词生成、语音合成、数字信号处理合成)的全链路数据。作为小模型驱动下本地化 AI 创作的典型案例,该数据集对研究轻量级多模态部署、流水线跟踪技术以及人机共创作场景下的生成可解释性具有重要推动意义。
当前挑战
该数据集所面临的领域挑战主要在于多模型流水线中确定性阶段与随机性阶段的协调与复现问题——视觉推理和数字信号处理渲染部分具有确定性,但歌词生成模型(温度 0.85)与文本转语音模型各自引入随机采样,导致整体生成结果难以完全精准重现。在构建过程中,挑战则集中于数据的隐私保护:所有痕迹数据均使用合成测试名称与开发者自绘图像,确保不包含真实儿童信息;此外,流水线完全在本地设备运行、不调用任何云 API,这一约束保证了用户隐私,但也限制了数据规模与多样性,最终仅收录不足 1000 条痕迹,覆盖视觉路径与纯文本路径两类运行方式。
常用场景
经典使用场景
在智能音频生成与多模态交互的交叉领域中,Lolaby-generation-traces数据集为端到端流水线的可复现性研究提供了珍贵的观测窗口。该数据集完整记录了Lolaby——一款专为儿童摇篮曲创作设计的AI系统——从用户输入(手绘图像或文字描述)到最终音频输出的全链路轨迹。每个轨迹子文件夹包含结构化的trace.json日志、输入图像及生成的WAV文件,覆盖了视觉驱动与纯文本驱动两种运行路径。研究者可利用这些数据精确剖析多阶段流水线的组合逻辑,包括视觉语言模型对涂鸦的解读、微调语言模型基于情感主题生成歌词与和弦结构、以及文本转语音与数字合成器协同渲染音频的完整过程。这种细粒度的流水线追踪数据,为小模型场景下的可解释性分析与系统行为验证提供了前所未有的实证基础。
解决学术问题
该数据集的核心贡献在于破解了小型开源模型组合系统中长期存在的黑箱化难题。在学术层面,它首次提供了公开可获取的多模态生成流水线的完整执行痕迹,使研究者能够定量评估视觉理解(MiniCPM-V 4.6)与歌词生成(微调Llama 3.2 3B)之间的信息传递误差,以及确定性合成阶段与随机性采样阶段对最终音频质量的交互影响。通过记录每个阶段的种子参数、提示词与原始输出,该数据集支持对多模态语义对齐、跨模型协作鲁棒性等关键学术问题的系统研究。其CC0许可协议更是消解了数据共享的法律壁垒,让学术界能够在统一基准上比较不同模型组合策略在创意生成任务中的表现,从而推动小而美模型生态从经验直觉走向可量化验证的科学范式。
衍生相关工作
围绕该数据集已衍生出一系列值得关注的学术与实践工作。作为其基础构件的独立发布项目——包括经过摇篮曲风格微调的Llama 3.2 3B歌词模型、集成的MiniCPM-V 4.6视觉模型以及Kokoro-82M语音模型——构成了一个小而强模型协同生态的技术主轴。后续的工作可以沿两条路径展开:一是基于轨迹数据开发流水线级的调试与可视化工具,使多模型组合的交互影响变得透明;二是利用这些真实轨迹作为强化学习的环境状态,训练自适应调度器以动态优化流水线路径选择(如根据用户输入复杂度决定是否启用视觉分支)。该数据集揭示的确定性/随机性混合生成策略,也为创意AI系统的可控性研究提供了重要的对比基线,激励着更多针对小参数量模型在艺术创作领域应用潜力的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务