遇见数据集

surrogate-2-business-pipeline

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

axentx Surrogate-2 Business Pipeline 是一个通过自动化流程生成的商业创意数据集,由 axentx burn-loop 守护程序持续合成输出。数据集旨在提供结构化的商业创意内容,适用于商业分析、创业教育、AI生成内容评估等场景。数据内容包含完整的商业创意要素:每个样本均包含一个唯一的顺序ID、ISO 8601格式的UTC生成时间戳、以及15个加权业务垂直类别之一。核心数据以Markdown格式的扁平化人类可读文本呈现,并附有结构化的商业模型画布(BMC),详细记录了创意名称、价值主张、目标客户、痛点问题、差异化优势、收入模型、市场规模(TAM/SAM/SOM)、启动成本(泰铢)、月收入潜力(泰铢)以及是否为科技类创意。此外,每个创意还包含一段60秒的电梯演讲、一个10页的路演大纲提纲,以及针对科技类创意的MVP代码骨架(可为空)。数据生成过程信息也被记录,包括生成每个部分所使用的特定大语言模型(LLM)以及生成所耗费的挂钟时间(秒)。数据集规模较小(少于1000个样本),以JSON文件格式存储,包含泰语和英语内容,遵循CC-BY-SA-4.0许可协议。数据生成于谷歌云平台(GCP)新加坡区域的SPOT n2-highmem-8实例,并综合利用了包括Cerebras、Groq、OpenRouter、Pollinations、OVHcloud、Cloudflare Workers AI、GitHub Models以及本地Ollama在内的多种LLM提供商和服务。

The axentx Surrogate-2 Business Pipeline is a business idea dataset generated through an automated pipeline, continuously synthesized and output by the axentx burn-loop daemon. The dataset aims to provide structured business idea content suitable for scenarios such as business analysis, entrepreneurship education, and AI-generated content evaluation. The data content includes complete business idea elements: each sample contains a unique sequential ID, a UTC timestamp in ISO 8601 format, and one of 15 weighted business vertical categories. The core data is presented in flattened human-readable text in Markdown format, accompanied by a structured Business Model Canvas (BMC), detailing the idea name, value proposition, target customers, pain points, differentiation advantages, revenue model, market size (TAM/SAM/SOM), startup cost (in Thai Baht), monthly revenue potential (in Thai Baht), and whether it is a tech-related idea. Additionally, each idea includes a 60-second elevator pitch, a 10-page pitch deck outline, and an MVP code skeleton for tech-related ideas (which may be empty). Information about the data generation process is also recorded, including the specific large language model (LLM) used to generate each part and the wall-clock time (in seconds) consumed during generation. The dataset is small in scale (fewer than 1000 samples), stored in JSON file format, contains content in Thai and English, and follows the CC-BY-SA-4.0 license. The data was generated on a SPOT n2-highmem-8 instance in the Google Cloud Platform (GCP) Singapore region, utilizing various LLM providers and services including Cerebras, Groq, OpenRouter, Pollinations, OVHcloud, Cloudflare Workers AI, GitHub Models, and local Ollama.

创建时间:
2026-05-25
原始信息汇总

数据集概述

名称:axentx Surrogate-2 Business Pipeline
许可协议:CC-BY-SA-4.0(需署名,衍生作品需相同方式共享)
语言:泰语(th)、英语(en)
数据规模:小于1,000条(n<1K)
标签:business, startup, business-model-canvas, axentx, pain-point, pitch-deck, mvp

数据内容

数据集包含持续生成的商业创意合成输出,每条记录包含以下字段:

字段 类型 描述
id int 顺序记录ID
timestamp str (ISO 8601) UTC生成时间
category str 商业垂直领域(15个类别,加权分布)
text str (markdown) 扁平化人类可读序列化内容(主要视图)
idea dict 结构化商业模型画布:名称、价值主张、目标客户、问题、差异化因素、收入模型、TAM/SAM/SOM、初创成本(泰铢)、月收入潜力(泰铢)、是否技术驱动
pitch str 60秒电梯演讲
deck str 10页演示文稿大纲
mvp_code str (nullable) 最小可行产品代码骨架(仅针对技术驱动型创意)
models_used dict 各章节由哪个大语言模型生成
wall_clock_seconds float 生成延迟(秒)

数据来源

  • axentx/surrogate-2-burn-loop 在 GCP SPOT n2-highmem-8(新加坡)节点上持续生成
  • 模型来源轮换:Cerebras、Groq、OpenRouter(15个免费模型)、Pollinations、OVHcloud、Cloudflare Workers AI、GitHub Models(13个PAT池)、本地Ollama(qwen3.6/qwen3-coder/gpt-oss)

配置与格式

  • 默认配置名为 default
  • 训练集数据文件路径:ideas/**/*.json
搜集汇总
数据集介绍
surrogate-2-business-pipeline 数据集图片
构建方式
该数据集源自axentx burn-loop守护进程持续运行的商业合成输出,由部署于GCP SPOT n2-highmem-8(新加坡区域)实例上的surrogate-2-burn-loop管道生成。数据采集采用多源模型轮转机制,涵盖Cerebras、Groq、OpenRouter等在内的十五种免费模型、Pollinations、OVHcloud、Cloudflare Workers AI以及GitHub Models的十三个PAT池,并辅以本地Ollama生态中的qwen3.6、qwen3-coder与gpt-oss模型,实现了异构计算资源的低延迟编排与商业创意的批量生成。
特点
数据集收录少于一千条样本,语种覆盖泰语与英语,专注于商业与创业领域。每条记录包含十五个垂直类别的商业模式画布结构化信息,以扁平可读的Markdown序列化文本为主视角。条目提供六十秒电梯推销稿与十页投资演示文稿大纲,技术类创意还附带MVP代码骨架,并完整记录生成所用模型名称与延迟时长,形成全链路可追溯的合成商业数据资产。
使用方法
调用时需通过HuggingFace Datasets库加载axentx/surrogate-2-business-pipeline,默认配置指向ideas目录下所有JSON文件作为训练集。用户可按需解析结构化字段如idea、pitch、deck及mvp_code,用于训练商业计划生成模型、自动化创业评估系统或语言模型的创意启发任务。若进行二次分发或衍生创作,须遵循CC-BY-SA-4.0协议,标注原数据来源axentx并以相同方式共享。
背景与挑战
背景概述
该数据集由axentx研究团队于2024年创建,旨在通过生成式AI技术实现商业创意的持续合成与自动化输出。其核心研究问题聚焦于如何利用多模型协作的生成管线,构建结构化的商业模型画布(BMC),并覆盖从价值主张、目标客户到收入模型等完整商业要素。数据集包含约1000条样本,涵盖15个垂直行业类别,并提供了包括电梯演讲、演示文稿大纲及MVP代码在内的多层次输出。作为开源项目(CC-BY-SA-4.0),Surrogate-2 Business Pipeline为创业研究、商业自动化及多模态生成领域提供了独特的基准资源,推动了生成式AI在商业建模中的实际应用探索。
当前挑战
该数据集所解决的领域挑战在于:传统商业模型构建依赖大量人工分析与专家经验,效率低下且难以规模化,而现有生成式AI工具缺乏针对结构化商业要素的系统化输出能力。在构建过程中,主要挑战包括:如何协调多个异构LLM(如Cerebras、Groq、本地Ollama模型等)的生成质量与一致性,确保商业模型的逻辑连贯;以及在低延迟实时期望下,通过GCP SPOT实例的分布式管线实现稳定持续合成,同时处理非技术类创意与代码生成任务间的异构需求。此外,数据集规模较小(n<1K),如何在有限样本中保持行业覆盖的广度与深度也是一项显著挑战。
常用场景
经典使用场景
Surrogate-2 Business Pipeline 数据集以其结构化的商业创意生成流水线,成为创业研究与商业模型验证领域的标杆资源。该数据集记录了从痛点识别到最小可行产品(MVP)代码骨架的完整商业合成过程,涵盖价值主张、目标客户、收入模型、市场规模(TAM/SAM/SOM)等15个垂直领域的核心要素。研究者可利用其多栏位格式,包括60秒电梯演讲、10页融资料提纲及技术类创意的MVP代码,系统性地分析创业构思的生成逻辑与结构特征,从而为自动化商业创意评估与孵化平台提供训练与评测基础。
实际应用
在实际产业应用中,该数据集可作为企业战略规划与创业加速器的决策辅助引擎。创业孵化器可将其用于自动生成并筛选候选商业方案,帮助创业者快速识别市场痛点、目标客群及差异化定位。风险投资机构能够基于数据集中结构化的收入模型和市场规模估算,搭建自动化尽职调查辅助系统,提升投资决策的理性与效率。此外,技术类创意附带的MVP代码骨架可直接作为快速原型开发的起点,支持企业以低代码方式验证商业假设,加速从概念到产品的转化进程。
衍生相关工作
围绕Surrogate-2 Business Pipeline数据集,衍生工作主要集中于商业创意质量评估模型、跨领域商业模式适配算法以及自动化融资料生成系统。例如,研究者利用其多维标注结构训练了基于Transformer的商业计划书评分器,能够自动预测创意在不同垂直领域的成功概率。另一项经典工作则聚焦于数据集中15个商业垂直领域间的知识迁移,开发出可跨域推荐商业模式要素的图神经网络框架。此外,结合数据集内的MPV代码和电梯演讲文本,衍生出多模态商业创意匹配系统,旨在为创业者推荐最优的技术实现路径与市场进入策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务