遇见数据集

companies-dataset

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Tracki - 合成公司数据集是一个包含10,196家虚构公司、18个字段的英文数据集,所有字段均由语言模型(Qwen2.5-3B-Instruct和Qwen2.5-0.5B-Instruct)生成。该数据集专为Tracki项目(RUNI数据科学导论课程期末项目)设计,用于实现公司语义搜索和相似推荐:给定一家公司描述,返回最相似的3家公司,以便订阅其社交媒体和网站。数据集涵盖了公司名称、标语、价值主张、行业、目标客户、商业模式、收入模型、部署模型、融资阶段、主要市场、总部国家、成立年份、员工数、总融资额、年收入、公司年龄、阶段排名以及用于嵌入的拼接文本。数据构建过程中采用了严格的验证、过滤和去重流程(包括精确匹配、标准化匹配和语义去重,余弦相似度阈值为0.94),以确保数据质量。该数据集适用于句子相似度、特征提取、文本生成和文本分类等任务,特别适合语义搜索、嵌入模型评估和竞争分析教育项目。注意:所有公司名称均为虚构,可能包含与真实公司名称的巧合匹配,但对应的数据完全为虚构,不应视为真实信息;嵌入文本以行业名称开头,导致最近邻结果高度依赖于行业匹配。

Tracki - Synthetic Company Dataset is an English dataset containing 10,196 fictional companies with 18 fields, all generated by language models (Qwen2.5-3B-Instruct and Qwen2.5-0.5B-Instruct). Designed for the Tracki project (final project for the RUNI Introduction to Data Science course), it enables company semantic search and similarity recommendation: given a company description, return the top 3 most similar companies for subscribing to their social media and websites. The dataset covers company name, tagline, value proposition, industry, target customers, business model, revenue model, deployment model, funding stage, primary market, headquarters country, founding year, number of employees, total funding, annual revenue, company age, stage ranking, and concatenated text for embedding. The data construction process involved rigorous validation, filtering, and deduplication (including exact match, normalized match, and semantic deduplication with cosine similarity threshold 0.94) to ensure quality. This dataset is suitable for tasks such as sentence similarity, feature extraction, text generation, and text classification, particularly for semantic search, embedding model evaluation, and educational projects in competitive analysis. Note: All company names are fictional and may coincidentally match real company names, but the corresponding data is entirely fictional and should not be considered real; the embedding text starts with the industry name, causing nearest neighbor results to be highly dependent on industry matching.

创建时间:
2026-08-24
原始信息汇总

数据集概述

Tracki 合成公司数据集是一个包含 10,196 家虚构公司 的数据集,每条记录包含 18 个字段。所有 15 个内容字段均由语言模型生成,没有任何规则生成的内容。该数据集专为 Tracki 项目(RUNI 数据科学导论)构建,用于通过嵌入技术实现“描述一家公司,返回 3 家最相似公司”的推荐功能。

用途:文本相似度、特征提取、文本生成、文本分类;适用于语义搜索、竞争分析、嵌入模型训练等场景。

规模:10,196 行(10K < N < 100K),单文件 companies_final.parquet,含 train 分割。

语言:英语

许可证:MIT


数据模式(Schema)

字段 来源 观测特征 说明
name LLM 10,196 个唯一值 虚构公司名称(1-3 个词),批量二次生成
tagline LLM 10,196 个唯一值 营销标语(2-8 个词),批量二次生成
value_prop LLM 10,196 个唯一值 单句价值主张,行身份标识与嵌入核心文本
industry LLM 15 个值,最高 Fintech 8.2% 行业领域,生成时显式引导(STEERED)
target_customer LLM 8 个值,最高 Developers 36.8% 目标客户
business_model LLM 5 个值,最高 B2B 87.3% B2B / B2C / B2B2C / D2C / B2G
revenue_model LLM 5 个值,最高 Subscription 52.8% 收费模式
deployment_model LLM 4 个值,最高 Cloud 97.3% 交付方式
funding_stage LLM 8 个值,最高 Series A 13.5% 融资阶段(有序),生成时显式引导(STEERED)
primary_market LLM 3 个值,最高 Global 85.7% 销售市场
hq_country LLM 7 个值,最高 USA 99.0% 总部所在地
founded_year LLM 2005–2024,20 个不同值 成立年份
num_employees LLM 4–13000,61 个不同值 员工人数,与融资阶段带宽校验
funding_total_usd_m LLM 0–3000,76 个不同值 融资总额(百万美元),与融资阶段带宽校验
annual_revenue_usd_m LLM 0–7500,121 个不同值 年收入(百万美元),与融资阶段带宽校验
company_age 工程派生 2–21,20 个不同值 2026 - founded_year,确定性派生
stage_rank 工程派生 0–7,8 个不同值 funding_stage 的整数排名,确定性派生
embed_text 工程派生 10,196 个唯一值 旧版 7 列拼接文本,推荐器实际嵌入文本(实际嵌入 tagline + value_prop

构建方式

  • 生成模型Qwen/Qwen2.5-3B-Instruct(主生成),Qwen/Qwen2.5-0.5B-Instruct(名称和标语二次批量生成)
  • 并行生成:3 个 Colab 笔记本(种子 42/43/44),每个负责 5 个行业,GPU 批量提示,循环内验证并过滤
  • 引导策略:仅 industryfunding_stage 被显式引导(每批一个值),其余 13 个内容字段完全由模型自由选择
  • 拒绝机制:违反任何边界的行直接丢弃,不修复

去重流程

步骤 去重前 去重后 移除
精确 value_prop 去重 10,810 10,803 -7
规范化 value_prop 去重 10,803 10,782 -21
语义 value_prop 去重(cosine > 0.94) 10,782 10,196 -586

使用 sentence-transformers/all-MiniLM-L6-v2 进行语义去重,移除近重复行。

行计数

阶段 行数
生成尝试 12,436
被边界验证器拒绝 1,626
写入分片 10,810
去重后存活 10,196
发布 10,196
  • 行级有效性:86.93%(所有尝试中满足边界条件的比例)
  • 端到端产出率:81.99%(所有尝试中最终发布的比例)

数据特性与分布

分布坍缩(Distribution Collapse)

13 个自由选择字段显示模型偏好高度集中:

字段 可选项 实际使用 未使用选项 最高频值
hq_country 15 7 8 USA 99.0%
deployment_model 5 4 1 Cloud 97.3%
business_model 5 5 - B2B 87.3%
primary_market 7 3 4 Global 85.7%
revenue_model 7 5 2 Subscription 52.8%
target_customer 8 8 - Developers 36.8%
funding_stage 8 8 - Series A 13.5%
industry 15 15 - Fintech 8.2%

网格锁定(Grid-lock)

数值字段值高度集中:如 founded_year 中 20 个不同值,最高 2018 占 21.3%,前 10 个值覆盖 95.6%。

冗余性

  • company_agefounded_year 完全确定性相关(Spearman ρ = -1.000)
  • stage_rankfunding_stage 完全确定性相关
  • 建议:不要将同一对字段同时输入模型
  • 8.47% 的行在所有非文本列上完全重复

一致性验证

所有数值均由模型选择,超出融资阶段带宽的行被丢弃。总体带宽符合率(12,436 次尝试中):

检查项 通过率
所有带宽同时满足 95.05%
融资额在阶段带宽内 97.79%
员工数在阶段带宽内 99.58%
收入在阶段带宽内 99.96%
人均收入合理 97.74%

已知问题与注意事项

与真实公司的名称冲突

已知有 10 个完全匹配(10 行)和 19 个首词匹配(23 行)的真实公司名称: Asana, Figma, HubSpot, Instacart, Mixpanel, Mosaic, Salesforce, Slack, Zendesk, Zoom

这些行完全虚构,不应视为指向真实组织。这是下限估计,手工屏蔽列表可能遗漏更多。

推荐器依赖关系

  • embed_text 在 100% 的行中以行业名称开头,导致 98.8% 的最近邻行共享相同行业(随机基线为 7.1%)
  • 语义去重(0.94 阈值)后仍留有接近重复对,58.54% 的行的最近邻余弦相似度 ≥ 0.80

相关生成(Part 3+4)

generation/ 目录包含一个竞争对手动态生成器,根据公司信息预测其可能发布的公告(用于演示社交/新闻追踪功能)。

  • 模型Qwen/Qwen2.5-0.5B-Instruct
  • 类型约束:公告类型受 funding_stage 约束(如种子轮公司不能 IPO)
  • 关键词提取:关键词为派生而非生成(来自公司名称、公告类型、行业列)
  • 验证策略:帖子经过严格筛查(字数、句子数、非英文、真实公司名、禁用开头、机器写作痕迹、无根据数字、重复检测),失败则拒绝,不修复

使用建议

  1. 数据内容:所有公司均为虚构,适合语义搜索、嵌入模型评估、竞争分析演示等用途
  2. 避免直接用作真实商业数据
  3. 注意字段冗余性:不要同时使用 company_agefounded_year、或 stage_rankfunding_stage
  4. 嵌入建议:推荐使用 tagline + value_prop 而非 embed_text(后者含冗余前缀)
搜集汇总
数据集介绍
companies-dataset 数据集图片
构建方式
该数据集由Tracki项目精心构筑,旨在为初创企业描述与竞品分析提供生成式数据基础。构建过程中,研究团队采用三台并行Colab实例,分别以不同随机种子驱动Qwen2.5-3B-Instruct模型,对涵盖十五个行业的公司画像进行批量生成。每一批次均经实时验证与过滤,凡触及约束边界的样本即被剔除而非修复,以保证数据纯净。其后,利用Qwen2.5-0.5B模型对名称与标语执行二次批量生成,通过上下文参照规避重复。两列受导向字段(行业与融资阶段)虽为显式指定,但内容仍由模型自主撰写,不匹配者即废弃。经严格的重复消除级联(包括精确匹配、归一化匹配及基于MiniLM的语义去重),最终保留10,196条独特公司记录,确保每条价值主张独一无二。
特点
此数据集蕴含104个内容字段皆出自语言模型之手,非规则生成,体现了高度的真实性和多样性。然而,数据的分布特征深刻揭示了小规模指令微调模型的固有先验:如总部所在国美国占比99%,部署模式云端占97.3%,B2B商业模式占87.3%,呈现显著集中趋势。数值字段虽存在栅格化现象,如成立年份集中于2018年,但各融资阶段的资金与雇员规模均与阶段带校验一致,且未辅助合规率达95%,显示了内在逻辑的严密性。值得注意的是,数据中可能存在与真实企业名称的意外碰撞,但所有人物与数字皆属虚构,且已声明为下限。此外,列间的确定性冗余(如公司年龄与成立年份完全相关)提示模型应谨慎使用,而高相似性残留对推荐系统构成潜在挑战。
使用方法
此数据集专为语义搜索与文本嵌入任务设计,推荐引擎使用户以自然语言描述目标企业,即可检索出最相似的三家公司,进而订阅其社交媒体与网站动态。使用中应拼接公司与价值主张作为嵌入文本,避免使用包含行业前缀的旧有文本列,因其可能导致相似度偏向行业匹配。数据集亦可用于训练文本分类或特征提取模型,支持对商业模式、融资阶段等属性的预测。伴随数据集提供的生成器脚本,可依据检索结果模拟公司公告,用于演示追踪功能而无需调用外部API。分析者需留意类别不平衡与数值聚集现象,注意不要将确定性衍生列作为独立特征馈入模型,以防共线性干扰。建议在评估嵌入模型时,对去除样板前缀的变体进行对比测试。
背景与挑战
背景概述
该数据集由Tracki项目(RUNI - 数据科学导论)于2023年创建,由RUNI团队利用Qwen2.5系列语言模型生成,旨在构建一个包含10,196家虚构公司描述的综合型数据集,用于语义搜索和推荐系统研究。其核心研究问题是探索合成数据在竞争分析、嵌入式相似性匹配中的有效性,尤其是为创业公司提供相似企业推荐服务。该数据集提供了18个多样化字段,涵盖公司核心属性,并经过严格的校验与去重流程,确保了数据质量与可用性,对合成数据生成、语义嵌入及数据集构建方法论领域具有重要参考价值。
当前挑战
该数据集面临的挑战包括两个方面。在领域问题层面,其旨在解构公司相似性判断中的表征学习难题:传统方法多依赖行业分类,而该数据集通过生成多样化的文本描述(如价值主张、标语等)以捕捉更深层的语义关联,同时暴露了模型分布坍缩——15个非引导列中有8个高度集中于少数取值(如总部所在地美国占99%),导致多样性受限。在构建过程中,需克服生成数据的有效性和一致性门槛:12,436次生成尝试中13.07%被拒绝,主要体现在文本格式不符、边界违反及语义重复;此外,通过语义去重(余弦相似度>0.94)移除近重复项,确保每行独特性,并需处理与现实公司名的冲突(发现了10个精确匹配),同时保证数据不产生误导性。
常用场景
经典使用场景
该数据集包含10,196家虚构公司的丰富结构化信息,涵盖名称、标语、价值主张、行业、融资阶段等15个由语言模型生成的内容字段,专为语义相似度检索与嵌入模型评估而设计。其核心应用场景在于通过计算公司描述文本的向量表示,实现精准的相似公司推荐,例如给定一家初创公司的简介,系统可返回最相似的三家公司,以支持市场情报与竞争分析。此外,该数据集还可用于句向量模型的微调与基准测试,以及作为文本生成任务的模拟语料,为信息检索、推荐系统和自然语言处理研究提供可控的合成数据环境。
衍生相关工作
伴随该数据集产生的衍生产物包括一套用于模型输出验证的完备规则体系,其边界校验与拒绝机制启发了针对合成数据管道的质量控制研究,尤其是如何通过约束采样和语义去重提升生成内容的真实性和多样性。此外,数据集的构建流程催生了关于小语言模型在结构化生成任务中分布偏差的深入探讨,相关分析(如分布坍缩、数值网格锁定)为后续工作提供了评估合成数据同质性的测量方法。其生成器部分所采用的阶段条件化公告生成策略,亦为面向时间线一致性的内容合成提供了范例,可能引发关于如何平衡模型自由生成与外部约束的更广泛学术讨论。
数据集最近研究
最新研究方向
该合成数据集的最新研究方向聚焦于利用大语言模型生成企业档案,并以此测试与优化语义检索系统,特别是在处理生成文本的分布坍缩、冗余性和一致性等挑战。研究前沿涉及通过非规则化生成、语义去重以及基于阶段的约束验证,来评估文本嵌入模型在企业相似性推荐中的表现,同时探索生成式预训练模型(如Qwen2.5)在商业场景下的数据合成能力。该工作对提升AI在竞争分析、市场情报和社交媒体内容跟踪等应用中的可靠性与真实性具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务