companies-dataset
收藏资源简介:
Tracki - 合成公司数据集是一个包含10,196家虚构公司、18个字段的英文数据集,所有字段均由语言模型(Qwen2.5-3B-Instruct和Qwen2.5-0.5B-Instruct)生成。该数据集专为Tracki项目(RUNI数据科学导论课程期末项目)设计,用于实现公司语义搜索和相似推荐:给定一家公司描述,返回最相似的3家公司,以便订阅其社交媒体和网站。数据集涵盖了公司名称、标语、价值主张、行业、目标客户、商业模式、收入模型、部署模型、融资阶段、主要市场、总部国家、成立年份、员工数、总融资额、年收入、公司年龄、阶段排名以及用于嵌入的拼接文本。数据构建过程中采用了严格的验证、过滤和去重流程(包括精确匹配、标准化匹配和语义去重,余弦相似度阈值为0.94),以确保数据质量。该数据集适用于句子相似度、特征提取、文本生成和文本分类等任务,特别适合语义搜索、嵌入模型评估和竞争分析教育项目。注意:所有公司名称均为虚构,可能包含与真实公司名称的巧合匹配,但对应的数据完全为虚构,不应视为真实信息;嵌入文本以行业名称开头,导致最近邻结果高度依赖于行业匹配。
Tracki - Synthetic Company Dataset is an English dataset containing 10,196 fictional companies with 18 fields, all generated by language models (Qwen2.5-3B-Instruct and Qwen2.5-0.5B-Instruct). Designed for the Tracki project (final project for the RUNI Introduction to Data Science course), it enables company semantic search and similarity recommendation: given a company description, return the top 3 most similar companies for subscribing to their social media and websites. The dataset covers company name, tagline, value proposition, industry, target customers, business model, revenue model, deployment model, funding stage, primary market, headquarters country, founding year, number of employees, total funding, annual revenue, company age, stage ranking, and concatenated text for embedding. The data construction process involved rigorous validation, filtering, and deduplication (including exact match, normalized match, and semantic deduplication with cosine similarity threshold 0.94) to ensure quality. This dataset is suitable for tasks such as sentence similarity, feature extraction, text generation, and text classification, particularly for semantic search, embedding model evaluation, and educational projects in competitive analysis. Note: All company names are fictional and may coincidentally match real company names, but the corresponding data is entirely fictional and should not be considered real; the embedding text starts with the industry name, causing nearest neighbor results to be highly dependent on industry matching.
数据集概述
Tracki 合成公司数据集是一个包含 10,196 家虚构公司 的数据集,每条记录包含 18 个字段。所有 15 个内容字段均由语言模型生成,没有任何规则生成的内容。该数据集专为 Tracki 项目(RUNI 数据科学导论)构建,用于通过嵌入技术实现“描述一家公司,返回 3 家最相似公司”的推荐功能。
用途:文本相似度、特征提取、文本生成、文本分类;适用于语义搜索、竞争分析、嵌入模型训练等场景。
规模:10,196 行(10K < N < 100K),单文件 companies_final.parquet,含 train 分割。
语言:英语
许可证:MIT
数据模式(Schema)
| 字段 | 来源 | 观测特征 | 说明 |
|---|---|---|---|
name |
LLM | 10,196 个唯一值 | 虚构公司名称(1-3 个词),批量二次生成 |
tagline |
LLM | 10,196 个唯一值 | 营销标语(2-8 个词),批量二次生成 |
value_prop |
LLM | 10,196 个唯一值 | 单句价值主张,行身份标识与嵌入核心文本 |
industry |
LLM | 15 个值,最高 Fintech 8.2% |
行业领域,生成时显式引导(STEERED) |
target_customer |
LLM | 8 个值,最高 Developers 36.8% |
目标客户 |
business_model |
LLM | 5 个值,最高 B2B 87.3% |
B2B / B2C / B2B2C / D2C / B2G |
revenue_model |
LLM | 5 个值,最高 Subscription 52.8% |
收费模式 |
deployment_model |
LLM | 4 个值,最高 Cloud 97.3% |
交付方式 |
funding_stage |
LLM | 8 个值,最高 Series A 13.5% |
融资阶段(有序),生成时显式引导(STEERED) |
primary_market |
LLM | 3 个值,最高 Global 85.7% |
销售市场 |
hq_country |
LLM | 7 个值,最高 USA 99.0% |
总部所在地 |
founded_year |
LLM | 2005–2024,20 个不同值 | 成立年份 |
num_employees |
LLM | 4–13000,61 个不同值 | 员工人数,与融资阶段带宽校验 |
funding_total_usd_m |
LLM | 0–3000,76 个不同值 | 融资总额(百万美元),与融资阶段带宽校验 |
annual_revenue_usd_m |
LLM | 0–7500,121 个不同值 | 年收入(百万美元),与融资阶段带宽校验 |
company_age |
工程派生 | 2–21,20 个不同值 | 2026 - founded_year,确定性派生 |
stage_rank |
工程派生 | 0–7,8 个不同值 | funding_stage 的整数排名,确定性派生 |
embed_text |
工程派生 | 10,196 个唯一值 | 旧版 7 列拼接文本,非推荐器实际嵌入文本(实际嵌入 tagline + value_prop) |
构建方式
- 生成模型:
Qwen/Qwen2.5-3B-Instruct(主生成),Qwen/Qwen2.5-0.5B-Instruct(名称和标语二次批量生成) - 并行生成:3 个 Colab 笔记本(种子 42/43/44),每个负责 5 个行业,GPU 批量提示,循环内验证并过滤
- 引导策略:仅
industry和funding_stage被显式引导(每批一个值),其余 13 个内容字段完全由模型自由选择 - 拒绝机制:违反任何边界的行直接丢弃,不修复
去重流程
| 步骤 | 去重前 | 去重后 | 移除 |
|---|---|---|---|
精确 value_prop 去重 |
10,810 | 10,803 | -7 |
规范化 value_prop 去重 |
10,803 | 10,782 | -21 |
语义 value_prop 去重(cosine > 0.94) |
10,782 | 10,196 | -586 |
使用 sentence-transformers/all-MiniLM-L6-v2 进行语义去重,移除近重复行。
行计数
| 阶段 | 行数 |
|---|---|
| 生成尝试 | 12,436 |
| 被边界验证器拒绝 | 1,626 |
| 写入分片 | 10,810 |
| 去重后存活 | 10,196 |
| 发布 | 10,196 |
- 行级有效性:86.93%(所有尝试中满足边界条件的比例)
- 端到端产出率:81.99%(所有尝试中最终发布的比例)
数据特性与分布
分布坍缩(Distribution Collapse)
13 个自由选择字段显示模型偏好高度集中:
| 字段 | 可选项 | 实际使用 | 未使用选项 | 最高频值 |
|---|---|---|---|---|
hq_country |
15 | 7 | 8 | USA 99.0% |
deployment_model |
5 | 4 | 1 | Cloud 97.3% |
business_model |
5 | 5 | - | B2B 87.3% |
primary_market |
7 | 3 | 4 | Global 85.7% |
revenue_model |
7 | 5 | 2 | Subscription 52.8% |
target_customer |
8 | 8 | - | Developers 36.8% |
funding_stage |
8 | 8 | - | Series A 13.5% |
industry |
15 | 15 | - | Fintech 8.2% |
网格锁定(Grid-lock)
数值字段值高度集中:如 founded_year 中 20 个不同值,最高 2018 占 21.3%,前 10 个值覆盖 95.6%。
冗余性
company_age与founded_year完全确定性相关(Spearman ρ = -1.000)stage_rank与funding_stage完全确定性相关- 建议:不要将同一对字段同时输入模型
- 8.47% 的行在所有非文本列上完全重复
一致性验证
所有数值均由模型选择,超出融资阶段带宽的行被丢弃。总体带宽符合率(12,436 次尝试中):
| 检查项 | 通过率 |
|---|---|
| 所有带宽同时满足 | 95.05% |
| 融资额在阶段带宽内 | 97.79% |
| 员工数在阶段带宽内 | 99.58% |
| 收入在阶段带宽内 | 99.96% |
| 人均收入合理 | 97.74% |
已知问题与注意事项
与真实公司的名称冲突
已知有 10 个完全匹配(10 行)和 19 个首词匹配(23 行)的真实公司名称:
Asana, Figma, HubSpot, Instacart, Mixpanel, Mosaic, Salesforce, Slack, Zendesk, Zoom
这些行完全虚构,不应视为指向真实组织。这是下限估计,手工屏蔽列表可能遗漏更多。
推荐器依赖关系
embed_text在 100% 的行中以行业名称开头,导致 98.8% 的最近邻行共享相同行业(随机基线为 7.1%)- 语义去重(0.94 阈值)后仍留有接近重复对,58.54% 的行的最近邻余弦相似度 ≥ 0.80
相关生成(Part 3+4)
generation/ 目录包含一个竞争对手动态生成器,根据公司信息预测其可能发布的公告(用于演示社交/新闻追踪功能)。
- 模型:
Qwen/Qwen2.5-0.5B-Instruct - 类型约束:公告类型受
funding_stage约束(如种子轮公司不能 IPO) - 关键词提取:关键词为派生而非生成(来自公司名称、公告类型、行业列)
- 验证策略:帖子经过严格筛查(字数、句子数、非英文、真实公司名、禁用开头、机器写作痕迹、无根据数字、重复检测),失败则拒绝,不修复
使用建议
- 数据内容:所有公司均为虚构,适合语义搜索、嵌入模型评估、竞争分析演示等用途
- 避免直接用作真实商业数据
- 注意字段冗余性:不要同时使用
company_age与founded_year、或stage_rank与funding_stage - 嵌入建议:推荐使用
tagline + value_prop而非embed_text(后者含冗余前缀)





