遇见数据集

Indian_Companies_Information

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

印度公司目录数据集是一个结构化数据集,包含通过自动网络爬虫收集的9,305多家印度公司的信息,并经过整理以供分析和机器学习工作流使用。数据集采用干净的表格格式,包含公司名称、行业、评级、评论数量、总部和位置详情等字段。该数据集适用于研究人员、学生、开发人员和数据科学家,可用于商业智能、搜索系统、推荐引擎、检索增强生成(RAG)、知识图谱构建、公司信息系统和教学项目等应用。数据格式为CSV和XLSX,收集方法为基于Python的网络爬虫技术,使用Requests、BeautifulSoup和Pandas进行处理。数据集基于CC-BY-4.0许可证发布,主要用于教育、研究和分析目的。

The Indian Company Directory dataset is a structured dataset containing information on over 9,305 Indian companies collected via automated web crawling and organized for analysis and machine learning workflows. It features a clean tabular format with fields such as company name, industry, rating, number of reviews, headquarters, and location details. This dataset is suitable for researchers, students, developers, and data scientists, and can be applied in business intelligence, search systems, recommendation engines, retrieval-augmented generation (RAG), knowledge graph construction, company information systems, and educational projects. The data is available in CSV and XLSX formats, collected using Python-based web crawling techniques with Requests, BeautifulSoup, and Pandas for processing. It is released under the CC-BY-4.0 license and intended primarily for educational, research, and analytical purposes.

创建时间:
2026-07-23
原始信息汇总

数据集概述

  • 名称:Indian Companies Directory Dataset(印度公司目录数据集)
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 国家:印度
  • 数据规模:9,305 条以上公司记录
  • 数据格式:CSV、XLSX
  • 数据类型:结构化表格数据
  • 数据收集方法:基于 Python 的网页爬虫(使用 Requests、BeautifulSoup、Pandas)
  • 数据处理:数据清洗与格式化

数据特征

数据集包含以下字段:

  • 公司名称(Company Name)
  • 行业(Industry)
  • 公司评分(Company Rating)
  • 评论数量(Review Count)
  • 总部(Headquarters)
  • 其他地点(Other Locations)

应用场景

  • 商业智能
  • 机器学习
  • 数据分析
  • 搜索系统
  • 推荐引擎
  • 检索增强生成(RAG)
  • 知识图谱构建
  • 公司信息系统
  • 教育项目

文件结构

Indian_Companies_Directory_Dataset/ ├── Companies_Dataset.csv ├── Companies_Dataset.xlsx ├── Web_Scraping.ipynb ├── README.md └── LICENSE

加载数据集示例

python import pandas as pd

df = pd.read_csv("Companies_Dataset.csv") print(df.head())

注意事项

  • 数据集仅供教育、研究和分析用途。
  • 用户需确保遵守原始数据源的使用条款。
  • 部分公司信息可能随时间发生变化。

未来更新计划

未来版本可能包含以下信息:

  • 公司网站
  • 员工规模
  • 公司描述
  • 成立年份
  • 收入信息
  • 其他商业元数据

作者

  • 姓名:Tanmay Kala
  • 简介:AI 工程师,专注于生成式 AI、自然语言处理、Hugging Face
  • GitHub:https://github.com/tanmayai23
  • LinkedIn:https://linkedin.com/in/tanmay-kala
搜集汇总
数据集介绍
Indian_Companies_Information 数据集图片
构建方式
Indian_Companies_Information 数据集通过自动化网络爬取技术,基于 Python 的 Requests 和 BeautifulSoup 库从多个在线来源提取企业数据,随后利用 Pandas 进行数据清洗与格式化,最终生成结构化的表格形式。该过程确保了数据的整洁性和一致性,最终收录了超过 9,305 家印度公司的信息,涵盖公司名称、所属行业、评分、评论数量、总部地址及分支机构等字段。数据集以 CSV 和 XLSX 两种格式发布,便于不同场景下的直接使用。
特点
该数据集的核心特点在于其高度结构化的组织形式和丰富的信息维度,涵盖了公司名称、行业类别、用户评分、评论数量、总部位置及多地点详情,为商业智能与机器学习提供了坚实的基础。数据规模适中,包含 9,305 条记录,语言为英语,适用于检索增强生成、知识图谱构建以及推荐系统开发等前沿领域。其通过自动化采集与后期标准化处理,平衡了数据广度与质量,尤其适合作为研究印度企业生态的参考资源。
使用方法
用户可通过简单的数据加载方式快速集成该数据集,例如使用 Pandas 库中的 pd.read_csv 函数直接读取 CSV 文件,或通过 Excel 兼容工具打开 XLSX 格式。加载后,数据集可直接用于业务分析、模型训练或搜索系统开发,如执行基于公司评分或行业的筛选、构建推荐算法,或作为 RAG 系统的知识源。此外,数据集附带了 Web_Scraping.ipynb 脚本,用户可参考其采集流程进行扩展或定制更新。
背景与挑战
背景概述
在商业智能与机器学习领域,结构化企业数据是支撑决策分析、推荐系统及知识图谱构建的基础资源。由AI工程师Tanmay Kala于近期创建的Indian_Companies_Information数据集,通过自动化网络爬取技术收集了9305家以上印度公司的结构化信息,涵盖公司名称、行业分类、用户评分、评论数量及总部地点等维度。该数据集以CSV和XLSX格式发布,遵循CC-BY-4.0许可,旨在为研究者、开发者及数据科学家提供标准化的印度企业数据源,推动区域商业分析、检索增强生成及教育项目的进展,弥补了印度企业目录在开放数据集领域的稀缺性。
当前挑战
该数据集主要面临两大挑战。在领域问题层面,虽然其专注于印度公司信息目录构建,但缺乏对非结构化商业信息(如公司网站、雇员规模、成立年份及营收数据)的整合,限制了其在复杂商业分析及预测模型中的深度应用。在构建过程中,由于数据完全依赖网络爬取,原始来源的时效性差异导致部分公司信息可能过时,且合规性要求使用者需自行验证与原始数据源的条款一致性;此外,数据集规模仅达到数千级别,难以覆盖印度庞大的企业生态,对跨行业、地域的泛化分析造成局限。
常用场景
经典使用场景
Indian_Companies_Information数据集汇聚了印度9305余家企业的结构化信息,涵盖公司名称、行业归属、评级评分、评论数量以及总部与分支机构地址等核心字段。该数据集的典型应用场景聚焦于商业智能分析,研究人员能够借此洞悉印度市场的行业分布格局与企业竞争力。通过统计各行业的企业数量与评级分布,可勾勒出不同领域的商业活力图谱;结合评论数量等指标,则可量化企业的市场声誉与客户参与度。此外,该数据还能支持企业信息检索系统的构建,为投资者、创业者与市场分析师提供快速定位目标公司的基础数据索引。
实际应用
实际应用层面,Indian_Companies_Information数据集构成了企业搜索引擎与推荐系统的底层引擎。开发者可利用公司名称、行业分类及地理位置等字段,搭建面向印度市场的企业信息查询平台,助力用户快速筛选符合业务需求的目标企业。在检索增强生成(RAG)场景中,该数据集可作为知识库注入语言模型,赋能客服机器人或智能助手回答关于印度公司的实时查询。电商或商业服务平台亦可基于评级与评论数据,实现个性化企业推荐,提升用户决策效率与商业匹配精准度。
衍生相关工作
围绕Indian_Companies_Information数据集,已衍生出多项具有影响力的经典工作。在嵌入式表示学习方向,研究者利用公司名称与行业标签训练企业实体向量,将其融入企业相似度计算与聚类分析任务。部分工作将其作为知识图谱构成节点,与外部公开数据源(如公司财报或新闻文本)联合构建多模态企业关系网络,推动跨源信息融合技术的演进。在商业智能流水线中,该数据集被用作分类与回归任务的基准,促进了面向企业评级的预测模型优化。此外,它还为数据驱动的地理经济分析提供了样本,支撑了关于印度区域产业集聚模式的探索性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务