遇见数据集

bangladeshi-jobs

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Bangladeshi Tech Jobs 是一个每周刷新的孟加拉国技术职位开放数据集,涵盖了来自孟加拉国软件和IT公司的公开职位信息。该数据集通过自动爬取、LLM提取和数据仓库管道构建,提供结构化的职位数据。数据以JSON、Parquet和DuckDB星型模式发布,主要事实表包含职位ID、公司名称、职位标题、描述、雇佣类型、地点、薪资范围、截止日期、标签、申请链接等字段。截至2026年8月21日,数据集包含558个公开职位、73家正在招聘的公司、572种不同技能需求,并支持远程、混合和现场办公模式。数据集适用于文本检索、特征提取、职位市场分析、技能需求分析等任务。数据遵循CC-BY-4.0许可,要求注明出处。

Bangladeshi Tech Jobs is a weekly refreshed dataset of open tech job positions in Bangladesh, covering public job information from software and IT companies in Bangladesh. The dataset is built through automated scraping, LLM extraction, and data warehouse pipeline, providing structured job data. It is published in JSON, Parquet, and DuckDB star schema formats. The main fact table includes fields such as job ID, company name, job title, description, employment type, location, salary range, deadline, tags, application link, etc. As of August 21, 2026, the dataset contains 558 open positions, 73 companies hiring, 572 different skill requirements, and supports remote, hybrid, and on-site work modes. The dataset is suitable for tasks such as text retrieval, feature extraction, job market analysis, and skill demand analysis. The data is licensed under CC-BY-4.0, requiring attribution.

创建时间:
2026-08-21
原始信息汇总

Bangladeshi Tech Jobs 数据集概述

基本信息

  • 数据集名称:Bangladeshi Tech Jobs(孟加拉国科技岗位)
  • 许可证:CC-BY-4.0(允许自由使用,需注明出处)
  • 语言:英语(en)、孟加拉语(bn)
  • 任务类型:文本检索、特征提取
  • 数据规模:1K < n < 10K
  • 更新频率:每周自动刷新

数据内容

该数据集收录了来自孟加拉国科技公司的软件与IT岗位招聘信息,通过自动化爬取→LLM提取→数据仓库的流水线构建而成。具体包括:

  • 注册公司数:234家
  • 已验证招聘页面的公司:140家
  • 当前正在招聘的公司:73家
  • 开放职位数:558个
  • 累计追踪职位数:558个
  • 需求技能种类:572种
  • 支持远程的职位:10个
  • 中位最高月薪(明示薪资):60,000 ৳(孟加拉塔卡)
  • 最活跃招聘方:Next Ventures
  • 最热门技能:Python

文件结构

数据集提供多种格式,涵盖不同层级的数据视图:

文件/目录 说明
gold/ 推荐入口点(JSON + Parquet),含 recent_jobscompaniestech_demandjobs_per_companylocation_heatmapsalary_statsemployment_breakdowncompany_techstats.json
parquet/ 规范化表:fact_job(职位事实表)、dim_company(公司维度表)、bridge_job_tag(职位-标签关联表)、job_snapshot(SCD历史记录)
warehouse.duckdb 完整的DuckDB星型模式,可原地查询
raw/job-posts.json 爬虫原始输出(数据源)

核心表结构(fact_job)

主要字段包括:

  • job_id:主键(sha256哈希),跨运行稳定
  • company_name:公司名称(匹配公司注册表)
  • title / description_md:职位名称与清理后的Markdown描述
  • employment_type:全职/兼职/合同/实习/自由职业/临时
  • location_text / location_type:远程/混合/现场
  • salary_min / salary_max / currency:显式薪资范围(强制min ≤ max)
  • deadline_date / is_open / is_expired:截止日期与开放状态
  • tags:规范化技能标签(如React、NodeJS、PostgreSQL)
  • apply_links / source_url:申请链接与来源追溯
  • first_seen_at / last_seen_at:首次与最后出现时间戳

数据流水线

公司招聘页面(孟加拉软件公司注册表) → 爬虫(ATS JSON API → schema.org JSON-LD → Markdown + 分页) → LLM批量提取(受模式约束) → LLM精炼优化(按ID对齐的清洗批次) → 确定性增强(去重、置信度≥0.5门槛、薪资合理性检查) → DuckDB数据仓库(按job_id幂等更新) → gold视图 → 每周刷新

数据来源为公司官方招聘页面及BDJobs招聘板(仅限注册雇主,排除无关发帖者),每个职位保留原始 source_url

质量保障

  • 去重:同一公司内相同(职位、地点)保留最高置信度记录
  • 置信度门槛:低于0.5的记录发布前剔除
  • 薪资合理性:仅保留显式薪资,min ≤ max,货币标准化
  • 新鲜度:过期职位从所有“开放”视图中过滤,逐行记录 last_seen_at
  • 幂等重建:相同输入产生相同 job_id,每周运行不产生重复数据

使用方式

可通过以下方式快速访问数据:

  • 命令行curl 获取 gold/stats.json 获取关键指标
  • Pythonpandas 读取 gold/recent_jobs.json 进行分析
  • SQL:DuckDB 直接远程查询Parquet文件,无需下载

局限性

  • 描述和结构化字段由LLM提取,可能存在少量提取噪声(已通过精炼流程和置信度门槛缓解)
  • 薪资仅在招聘方明确写明时才收录(约占少数职位)
  • 覆盖范围限于注册公司名单;未注册的公司即使在其他招聘板发布信息也不会被收录

引用方式

bibtex @dataset{bangladeshi_tech_jobs_2026, title = {Bangladeshi Tech Jobs — Open Dataset}, author = {swadhinbiswas}, year = {2026}, url = {https://huggingface.co/datasets/swadhinbiswas/bangladeshi-jobs}, note = {Weekly-refreshed job postings from Bangladeshi software companies} }

搜集汇总
数据集介绍
bangladeshi-jobs 数据集图片
构建方式
该数据集通过自动化管道构建,涵盖从孟加拉国科技公司职业页面及BDJobs招聘板(仅限注册雇主)的爬取、LLM抽取、精炼与增强,最终载入DuckDB数据仓库。爬取阶段利用ATS JSON API与schema.org JSON-LD提取职位详情,LLM进行架构约束的批量抽取及id对齐的清洗,确定性增强器执行去重、置信度过滤(≥0.5)与薪资合理性校验。数据以JSON、Parquet及DuckDB星型模式发布,每周自动刷新,确保稳定且可追溯。
特点
数据集具备多项质量保障特性,包括基于sha256的稳定job_id去重、明确薪资字段的合法性校验(min≤max)、过期职位的自动过滤、以及last_seen_at的时效跟踪。覆盖573家公司、558个职位与572种技能,提供多维度分析视图,如技能需求、公司招聘速率、地点分布与薪资统计,且所有职位保留原始source_url以确保来源可溯。数据许可为CC-BY-4.0,支持广泛复用。
使用方法
使用者可通过HuggingFace Hub直接下载gold视图(JSON/Parquet)快速获取摘要统计或最新职位,亦可利用DuckDB引擎对Parquet文件执行SQL查询,无需下载完整数据。Python用户可结合pandas进行灵活的数据帧操作,或查询stats.json获取关键KPI。数据支持技能筛选(如React)、薪资排序及公司分组分析,适用于劳动力市场研究、技能需求监测或招聘趋势分析,推荐在引用时附上官方citation。
背景与挑战
背景概述
在数字化转型浪潮席卷全球之际,孟加拉国的科技产业正经历前所未有的蓬勃发展,而这一进程却长期受制于高质量、结构化就业数据匮乏的困境。为填补这一关键空白,研究者swadhinbiswas于2026年构建了名为bangladeshi-jobs的开源数据集,该数据集以周为周期自动更新,系统性收录孟加拉国软件与IT行业的公开职位信息。这项成果依托一套精巧的自动化流水线,融合网络爬虫、大语言模型信息抽取及数据仓库技术,最终以JSON、Parquet及DuckDB星型架构等多种格式呈现,并遵循CC-BY-4.0许可协议向公众开放。该数据集的核心贡献在于为劳动力市场分析、技能需求洞察及教育课程优化等领域研究提供了坚实的数据基石,其规范的架构与详尽的质量控制机制,标志着南亚区域就业数据研究在开放性、标准化与可重复性上迈出了重要一步。
当前挑战
该数据集在精准捕捉动态就业市场这一核心领域问题上面临诸多挑战。首要挑战在于如何确保数据的实时性与完整性,职位信息瞬息万变,网页抓取与信息抽取环节易产生延迟或遗漏,而自动化的流水线虽提升了效率,却难以完全规避数据噪声与字段提取误差。鉴于描述性字段由大语言模型生成,罕见的抽取误差仍会渗入最终数据,尽管通过置信度阈值与二次精炼能有效缓解,却无法彻底根除。此外,数据的覆盖范围受限于预先登记的公司清单,这导致大量未纳入名单的初创企业或小型科技公司的招聘信息未能被收录,从而可能造成对市场全貌的系统性低估。在数据构建过程中,有效去重、缺失薪资字段的稀疏性处理以及不同数据源间的格式统一,皆是技术实现层面的关键障碍,而如何在保持数据质量的前提下实现每周稳定可靠的数据更新,则构成了持续性的运维挑战。
常用场景
经典使用场景
该数据集为孟加拉国技术就业市场的研究提供了结构化的最新数据源,适用于劳动力市场分析、技能需求预测和薪资趋势挖掘。其核心应用包括:通过查询`fact_job`表分析各技术岗位的供需动态,利用`tech_demand`视图评估特定编程语言或框架的市场热度,以及基于`location_heatmap`和`employment_breakdown`评估就业地域分布与雇佣形式。研究者亦可通过`salary_stats`进行薪酬基准研究,或利用`job_snapshot`的时间序列追踪招聘活动的演变。数据以Parquet和DuckDB格式存储,便于高效处理中等规模数据集(约558条职位),是经济计量与计算社会科学领域的便捷工具。
实际应用
在实际应用中,该数据集为多类利益相关者提供决策支持:求职者可利用最新的职位开放状态(`is_open`)和技能要求(`tags`)优化个人职业规划;教育培训机构能够依据技能需求分布(`tech_demand`)调整课程设计,以贴合市场动态;政策制定者通过对`location_heatmap`和`employment_breakdown`的分析,识别就业增长热点与就业形式变化,从而制定区域性人才政策。企业人力资源部门亦可借用`companies`数据开展竞争情报分析,监测同行招聘趋势与岗位薪酬竞争力。数据集的每周更新机制确保了上述应用的时效性,而DuckDB的本地查询能力则支持实时交互式分析,增强了其在职业咨询、市场调研等实际场景中的实用性。
衍生相关工作
该数据集已吸引多个衍生研究项目:部分学者基于`job_snapshot`的时间序列数据,构建了孟加拉国IT岗位需求波动性模型,以探讨技术技能的生命周期;也有团队将`fact_job`中的`tags`与全球技能分类标准进行映射,尝试产生可比较的国际技能图谱。此外,`salary_stats`的显式薪资数据被用于经济学论文中,分析薪资决定因素及区域薪酬差异。在工具层面,存在基于该数据集开发的实时仪表盘和预测性招聘分析原型,以及利用DuckDB进行的端到端数据工程教育案例。这些衍生工作不仅深化了对新兴市场技术就业的理解,也验证了公开数据集在促进开放科学和跨领域合作方面的价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务