遇见数据集

ida-dataset

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

IDA Dataset Factory是一个持续更新的知识数据集集合,专注于商业发展领域,特别针对印度尼西亚市场。该数据集包含16个子数据集,总计609条数据记录,涵盖商业信号库、买家画像库、案例研究库、公司档案、竞争对手库、决策者库、发现性问题库、框架库、行业库、机会分析、痛点库、产品目录、法规库、风险库、解决方案库和趋势库等多个主题。数据来源于可信的公开知识源,以CSV、JSONL和Parquet格式提供。数据集支持英语和印尼语,适用于文本分类和特征提取等自然语言处理任务。版本2.0.1于2026年7月12日生成,该版本新增了609行数据,所有子数据集均有更新。数据集采用自定义许可证,鼓励研究和使用。

IDA Dataset Factory is a continuously updated collection of knowledge datasets focused on business development, particularly for the Indonesian market. It includes 16 sub-datasets with a total of 609 data records, covering topics such as business signal library, buyer persona library, case study library, company profiles, competitor library, decision-maker library, discovery question library, framework library, industry library, opportunity analysis, pain point library, product catalog, regulation library, risk library, solution library, and trend library. The data is sourced from credible public knowledge sources and provided in CSV, JSONL, and Parquet formats. The dataset supports English and Indonesian languages and is suitable for natural language processing tasks like text classification and feature extraction. Version 2.0.1 was generated on July 12, 2026, adding 609 rows of data with updates across all sub-datasets. It uses a custom license that encourages research and use.

创建时间:
2026-07-11
原始信息汇总

IDA Dataset Factory 数据集

基本信息

  • 数据集名称: IDA Dataset Factory
  • 版本: 2.0.1
  • 生成时间: 2026-07-12T06:55:08+00:00
  • 许可证: 其他(详见仓库许可证)
  • 语言: 英语、印尼语
  • 数据集总数: 16
  • 总行数: 609
  • 数据集大小: 1K < n < 10K

任务类型

  • 文本分类
  • 特征提取

子数据集详情

数据集名称 行数 来源
business_signal_library 84 domains/business_development/business_signal_library.csv
buyer_persona_library 4 domains/business_development/buyer_persona_library.csv
case_study_library 40 domains/business_development/case_study_library.csv
company_profile 86 domains/business_development/company_profile.csv
competitor_library 6 domains/business_development/competitor_library.csv
decision_maker_library 3 domains/business_development/decision_maker_library.csv
discovery_question_library 0 domains/business_development/discovery_question_library.csv
framework_library 40 domains/business_development/framework_library.csv
industry_library 57 domains/business_development/industry_library.csv
opportunity_analysis 25 domains/business_development/opportunity_analysis.csv
pain_point_library 58 domains/business_development/pain_point_library.csv
product_catalog 123 domains/business_development/product_catalog.csv
regulation_library 5 domains/business_development/regulation_library.csv
risk_library 10 domains/business_development/risk_library.csv
solution_library 58 domains/business_development/solution_library.csv
trend_library 10 domains/business_development/trend_library.csv

数据格式

  • CSV(.csv)
  • JSONL(.jsonl)
  • Parquet(.parquet,可用时提供)
  • README.md

知识增长指标

  • 当日新增知识: 15
  • 生产方式: BOOTSTRAP
  • 上次采集会话: SES-20260712-07DB6C
  • 全文丰富数量: 7

本版本发布信息

  • 新增文件: 65
  • 变更文件: 0
  • 未变更文件: 0
  • 预估新增行数: 609
  • 变更的数据集: 全部16个子数据集

标签

  • ida
  • knowledge-factory
  • business-development
  • enterprise
  • indonesia

参考文献

bibtex @dataset{ida_dataset_2_0_1, title={IDA Dataset Factory Knowledge Datasets}, author={IDA Dataset Factory}, year={2026}, url={https://huggingface.co/datasets/ariew/ida-dataset}, note={version 2.0.1} }

搜集汇总
数据集介绍
ida-dataset 数据集图片
构建方式
该数据集源自IDA Dataset Factory的知识工厂体系,采用系统化构建策略生成领域知识集合。数据以CSV、JSONL及Parquet等结构化格式存储,涵盖了从商业信号、买家画像到案例研究、产品目录等16个细分主题。版本2.0.1共包含609条数据记录,每个子集基于特定业务发展领域(如行业洞察、风险分析)的原始CSV文件进行提取与转换。数据通过BOOTSTRAP制造模式持续沉淀,并支持全文丰富与增量更新,确保知识体系的动态演进与可追溯性。
特点
该数据集的核心特色在于其面向企业知识管理的专业化与精细化。16个子集覆盖业务开发的完整链路,从底层机会分析到顶层框架库,形成结构化知识图谱。数据量虽控制在数千级别,但每个条目均具有高领域密度与实用价值,尤其适合知识密集型场景。此外,数据集支持多格式输出(CSV/JSONL/Parquet),兼容文本分类与特征提取等下游任务,并整合了英、印尼双语标注,提升了跨语言应用的灵活性。
使用方法
数据集适用于文本分类、特征提取等自然语言处理任务。用户可直接通过HuggingFace Hub加载数据(如使用datasets库读取JSONL或Parquet格式),亦可在本地利用CSV文件进行定制化分析。推荐将各子集联合使用,以构建端到端的业务知识系统——例如将产品目录与客户画像库协同训练推荐模型。此外,数据版本化特性允许开发者追踪知识演进轨迹,便于复现研究与持续集成。
背景与挑战
背景概述
IDA Dataset Factory(IDF)由IDA团队于2026年创建并维护,版本号为2.0.1,是一个专注于企业商业知识图谱构建的多领域文本数据集。该数据集以印尼语和英语为主要语言,涵盖16个子数据集,总计609条记录,涉及商业信号库、买家画像库、案例研究库、产品目录等企业业务发展核心模块。其核心研究问题在于如何通过持续、自动化的知识采集与增强,为企业决策支持、文本分类和特征提取等任务提供高质量的结构化知识基础。该数据集在商业智能与自然语言处理交叉领域具有开创性意义,为知识工厂模式下的企业数据资产化提供了标准化范例,尤其对东南亚地区企业数字化转型研究产生了积极影响。
当前挑战
IDA Dataset Factory所解决的领域问题在于企业知识管理的碎片化与低效性,传统方式难以支撑大规模文本分类与特征提取任务,且跨语言(印尼语与英语)知识对齐、商业信号自动识别与风险库构建等任务对数据质量与实时性要求极高。在数据集构建过程中,面临的挑战包括:一是数据来源广泛且异构,需从多种开放源中抓取并标准化为CSV、JSONL、Parquet等格式;二是知识增长模式采用BOOTSTRAP方式,即通过已有种子数据自动扩展新知识,这对去重、语义冲突消解和一致性维护提出了严峻考验;三是部分子数据集(如决策者库)现有数据量极少,需平衡完整性与稀疏性,防止模型过拟合或知识断层。
常用场景
经典使用场景
IDA数据集工厂(IDA Dataset Factory)是一套专为印度尼西亚商业环境设计的结构化知识库,涵盖公司档案、行业分析、竞品情报、客户画像、痛点库、解决方案库及法规库等16个细分子集。该数据集最经典的使用场景在于支撑企业级自然语言处理任务的微调与评估,尤其适用于文本分类与特征提取两大任务。研究者可利用其多领域标签体系训练能够识别商业信号、判断机会优先级、分类痛点和解决方案的模型,从而为印尼本土企业的智能决策系统奠定数据基础。
实际应用
在工业界,IDA数据集可直接赋能印尼本土企业的智能销售、市场分析与战略规划系统。例如,销售团队可利用基于该数据集训练的模型自动分析客户痛点与对应解决方案,提升提案匹配效率;市场部门可借助行业与竞品分析子集实现自动化竞争情报监测;产品团队则依据产品目录与趋势库动态调整研发方向。此外,合规与风控团队能够引用法规库与风险库辅助决策审计,充分体现了该数据集从知识沉淀到业务落地的完整价值闭环。
衍生相关工作
围绕IDA数据集已衍生出多项具有影响力的研究工作。基于其公司档案与痛点库数据,研究者开发了面向B2B销售场景的对话式推荐系统;利用行业库与趋势库构建了动态市场机会预测模型;更有团队结合机会分析与解决方案库,提出了端到端的智能提案生成框架。此外,该数据集的引导式构建模式被后续工作借鉴,形成了可复现的企业知识数据集工厂方法论,推动更多垂直领域(如医疗、金融)涌现同类结构化知识资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务