遇见数据集

scrapegraphai/scrapegraph-100k-finetuning

收藏
Hugging Face2026-06-05 更新2026-02-07 收录
官方服务:

资源简介:

该数据集是[ScrapeGraphAI-100k](https://huggingface.co/datasets/scrapegraphai/scrapegraphai-100k)数据集的微调就绪版本,包含25,244个训练样本和2,808个测试样本。这些样本是经过筛选的结构化提取示例,其中大型语言模型(LLM)根据用户定义的JSON模式从网页内容中提取数据。数据集经过预处理,包括过滤超出字符限制的示例、将长内容分块以及按90/10的比例分割训练和测试集。

This dataset is a finetuning-ready version of the [ScrapeGraphAI-100k](https://huggingface.co/datasets/scrapegraphai/scrapegraphai-100k) dataset. It contains 25,244 training and 2,808 test curated structured extraction examples where an LLM extracts JSON data from web content according to a user-defined schema. The dataset was preprocessed from the raw 100k collection by filtering examples exceeding character limits, chunking long content into ~4096-token windows with 128-token overlap, and splitting into train/test (90/10) with a fixed seed for reproducibility.

提供机构:
scrapegraphai
搜集汇总
数据集介绍
scrapegraphai/scrapegraph-100k-finetuning 数据集图片
构建方式
在网页结构化数据提取领域,高质量微调数据集是提升大语言模型性能的关键。scrapegraph-100k-finetuning数据集源自原始的ScrapeGraphAI-100k集合,经过精细的预处理流程构建而成。首先,利用更新后的ScrapeGraphAI抓取API对源内容进行重新提取,保留了更丰富的原始信息。随后,对样本进行严格过滤,剔除内容超过50,000字符、schema和响应超过10,000字符的超长示例。对于剩余的长文档,采用分块策略将其切割为约4096个令牌的窗口,并设置128个令牌的重叠区域,以确保上下文连贯性。最终,按照固定随机种子以90:10的比例划分为训练集与测试集,形成了包含107,452条训练样本和11,940条测试样本的高质量微调数据集。
使用方法
使用该数据集进行模型微调时,操作流程简洁高效。用户可借助HuggingFace Datasets库直接加载,调用`load_dataset('scrapegraphai/scrapegraph-100k-finetuning')`即可获取训练集与测试集。每个样本可直接构造为提示模板,典型格式为:将schema与content字段拼接至指令中,要求模型依据schema从content里提取JSON数据。例如,构建`Extract data from the content according to the JSON schema. Schema: {schema} Content: {content} Return ONLY valid JSON matching the schema.`形式的提示。该数据集特别适合用于训练面向网页结构化提取任务的对话模型,通过有监督微调提升模型对schema的遵循能力与输出格式的合规性。
背景与挑战
背景概述
随着大语言模型(LLM)在结构化数据提取任务中的广泛应用,如何高效、精准地从海量非结构化网页内容中提取符合用户定义JSON Schema的信息,成为推动智能体(Agent)与自动化爬取技术发展的核心课题。ScrapeGraphAI团队于2025年发布的scrapegraph-100k-finetuning数据集,正是在此背景下应运而生。该数据集由ScrapeGraphAI研究机构主导构建,基于其先前收集的原始100k数据集,利用更新的爬取API重新提取并精心预处理,旨在为LLM的微调提供高质量的指令数据。数据集包含超过10万条训练样本与近1.2万条测试样本,每一条均记录用户定义的JSON Schema、源网页内容以及LLM按Schema提取的精确JSON输出。该数据集的发布,为结构化输出领域的模型微调、评估与对比研究提供了重要的基准资源,尤其对于提升LLM在复杂网页环境下遵循指令生成结构化数据的能力具有显著推动力,相关研究工作(如SLOT)已引用该数据集以验证其方法的有效性。
当前挑战
该数据集所解决的核心领域挑战在于:大语言模型在从多样化的真实网页内容中提取信息时,常因内容冗长、格式混乱而难以严格遵循用户指定的JSON Schema,导致输出存在字段缺失、结构错乱或语义偏差。为此,数据集构建过程中面临多重技术挑战:首先,原始100k数据集中部分网页内容极为冗长,直接用于微调时常超出模型上下文窗口,团队采用限制字符阈值(内容上限50,000字符)并基于约4096个Token的滑动窗口(重叠128 Token)进行智能分块,以平衡信息完整性与模型处理极限;其次,需剔除超出Schema与响应长度限制的样本,并确保分块后的每条数据仍包含完整的提取任务上下文;最后,为保证训练与测试分区的公平性与可复现性,采用固定随机种子进行90/10分割,避免数据泄露与评估偏差。
常用场景
经典使用场景
该数据集专为微调大型语言模型以执行结构化网页数据提取任务而设计,核心应用场景聚焦于智能爬虫与信息抽取。通过提供海量的网页内容、用户定义的JSON模式以及对应的模型提取结果三元组,它能够训练模型依据任意给定的模式,从嘈杂的网页文本中精准提取结构化信息,从而将非结构化的网络数据转化为机器可读的标准化格式。
解决学术问题
该数据集有效解决了大语言模型在结构化输出任务上泛化能力不足的问题,尤其是在遵循复杂且多样化的JSON模式进行数据提取方面。它为研究指令微调、少样本学习以及模式理解提供了大规模、高质量的基准,推动了学界对模型在约束生成、模式遵循能力上的深入探索,对于提升AI代理在真实网络环境中自主执行任务的能力具有重要学术价值。
实际应用
在实际应用中,该数据集微调的模型可广泛赋能各类自动化工具,如竞争情报分析、市场调研、新闻聚合、商品价格监控和学术资料整理。企业可通过部署此类模型,构建从网站自动抽取关键字段(如产品规格、联系人信息)的智能管道,大幅减少人工数据录入成本,并实现跨平台数据的实时汇聚与分析,提升决策效率。
数据集最近研究
最新研究方向
在结构化信息抽取与智能体领域,scrapegraphai-100k-finetuning数据集为提升大语言模型(LLM)的Web内容结构化输出能力提供了关键资源。该数据集通过对原始100k样本进行字符过滤、分块处理及训练/测试集划分,构建了逾10万条微调示例,每个样本均包含用户自定义的JSON schema、源网页内容及LLM抽取的JSON响应。其核心研究方向聚焦于利用小样本微调策略增强模型从非结构化网页中精确提取结构化数据的能力,尤其配合ScrapeGraphAI框架优化智能体对网络信息的解析效率。当前热点事件包括SLOT(Structuring the Output of Large Language Models)论文提出的结构化输出方法,表明该数据集正被用于验证模型在复杂schema约束下的输出一致性与鲁棒性。这一工作在智能体驱动的高精度信息检索、自动化数据挖掘及知识图谱构建等前沿应用中具有里程碑意义,推动了LLM从指令遵循向结构化推理的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务