登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
网页数据获取助手
网页数据获取助手
收藏
浙江大数据交易服务平台
2025-04-10 更新
2025-04-02 收录
网页抓取
网络爬虫
数据链接:
https://ditm.zjdex.com/data-service/product-details?id=1906670923976220674
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
极具性价比的公开网页url数据获取小工具,对无、弱风控网页具有高稳定高可用。
应用场景:
提供机构:
小数汇智(杭州)科技有限公司
创建时间:
2025-04-10
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集是一个用于获取公开网页URL数据的数据工具,具有高稳定性和高可用性,适用于无或弱风控网页。数据集涉及互联网和数字营销场景,数据来源于公共数据,更新频率为实时。
以上内容由遇见数据集搜集并总结生成
相关数据集
Heading Tag Analyzer API
SEO优化
网页抓取
Extracts all heading tags (` ` to ` `) from HTML. SEO / Web Scraping
RapidAPI
2025-11-13 更新
16
0
Amazon Scraper API
网络爬虫
电子商务
An Amazon Scraper API is a tool that allows you to extract data from the Amazon website using a programmatic interface. This can include information such as product details, pricing, and reviews. The
RapidAPI
2023-01-23 更新
13
0
nhagar/CC-MAIN-2020-45_urls
网络爬虫
URL数据
这是一个包含网页抓取信息的数据集,具体特征包括网页内容(crawl)、网址主机名(url_host_name)和网址计数(url_count)。数据集分为训练集,大小为3129500682字节,共有63241847个示例。
Hugging Face
2025-05-15 更新
7
0
KathirKs/CC-MAIN-2017-22_row_wise_20241007_162941
网络爬虫
数据挖掘
该数据集包含文本内容、唯一标识符和元数据三个主要特征。文本内容为字符串序列,唯一标识符为字符串类型,元数据包含dump、file_path、id和url四个子字段,均为字符串类型。数据集分为一个训练集,包含1,688,855个样本,总大小为20,446,020,473字节。下载大小为7,685,259,506字节。数据集的配置文件名为default,数据文件路径为data/train-*。
Hugging Face
2024-10-07 更新
15
0
nhagar/CC-MAIN-2017-43_urls
网络爬虫
互联网内容分析
该数据集包含网页抓取信息,具体字段包括网页内容(crawl)、网址的主机名(url_host_name)以及主机名出现的次数(url_count)。训练集包含大约80225400个示例,数据集总大小为4224884178字节。
Hugging Face
2025-05-15 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广