遇见数据集

Crawl-5K

收藏
魔搭社区2026-07-07 更新2025-02-22 收录
官方服务:

资源简介:

Crawl-5K 是首个专注于 爬虫领域 的高质量指令数据集,旨在提升大语言模型(LLM)在爬虫任务上的代码生成、指令理解及代码补全能力。

Crawl-5K is the first high-quality instruction dataset focused on the web scraping domain, which aims to enhance the code generation, instruction understanding and code completion capabilities of Large Language Models (LLMs) for web scraping tasks.

提供机构:
maas
创建时间:
2025-02-20
搜集汇总
数据集介绍
Crawl-5K 数据集图片
背景与挑战
背景概述
Crawl-5K是一个专注于web crawling领域的高质量指令数据集,旨在提升大语言模型在代码生成、指令理解和代码补全等任务中的性能。数据集采用JSON格式,适用于指令调优和代码补全模型训练,数据基于自动解析技术从官方文档和代码库中构建,无需手动标注,并遵循Apache License 2.0许可。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务