WithinUsAI/The_Web_From_WithIn_10k
收藏资源简介:
The_Web_From_WithIn_10k是一个前沿质量的数据集,旨在训练先进的基于网络的自主代理语言模型,专注于专业的网络搜索、信息检索、来源发现、搜索优化和网络证据收集。每个示例都展示了专业的搜索推理、查询生成、来源发现、质量评估、信息提取和综合,这些内容都包含在<thinking>标签内。该数据集包含10,000个独特示例,覆盖技术文档、AI研究、机器学习、软件工程、网络安全、医学、科学、金融、商业、创业公司、基础设施、云计算、教育、法律、经济学、制造业和物流等多个领域。数据集采用JSONL格式,每个JSON对象包含指令、输入和输出字段,其中输出字段详细记录了思维过程、搜索目标、搜索查询、候选来源、来源质量分析、发现的信息和最终总结。数据集经过严格的去重和验证过程,确保逻辑一致性、专业语气和来源评估质量,适用于监督微调,以提升网络搜索质量、来源评估和证据收集能力。
The_Web_From_WithIn_10k is a frontier-quality dataset designed to train advanced web-enabled autonomous agentic language models on professional web search, information retrieval, source discovery, search refinement, and evidence gathering from the web. Every example demonstrates professional search reasoning, query generation, source discovery, quality evaluation, information extraction, and synthesis inside <think> tags. The dataset contains 10,000 unique examples covering domains such as technical documentation, AI research, machine learning, software engineering, cybersecurity, medicine, science, finance, business, startups, infrastructure, cloud computing, education, law, economics, manufacturing, and logistics. It is formatted in JSONL, with each JSON object including instruction, input, and output fields, where the output field details thinking processes, search objectives, search queries, candidate sources, source quality analysis, information found, and final summary. The dataset undergoes aggressive deduplication and validation for logical consistency, professional tone, and source evaluation quality, and is recommended for supervised fine-tuning to improve web search quality, source evaluation, and evidence gathering capabilities.




