多语言框架知识问答与经验分享语料集
收藏数据链接:
官方服务:
资源简介:
本数据集为《编程语言自动识别》主题语料集,数量10万条,涵盖Python、JavaScript、TypeScript、Java、Rust、Go、C++、C语言、Kotlin、Swift、C#、Ruby、PHP、Scala、Haskell、Elixir、Clojure、Dart、Lua、R语言、Julia等21种主流编程语言,内容涉及变量声明、数据类型、控制流、循环语法、函数定义、面向对象、模块导入、异常处理、字符串处理、数组集合、字典映射、泛型类型、并发编程、内存管理等15大语法类别。语料风格模拟技术社区用户发帖讨论的口吻,涵盖经验分享、问题求助、观点表达、客观说明等多种文本意图。每条语料均附有35+ 维度细粒度自动标注,包含文本属性、用户画像、场景关系、可信度、情感强度分级等高价值标注维度,可作为文本生成、文本分类、摘要提取、情感分析、内容推荐等任务的训练与评测资源。
提供机构:
深圳市龙华区百图科技工作室创建时间:
2026-06-02
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集是一个专注于编程语言自动识别主题的虚拟生成语料集,包含10万条模拟技术社区讨论风格的中文文本,覆盖21种主流编程语言及其15大语法类别。每条语料均附带超过35个维度的细粒度自动标注,适用于文本生成、分类、情感分析等多种自然语言处理任务的训练与评估。
以上内容由遇见数据集搜集并总结生成



