遇见数据集

多语言框架知识问答与经验分享语料集

收藏
国家数据集管理服务平台2026-06-26 更新2026-06-30 收录
官方服务:

资源简介:

本数据集为《编程语言自动识别》主题语料集,数量10万条,涵盖Python、JavaScript、TypeScript、Java、Rust、Go、C++、C语言、Kotlin、Swift、C#、Ruby、PHP、Scala、Haskell、Elixir、Clojure、Dart、Lua、R语言、Julia等21种主流编程语言,内容涉及变量声明、数据类型、控制流、循环语法、函数定义、面向对象、模块导入、异常处理、字符串处理、数组集合、字典映射、泛型类型、并发编程、内存管理等15大语法类别。语料风格模拟技术社区用户发帖讨论的口吻,涵盖经验分享、问题求助、观点表达、客观说明等多种文本意图。每条语料均附有35+ 维度细粒度自动标注,包含文本属性、用户画像、场景关系、可信度、情感强度分级等高价值标注维度,可作为文本生成、文本分类、摘要提取、情感分析、内容推荐等任务的训练与评测资源。

创建时间:
2026-06-02
搜集汇总
数据集介绍
多语言框架知识问答与经验分享语料集 数据集图片
背景与挑战
背景概述
该数据集是一个专注于编程语言自动识别主题的虚拟生成语料集,包含10万条模拟技术社区讨论风格的中文文本,覆盖21种主流编程语言及其15大语法类别。每条语料均附带超过35个维度的细粒度自动标注,适用于文本生成、分类、情感分析等多种自然语言处理任务的训练与评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务