lilacai/lilac-textbook_quality_programming
收藏资源简介:
This dataset is generated by [Lilac](http://lilacml.com) for a HuggingFace Space: [huggingface.co/spaces/lilacai/lilac](https://huggingface.co/spaces/lilacai/lilac). Original dataset: [https://huggingface.co/datasets/vikp/textbook_quality_programming](https://huggingface.co/datasets/vikp/textbook_quality_programming) Lilac dataset config: ```namespace: lilac name: textbook_quality_programming source: dataset_name: vikp/textbook_quality_programming source_name: huggingface embeddings: - path: - outline - '*' embedding: gte-small - path: - concepts - '*' embedding: gte-small - path: markdown embedding: gte-small signals: - path: - outline - '*' signal: signal_name: pii - path: - outline - '*' signal: signal_name: text_statistics - path: - outline - '*' signal: signal_name: near_dup - path: - outline - '*' signal: signal_name: lang_detection - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: legal-termination signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: negative-sentiment signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: non-english signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: positive-sentiment signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: profanity signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: question signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: source-code signal_name: concept_score - path: - outline - '*' signal: embedding: gte-small namespace: lilac concept_name: toxicity signal_name: concept_score - path: - concepts - '*' signal: signal_name: pii - path: - concepts - '*' signal: signal_name: text_statistics - path: - concepts - '*' signal: signal_name: near_dup - path: - concepts - '*' signal: signal_name: lang_detection - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: legal-termination signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: negative-sentiment signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: non-english signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: positive-sentiment signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: profanity signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: question signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: source-code signal_name: concept_score - path: - concepts - '*' signal: embedding: gte-small namespace: lilac concept_name: toxicity signal_name: concept_score - path: markdown signal: signal_name: pii - path: markdown signal: signal_name: text_statistics - path: markdown signal: signal_name: near_dup - path: markdown signal: signal_name: lang_detection - path: markdown signal: embedding: gte-small namespace: lilac concept_name: legal-termination signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: negative-sentiment signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: non-english signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: positive-sentiment signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: profanity signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: question signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: source-code signal_name: concept_score - path: markdown signal: embedding: gte-small namespace: lilac concept_name: toxicity signal_name: concept_score - path: - outline - '*' signal: signal_name: cluster_dbscan - path: - concepts - '*' signal: signal_name: cluster_dbscan - path: markdown signal: signal_name: cluster_dbscan - path: - outline - '*' signal: embedding: gte-small signal_name: cluster_hdbscan - path: - concepts - '*' signal: embedding: gte-small signal_name: cluster_hdbscan - path: markdown signal: embedding: gte-small signal_name: cluster_hdbscan settings: ui: media_paths: - - outline - '*' - - concepts - '*' - markdown markdown_paths: - markdown tags: - machine-learning ```
本数据集由Lilac生成,用于Hugging Face Spaces空间:[huggingface.co/spaces/lilacai/lilac](https://huggingface.co/spaces/lilacai/lilac)。 原始数据集来源:[https://huggingface.co/datasets/vikp/textbook_quality_programming](https://huggingface.co/datasets/vikp/textbook_quality_programming) Lilac数据集配置: 命名空间:lilac 数据集名称:textbook_quality_programming 数据源: 原始数据集名称:vikp/textbook_quality_programming 数据源类型:huggingface 嵌入向量配置: - 处理路径: - outline - '*' 嵌入模型:gte-small - 处理路径: - concepts - '*' 嵌入模型:gte-small - 处理路径:markdown 嵌入模型:gte-small 信号检测任务: - 处理路径: - outline - '*' 检测配置: 检测任务名称:pii(个人可识别信息) - 处理路径: - outline - '*' 检测配置: 检测任务名称:text_statistics(文本统计分析) - 处理路径: - outline - '*' 检测配置: 检测任务名称:near_dup(近似重复检测) - 处理路径: - outline - '*' 检测配置: 检测任务名称:lang_detection(语言自动检测) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:legal-termination 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:negative-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:non-english 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:positive-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:profanity 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:question 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:source-code 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:toxicity 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 检测任务名称:pii(个人可识别信息) - 处理路径: - concepts - '*' 检测配置: 检测任务名称:text_statistics(文本统计分析) - 处理路径: - concepts - '*' 检测配置: 检测任务名称:near_dup(近似重复检测) - 处理路径: - concepts - '*' 检测配置: 检测任务名称:lang_detection(语言自动检测) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:legal-termination 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:negative-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:non-english 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:positive-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:profanity 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:question 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:source-code 检测任务名称:concept_score(概念匹配评分) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:toxicity 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 检测任务名称:pii(个人可识别信息) - 处理路径:markdown 检测配置: 检测任务名称:text_statistics(文本统计分析) - 处理路径:markdown 检测配置: 检测任务名称:near_dup(近似重复检测) - 处理路径:markdown 检测配置: 检测任务名称:lang_detection(语言自动检测) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:legal-termination 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:negative-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:non-english 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:positive-sentiment 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:profanity 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:question 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:source-code 检测任务名称:concept_score(概念匹配评分) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 命名空间:lilac 关联概念名称:toxicity 检测任务名称:concept_score(概念匹配评分) - 处理路径: - outline - '*' 检测配置: 检测任务名称:cluster_dbscan(DBSCAN聚类检测) - 处理路径: - concepts - '*' 检测配置: 检测任务名称:cluster_dbscan(DBSCAN聚类检测) - 处理路径:markdown 检测配置: 检测任务名称:cluster_dbscan(DBSCAN聚类检测) - 处理路径: - outline - '*' 检测配置: 嵌入模型:gte-small 检测任务名称:cluster_hdbscan(HDBSCAN聚类检测) - 处理路径: - concepts - '*' 检测配置: 嵌入模型:gte-small 检测任务名称:cluster_hdbscan(HDBSCAN聚类检测) - 处理路径:markdown 检测配置: 嵌入模型:gte-small 检测任务名称:cluster_hdbscan(HDBSCAN聚类检测) 系统配置: 用户界面: 媒体展示路径: - - outline - '*' - - concepts - '*' - markdown Markdown渲染路径: - markdown 数据集标签: - machine-learning(机器学习)
数据集概述
基本信息
- 命名空间: lilac
- 名称: textbook_quality_programming
- 来源:
- 数据集名称: vikp/textbook_quality_programming
- 来源名称: huggingface
嵌入信息
- 路径:
outline/*concepts/*markdown
- 嵌入模型: gte-small
信号信息
- 路径:
outline/*concepts/*markdown
- 信号类型:
- pii
- text_statistics
- near_dup
- lang_detection
- concept_score (涉及多个概念,如legal-termination, negative-sentiment, non-english, positive-sentiment, profanity, question, source-code, toxicity)
- cluster_dbscan
- cluster_hdbscan
设置信息
- UI媒体路径:
outline/*concepts/*markdown
- Markdown路径:
markdown
- 标签:
- machine-learning




