lilacai/mosaicml-local-mosaic-chat-v2
收藏资源简介:
This dataset is generated by [Lilac](http://lilacml.com) for a HuggingFace Space: [huggingface.co/spaces/lilacai/mosaicml](https://huggingface.co/spaces/lilacai/mosaicml). Original dataset: [https://huggingface.co/datasets/sam-mosaic/chat-v2](https://huggingface.co/datasets/sam-mosaic/chat-v2) Lilac dataset config: ```embeddings: - {embedding: gte-small, path: original-context} - embedding: gte-small path: [new-context, value, '*'] - {embedding: gte-small, path: response} - {embedding: gte-small, path: prompt} name: mosaic-chat-v2 namespace: local settings: preferred_embedding: gte-small ui: media_paths: [prompt, response] signals: - path: prompt signal: {signal_name: pii} - path: prompt signal: {signal_name: text_statistics} - path: prompt signal: {signal_name: near_dup} - path: prompt signal: {signal_name: lang_detection} - path: prompt signal: {concept_name: negative-sentiment, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: prompt signal: {concept_name: non-english, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: prompt signal: {concept_name: profanity, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: prompt signal: {concept_name: source-code, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: prompt signal: {concept_name: toxicity, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: response signal: {signal_name: pii} - path: response signal: {signal_name: text_statistics} - path: response signal: {signal_name: near_dup} - path: response signal: {signal_name: lang_detection} - path: response signal: {concept_name: negative-sentiment, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: response signal: {concept_name: non-english, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: response signal: {concept_name: profanity, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: response signal: {concept_name: source-code, embedding: gte-small, namespace: lilac, signal_name: concept_score} - path: response signal: {concept_name: toxicity, embedding: gte-small, namespace: lilac, signal_name: concept_score} source: {dataset_name: sam-mosaic/chat-v2, source_name: huggingface} ```
本数据集由[Lilac](http://lilacml.com)生成,用于拥抱脸(Hugging Face) Spaces 应用:[huggingface.co/spaces/lilacai/mosaicml](https://huggingface.co/spaces/lilacai/mosaicml)。 原始数据集:[https://huggingface.co/datasets/sam-mosaic/chat-v2](https://huggingface.co/datasets/sam-mosaic/chat-v2) Lilac 数据集配置: 嵌入配置: - {嵌入模型:gte-small,数据路径:original-context} - 嵌入模型:gte-small 数据路径:[new-context, value, '*'] - {嵌入模型:gte-small,数据路径:response} - {嵌入模型:gte-small,数据路径:prompt} 数据集名称:mosaic-chat-v2 命名空间:local 设置项: 首选嵌入模型:gte-small 用户界面: 媒体路径:[prompt, response] 特征信号配置: - 数据路径:prompt 特征信号:{信号名称:pii(个人可识别信息)} - 数据路径:prompt 特征信号:{信号名称:text_statistics(文本统计)} - 数据路径:prompt 特征信号:{信号名称:near_dup(近似重复检测)} - 数据路径:prompt 特征信号:{信号名称:lang_detection(语言检测)} - 数据路径:prompt 特征信号:{概念名称:negative-sentiment(负面情感),嵌入模型:gte-small,命名空间:lilac, 信号名称:concept_score(概念评分)} - 数据路径:prompt 特征信号:{概念名称:non-english(非英语文本),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:prompt 特征信号:{概念名称:profanity(低俗用语),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:prompt 特征信号:{概念名称:source-code(源代码),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:prompt 特征信号:{概念名称:toxicity(内容毒性),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:response 特征信号:{信号名称:pii(个人可识别信息)} - 数据路径:response 特征信号:{信号名称:text_statistics(文本统计)} - 数据路径:response 特征信号:{信号名称:near_dup(近似重复检测)} - 数据路径:response 特征信号:{信号名称:lang_detection(语言检测)} - 数据路径:response 特征信号:{概念名称:negative-sentiment(负面情感),嵌入模型:gte-small,命名空间:lilac, 信号名称:concept_score(概念评分)} - 数据路径:response 特征信号:{概念名称:non-english(非英语文本),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:response 特征信号:{概念名称:profanity(低俗用语),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:response 特征信号:{概念名称:source-code(源代码),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} - 数据路径:response 特征信号:{概念名称:toxicity(内容毒性),嵌入模型:gte-small,命名空间:lilac,信号名称:concept_score(概念评分)} 数据源配置:{数据集名称:sam-mosaic/chat-v2,数据源名称:Hugging Face}
数据集概述
数据集配置
- 嵌入配置:
embedding: gte-smallpath: original-contextpath: [new-context, value, *]path: responsepath: prompt
- 名称:
mosaic-chat-v2 - 命名空间:
local - 设置:
preferred_embedding: gte-smallui: media_paths: [prompt, response]
信号配置
- 路径:
promptsignal_name: piisignal_name: text_statisticssignal_name: near_dupsignal_name: lang_detectionconcept_name: negative-sentimentconcept_name: non-englishconcept_name: profanityconcept_name: source-codeconcept_name: toxicity
- 路径:
responsesignal_name: piisignal_name: text_statisticssignal_name: near_dupsignal_name: lang_detectionconcept_name: negative-sentimentconcept_name: non-englishconcept_name: profanityconcept_name: source-codeconcept_name: toxicity
数据源
- 数据集名称:
sam-mosaic/chat-v2 - 来源名称:
huggingface




