GigaVerbo Text-Filter是一个包含110,000个随机选择的样本的数据集,这些样本来自9个子集的GigaVerbo(即那些不是合成的子集)。这个数据集用于训练在论文《Tucano: Advancing Neural Text Generation for Portuguese》中描述的文本质量过滤器。为了创建文本嵌入,我们使用了sentence-transformers/LaBS
# Toxic Conversation This is a version of the [Jigsaw Unintended Bias in Toxicity Classification dataset](https://www.kaggle.com/c/jigsaw-unintended-bias-in-toxicity-classification/overview). It cont