Nebulixlabs's picture
Update README.md
c2d9abf verified
|
Raw History Blame Contribute Delete
1.01 kB
metadata
language:
  - en
  - hi
tags:
  - text-classification
  - safety
  - content-moderation
  - multilingual
  - safe-vs-unsafe
  - calibrated-classifier
license: apache-2.0
datasets:
  - Nebulixlabs/safety-dataset
base_model:
  - Nebulixlabs/Quantum-Classifier
pipeline_tag: text-classification

Quantum-Clasifier-Finetuned

Fine-tuned version of:

Nebulixlabs/Quantum-Classifier

Architecture

  • Parameters: 1,000,000
  • Vocabulary: 4096
  • Context length: 128
  • Hidden size: 112
  • Attention heads: 7
  • Transformer layers: 4
  • FFN: 336
  • Classifier hidden: 170

Fine-tuning

Datasets:

  • Nebulixlabs/safety-dataset
  • KimDongH/spam_dataset-train-eval-test2

Batch size:

128

Target tokens:

30,000,000

Actual tokens:

30,010,756

Epochs:

9

Labels

0 = safe

1 = unsafe

Confidence

Temperature calibrated on validation data:

1.479935

Evaluation

The held-out test split, where available, is evaluated only after fine-tuning.

Multilingual smoke tests cover:

  • English
  • Hindi
  • Hinglish