--- language: - pt library_name: transformers pipeline_tag: feature-extraction tags: - BERT - encoder - embeddings - TiME - pt - size:s license: apache-2.0 teacher_model: FacebookAI/xlm-roberta-large datasets: - uonlp/CulturaX --- # TiME Portuguese (pt, s) Monolingual BERT-style encoder that outputs embeddings for Portuguese. Distilled from FacebookAI/xlm-roberta-large. ## Specs - language: Portuguese (pt) - size: s - architecture: BERT encoder - layers: 6 - hidden size: 384 - intermediate size: 1536 ## Usage (mean pooled embeddings) ```python from transformers import AutoTokenizer, AutoModel import torch repo = "dschulmeist/TiME-pt-s" tok = AutoTokenizer.from_pretrained(repo) mdl = AutoModel.from_pretrained(repo) def mean_pool(last_hidden_state, attention_mask): mask = attention_mask.unsqueeze(-1).type_as(last_hidden_state) return (last_hidden_state * mask).sum(1) / mask.sum(1).clamp(min=1e-9) inputs = tok(["example sentence"], padding=True, truncation=True, return_tensors="pt") outputs = mdl(**inputs) emb = mean_pool(outputs.last_hidden_state, inputs['attention_mask']) print(emb.shape) ```